推荐星级:
  • 1
  • 2
  • 3
  • 4
  • 5

面向AI推理的异构存储层级管理统一内存调度与数据迁移策略.docx

资料介绍

面向AI推理的异构存储层级管理:统一内存调度与数据迁移策略

——HBMCXL内存再到SSD的多级存储协同优化

引言

AI推理工作负载的存储需求呈现高度异构性:大语言模型推理需要HBM的高带宽支持KV Cache的快速访问,同时需要大规模内存容量存储模型权重和中间结果,还需要SSDSCM存储冷数据和历史会话。在单一系统中,HBM、本地DRAMCXL扩展内存和NVMe SSD构成了一个多层次存储层级。如何在这些层级之间高效地调度数据和迁移数据,是AI推理系统性能优化的关键。本文系统分析面向AI推理的异构存储层级管理架构,探讨统一内存调度和数据迁移策略。

推理工作负载的存储访问模式

AI推理的存储访问模式具有以下特征:

1. KV Cache访问:在生成过程中,KV Cache的访问模式是顺序写入和随机读取的混合,访问频率随Token序列长度变化。

2. 权重访问:模型权重在推理过程中是只读的,但不同层和不同模块的访问频率不同。

3. 中间结果:激活值和注意力分数等中间结果的生命周期短,访问频率高。

统一内存调度架构

统一内存地址空间

异构存储层级管理的基础是建立统一的虚拟地址空间,覆盖所有存储层级。统一内存地址空间通过以下机制实现:

1. 页面粒度的地址映射:以4KB2MB页面为单位,建立从虚拟地址到物理存储位置的映射表。

2. NUMA感知:在地址映射中记录每个页面所属的NUMA节点和存储层级,支持基于NUMA的访问优化。

3. 动态重映射:在运行时,根据数据访问模式动态调整页面的存储位置,实现数据迁移。


部分文件列表

文件名 大小
面向AI推理的异构存储层级管理统一内存调度与数据迁移策略.docx 40K

全部评论(0)

暂无评论

上传资源 上传优质资源有赏金

  • 打赏
  • 30日榜单

推荐下载