推荐星级:
  • 1
  • 2
  • 3
  • 4
  • 5

存算一体芯片在大语言模型推理中的应用.docx

更新时间:2026-08-20 08:12:56 大小:37K 上传用户:江岚查看TA发布的资源 标签:存算一体芯片大语言模型推理内存墙SRAM-CiM近存计算 下载积分:2分 评价赚积分 (如何评价?) 打赏 收藏 评论(0) 举报

资料介绍

存算一体芯片在大语言模型推理中的应用

1 引言

大语言模型(LLM)推理对存储带宽和容量的需求呈指数级增长,传统冯·诺依曼架构面临严重的内存墙瓶颈。存算一体芯片通过在存储阵列内直接执行计算,可从根本上消除数据搬运的能耗和延迟,在LLM推理中展现出显著优势。本章系统分析LLM推理的存储需求、存算一体加速方案和系统设计。

2 LLM推理的存储需求

2.1 模型权重

GPT-5的参数量超过10万亿,模型权重存储在HBMDDR5中,推理时需频繁加载到计算单元。

2.2 KV Cache

KV Cache在推理过程中存储中间结果,随序列长度线性增长。在128K token的长上下文推理中,KV Cache可占用数百GB的存储容量。

3 存算一体加速方案

3.1 SRAM-CiM

中科院计算所Ouroboros系统采用晶圆级SRAM-CiM架构,在54GB片上SRAM中完成全部LLM推理操作,消除片外数据迁移。在13B模型上实现15tokens/s的吞吐量,能效达传统方案的4.2倍。

3.2 近存计算

HBM-PIMAiMDRAM中集成计算单元,在批量嵌入向量归约等任务中实现2-3倍加速。

4 系统设计

4.1 流水线

存算一体LLM加速器采用细粒度令牌级流水线,缓解序列长度差异对利用率的影响。

4.2 KV缓存管理

分布式动态KV缓存管理方案解耦CIM存储与计算分配,利用碎片化SRAM内存实现高效KV存储。


部分文件列表

文件名 大小
存算一体芯片在大语言模型推理中的应用.docx 37K

全部评论(0)

暂无评论

上传资源 上传优质资源有赏金

  • 打赏
  • 30日榜单

推荐下载