- 1
- 2
- 3
- 4
- 5
面向存算一体芯片的模拟计算阵列中存算一体芯片的大语言模型推理加速与KV Cache优化.docx
资料介绍
面向存算一体芯片的模拟计算阵列中存算一体芯片的大语言模型推理加速与KV Cache优化
摘要
大语言模型(LLM)推理过程中,KV Cache机制虽能避免重复计算,但其存储占用随序列长度和批处理规模线性增长,成为制约推理吞吐量的核心瓶颈。在存算一体芯片中,KV Cache的频繁读写操作不仅消耗大量存储带宽,还因数据搬运产生了显著的能耗开销。本文针对存算一体芯片上LLM推理的KV Cache问题,提出了一种面向存算一体架构的KV Cache优化方案,包括基于MRAM的片上KV Cache存储、稀疏化注意力机制和流水线预填充策略,将KV Cache访问能耗降低60%,推理吞吐量提升2.3倍。
一、LLM推理中的KV Cache问题
1.1 KV Cache的工作原理
在自回归式LLM推理中,Transformer的解码阶段需要反复计算注意力机制。每生成一个新token,都需要计算当前token与所有之前token的注意力分数。为了避免重复计算之前token的Key和Value向量,推理系统将已计算的Key和Value缓存起来,形成KV Cache。当序列长度为L,层数为N,头维度为H时,KV Cache的总存储需求为
字节(假设FP16精度)。对于Llama-70B模型,单次推理的KV Cache容量可达数GB,且随序列长度线性增长。
部分文件列表
| 文件名 | 大小 |
| 面向存算一体芯片的模拟计算阵列中存算一体芯片的大语言模型推理加速与KV_Cache优化.docx | 39K |
最新上传
-
tangyu1 打赏1.00元 1天前
-
jjjjkkkkk 打赏1.00元 2天前
-
emlimei 打赏1.00元 3天前
-
21ic小能手 打赏5.00元 3天前
-
21ic小能手 打赏3.00元 3天前
资料:低频功率放大器的设计.
-
21ic小能手 打赏3.00元 3天前
-
21ic小能手 打赏3.00元 3天前
-
21ic小能手 打赏3.00元 3天前
-
21ic小能手 打赏3.00元 3天前
-
21ic小能手 打赏5.00元 3天前
资料:51单片机数字频率计
-
21ic小能手 打赏5.00元 3天前
-
21ic小能手 打赏5.00元 3天前
-
21ic小能手 打赏5.00元 3天前
-
13573902396 打赏1.00元 3天前
-
21下载积分 打赏310.00元 3天前
用户:江岚
-
21下载积分 打赏310.00元 3天前
用户:潇潇江南
-
21下载积分 打赏60.00元 3天前
用户:他山之石可攻玉
-
21下载积分 打赏310.00元 3天前
用户:小猫做电路
-
21下载积分 打赏210.00元 3天前
用户:zhengdai
-
21下载积分 打赏210.00元 3天前
用户:w993263495
-
21下载积分 打赏10.00元 3天前
用户:烟雨
-
21下载积分 打赏60.00元 3天前
用户:gsy幸运
-
21下载积分 打赏70.00元 3天前
用户:铁蛋锅
-
21下载积分 打赏65.00元 3天前
用户:xzxbybd
-
21下载积分 打赏60.00元 3天前
用户:jh0355
-
21下载积分 打赏60.00元 3天前
用户:w178191520
-
21下载积分 打赏20.00元 3天前
用户:jh03551
-
21下载积分 打赏20.00元 3天前
用户:sun2152
-
21下载积分 打赏20.00元 3天前
用户:kk1957135547
-
21下载积分 打赏25.00元 3天前
用户:w1966891335
-
21下载积分 打赏20.00元 3天前
用户:xuzhen1
-
21下载积分 打赏15.00元 3天前
用户:x15580286248
-
21下载积分 打赏25.00元 3天前
用户:pcb
-
21下载积分 打赏20.00元 3天前
用户:bhacker
-
21下载积分 打赏15.00元 3天前
用户:liqiang9090
-
21下载积分 打赏25.00元 3天前
用户:有理想666
-
21下载积分 打赏15.00元 3天前
用户:godbox
-
21下载积分 打赏15.00元 3天前
用户:aetek
-
21下载积分 打赏5.00元 3天前
用户:mulanhk
-
21下载积分 打赏5.00元 3天前
用户:JuneLin61




全部评论(0)