- 1
- 2
- 3
- 4
- 5
面向存算一体芯片的模拟计算阵列中存算一体芯片的存算一体芯片在AI大模型推理中的存算一体架构.docx
资料介绍
面向存算一体芯片的模拟计算阵列中存算一体芯片的存算一体芯片在AI大模型推理中的存算一体架构
摘要
大语言模型(LLM)的推理计算以矩阵乘法为主导,计算量大、内存带宽需求高,传统GPU方案在推理时面临"内存墙"瓶颈。本文针对LLM推理的存算一体加速需求,设计了一种面向Transformer架构的存算一体推理加速器,将LLM的权重矩阵存储在RRAM阵列中,在存算阵列中直接完成Query、Key和Value的矩阵乘法,将LLM推理的延迟降低至传统GPU方案的1/5,功耗降低至1/10。在7B参数LLM的推理测试中,存算一体加速器的首token延迟为150ms,芯片功耗为15W,为LLM的端侧部署提供了高能效的硬件方案。
一、LLM推理的存算一体需求
1.1 计算特征
LLM的推理计算以Transformer的矩阵乘法为主,包括QKV投影、Attention计算和FFN扩展。矩阵乘法的计算量占总计算量的90%以上。
1.2 内存带宽瓶颈
在7B参数LLM的推理中,权重矩阵的规模约为14GB(FP16),每次推理需要读取全部权重,内存带宽需求超过500GB/s。传统GPU方案的内存带宽利用率仅为30-50%。
二、存算一体LLM加速器设计
2.1 权重存内存储
7B LLM的INT4量化权重(约3.5GB)直接存储在RRAM阵列中,RRAM的非易失性使得权重在断电后不丢失,无需在每次推理时从片外加载。
部分文件列表
| 文件名 | 大小 |
| 面向存算一体芯片的模拟计算阵列中存算一体芯片的存算一体芯片在AI大模型推理中的存算一体架构.docx | 37K |
最新上传
-
tangyu1 打赏1.00元 1天前
-
jjjjkkkkk 打赏1.00元 2天前
-
emlimei 打赏1.00元 3天前
-
21ic小能手 打赏5.00元 3天前
-
21ic小能手 打赏3.00元 3天前
资料:低频功率放大器的设计.
-
21ic小能手 打赏3.00元 3天前
-
21ic小能手 打赏3.00元 3天前
-
21ic小能手 打赏3.00元 3天前
-
21ic小能手 打赏3.00元 3天前
-
21ic小能手 打赏5.00元 3天前
资料:51单片机数字频率计
-
21ic小能手 打赏5.00元 3天前
-
21ic小能手 打赏5.00元 3天前
-
21ic小能手 打赏5.00元 3天前
-
13573902396 打赏1.00元 3天前
-
21下载积分 打赏310.00元 3天前
用户:江岚
-
21下载积分 打赏310.00元 3天前
用户:潇潇江南
-
21下载积分 打赏60.00元 3天前
用户:他山之石可攻玉
-
21下载积分 打赏310.00元 3天前
用户:小猫做电路
-
21下载积分 打赏210.00元 3天前
用户:zhengdai
-
21下载积分 打赏210.00元 3天前
用户:w993263495
-
21下载积分 打赏10.00元 3天前
用户:烟雨
-
21下载积分 打赏60.00元 3天前
用户:gsy幸运
-
21下载积分 打赏70.00元 3天前
用户:铁蛋锅
-
21下载积分 打赏65.00元 3天前
用户:xzxbybd
-
21下载积分 打赏60.00元 3天前
用户:jh0355
-
21下载积分 打赏60.00元 3天前
用户:w178191520
-
21下载积分 打赏20.00元 3天前
用户:jh03551
-
21下载积分 打赏20.00元 3天前
用户:sun2152
-
21下载积分 打赏20.00元 3天前
用户:kk1957135547
-
21下载积分 打赏25.00元 3天前
用户:w1966891335
-
21下载积分 打赏20.00元 3天前
用户:xuzhen1
-
21下载积分 打赏15.00元 3天前
用户:x15580286248
-
21下载积分 打赏25.00元 3天前
用户:pcb
-
21下载积分 打赏20.00元 3天前
用户:bhacker
-
21下载积分 打赏15.00元 3天前
用户:liqiang9090
-
21下载积分 打赏25.00元 3天前
用户:有理想666
-
21下载积分 打赏15.00元 3天前
用户:godbox
-
21下载积分 打赏15.00元 3天前
用户:aetek
-
21下载积分 打赏5.00元 3天前
用户:mulanhk
-
21下载积分 打赏5.00元 3天前
用户:JuneLin61




全部评论(0)