推荐星级:
  • 1
  • 2
  • 3
  • 4
  • 5

面向存算一体芯片的模拟计算阵列中存算一体芯片的存算一体芯片在AI大模型推理中的存算一体架构.docx

更新时间:2026-09-19 19:04:33 大小:37K 上传用户:江岚查看TA发布的资源 标签:存算一体RRAMAI大模型推理Transformer加速器内存墙 下载积分:2分 评价赚积分 (如何评价?) 打赏 收藏 评论(0) 举报

资料介绍

面向存算一体芯片的模拟计算阵列中存算一体芯片的存算一体芯片在AI大模型推理中的存算一体架构

摘要

大语言模型(LLM)的推理计算以矩阵乘法为主导,计算量大、内存带宽需求高,传统GPU方案在推理时面临"内存墙"瓶颈。本文针对LLM推理的存算一体加速需求,设计了一种面向Transformer架构的存算一体推理加速器,将LLM的权重矩阵存储在RRAM阵列中,在存算阵列中直接完成QueryKeyValue的矩阵乘法,将LLM推理的延迟降低至传统GPU方案的1/5,功耗降低至1/10。在7B参数LLM的推理测试中,存算一体加速器的首token延迟为150ms,芯片功耗为15W,为LLM的端侧部署提供了高能效的硬件方案。

一、LLM推理的存算一体需求

1.1 计算特征

LLM的推理计算以Transformer的矩阵乘法为主,包括QKV投影、Attention计算和FFN扩展。矩阵乘法的计算量占总计算量的90%以上。

1.2 内存带宽瓶颈

7B参数LLM的推理中,权重矩阵的规模约为14GBFP16),每次推理需要读取全部权重,内存带宽需求超过500GB/s。传统GPU方案的内存带宽利用率仅为30-50%

二、存算一体LLM加速器设计

2.1 权重存内存储

7B LLMINT4量化权重(约3.5GB)直接存储在RRAM阵列中,RRAM的非易失性使得权重在断电后不丢失,无需在每次推理时从片外加载。


部分文件列表

文件名 大小
面向存算一体芯片的模拟计算阵列中存算一体芯片的存算一体芯片在AI大模型推理中的存算一体架构.docx 37K

全部评论(0)

暂无评论

上传资源 上传优质资源有赏金

  • 打赏
  • 30日榜单
  • 21下载积分 打赏60.00元   3天前

    用户:gsy幸运

  • 21下载积分 打赏70.00元   3天前

    用户:铁蛋锅

  • 21下载积分 打赏65.00元   3天前

    用户:xzxbybd

  • 21下载积分 打赏60.00元   3天前

    用户:jh0355

  • 21下载积分 打赏60.00元   3天前

    用户:w178191520

  • 21下载积分 打赏20.00元   3天前

    用户:jh03551

  • 21下载积分 打赏20.00元   3天前

    用户:sun2152

  • 21下载积分 打赏20.00元   3天前

    用户:kk1957135547

  • 21下载积分 打赏25.00元   3天前

    用户:w1966891335

  • 21下载积分 打赏20.00元   3天前

    用户:xuzhen1

  • 21下载积分 打赏15.00元   3天前

    用户:x15580286248

  • 21下载积分 打赏25.00元   3天前

    用户:pcb

  • 21下载积分 打赏20.00元   3天前

    用户:bhacker

  • 21下载积分 打赏15.00元   3天前

    用户:liqiang9090

  • 21下载积分 打赏25.00元   3天前

    用户:有理想666

  • 21下载积分 打赏15.00元   3天前

    用户:godbox

  • 21下载积分 打赏15.00元   3天前

    用户:aetek

  • 21下载积分 打赏5.00元   3天前

    用户:mulanhk

  • 21下载积分 打赏5.00元   3天前

    用户:JuneLin61

推荐下载