推荐星级:
  • 1
  • 2
  • 3
  • 4
  • 5

面向存算一体芯片的模拟计算阵列中存算一体芯片的大语言模型推理加速与KV Cache优化.docx

资料介绍

面向存算一体芯片的模拟计算阵列中存算一体芯片的大语言模型推理加速与KV Cache优化

摘要

大语言模型(LLM)推理过程中,KV Cache机制虽能避免重复计算,但其存储占用随序列长度和批处理规模线性增长,成为制约推理吞吐量的核心瓶颈。在存算一体芯片中,KV Cache的频繁读写操作不仅消耗大量存储带宽,还因数据搬运产生了显著的能耗开销。本文针对存算一体芯片上LLM推理的KV Cache问题,提出了一种面向存算一体架构的KV Cache优化方案,包括基于MRAM的片上KV Cache存储、稀疏化注意力机制和流水线预填充策略,将KV Cache访问能耗降低60%,推理吞吐量提升2.3倍。

一、LLM推理中的KV Cache问题

1.1 KV Cache的工作原理

在自回归式LLM推理中,Transformer的解码阶段需要反复计算注意力机制。每生成一个新token,都需要计算当前token与所有之前token的注意力分数。为了避免重复计算之前tokenKeyValue向量,推理系统将已计算的KeyValue缓存起来,形成KV Cache。当序列长度为L,层数为N,头维度为H时,KV Cache的总存储需求为  字节(假设FP16精度)。对于Llama-70B模型,单次推理的KV Cache容量可达数GB,且随序列长度线性增长。


部分文件列表

文件名 大小
面向存算一体芯片的模拟计算阵列中存算一体芯片的大语言模型推理加速与KV_Cache优化.docx 39K

全部评论(0)

暂无评论

上传资源 上传优质资源有赏金

  • 打赏
  • 30日榜单
  • 21下载积分 打赏60.00元   3天前

    用户:gsy幸运

  • 21下载积分 打赏70.00元   3天前

    用户:铁蛋锅

  • 21下载积分 打赏65.00元   3天前

    用户:xzxbybd

  • 21下载积分 打赏60.00元   3天前

    用户:jh0355

  • 21下载积分 打赏60.00元   3天前

    用户:w178191520

  • 21下载积分 打赏20.00元   3天前

    用户:jh03551

  • 21下载积分 打赏20.00元   3天前

    用户:sun2152

  • 21下载积分 打赏20.00元   3天前

    用户:kk1957135547

  • 21下载积分 打赏25.00元   3天前

    用户:w1966891335

  • 21下载积分 打赏20.00元   3天前

    用户:xuzhen1

  • 21下载积分 打赏15.00元   3天前

    用户:x15580286248

  • 21下载积分 打赏25.00元   3天前

    用户:pcb

  • 21下载积分 打赏20.00元   3天前

    用户:bhacker

  • 21下载积分 打赏15.00元   3天前

    用户:liqiang9090

  • 21下载积分 打赏25.00元   3天前

    用户:有理想666

  • 21下载积分 打赏15.00元   3天前

    用户:godbox

  • 21下载积分 打赏15.00元   3天前

    用户:aetek

  • 21下载积分 打赏5.00元   3天前

    用户:mulanhk

  • 21下载积分 打赏5.00元   3天前

    用户:JuneLin61

推荐下载