最新搜索: RDA8955 9260 DO-178 555 C8051F a20
推荐星级:
  • 1
  • 2
  • 3
  • 4
  • 5

KV缓存量化与压缩技术综述

更新时间:2026-06-15 08:26:19 大小:19K 上传用户:潇潇江南查看TA发布的资源 标签:压缩技术 下载积分:2分 评价赚积分 (如何评价?) 打赏 收藏 评论(0) 举报

资料介绍

一、引言

在大语言模型(LLM)推理部署过程中,KV缓存(Key-Value Cache)是实现推理加速的核心技术之一。自回归生成每一个新token时,模型都需要用到前面所有token计算得到的键(Key)和值(Value)投影结果,如果不进行缓存,每生成一个新token都需要重新计算所有历史tokenKV,会带来巨大的重复计算开销,大幅降低推理吞吐量,同时提高延迟。KV缓存通过存储历史tokenKV投影结果,使得每一步推理只需要计算当前新tokenKV,极大地减少了计算量。

但是随着生成序列长度增加,KV缓存占用的显存空间会线性增长。对于长文本生成场景,比如10token级的对话或者文档生成,KV缓存可以占用高达数GB甚至十数GB的显存,严重限制了单卡能够部署的模型批次大小,也制约了长上下文推理的应用。因此,对KV缓存进行量化与压缩,在保证模型生成效果几乎不下降的前提下降低显存占用,已经成为大模型推理部署中不可或缺的关键技术。本文将系统介绍KV缓存量化与压缩的基本原理、主流技术路线、效果对比,以及当前的研究进展和应用方向。

二、KV缓存基本原理与存储开销分析

2.1 KV缓存的工作机制

Transformer架构中,每一层的自注意力计算可以表示为:

 

其中Q是当前步的查询矩阵,KV分别是所有token(包括历史token和当前token)的键和值矩阵。在自回归生成场景,每一步只生成一个新token,因此Q只包含当前token的查询,而KV包含了从第一个token到当前token的所有结果。如果不使用缓存,每一步都需要把所有历史token重新输入模型计算一次KV,时间复杂度是n是序列长度,$d$是隐藏层维度。而使用KV缓存后,每一步只需要计算新tokenKV,拼接到缓存的历史KV后面即可,时间复杂度降低到$O(nd)$,大幅提升推理速度。


部分文件列表

文件名 大小
KV缓存量化与压缩技术综述.docx 19K

全部评论(0)

暂无评论

上传资源 上传优质资源有赏金

  • 打赏
  • 30日榜单
  • 21下载积分 打赏310.00元   3天前

    用户:江岚

  • 21下载积分 打赏310.00元   3天前

    用户:潇潇江南

  • 21下载积分 打赏60.00元   3天前

    用户:他山之石可攻玉

  • 21下载积分 打赏310.00元   3天前

    用户:小猫做电路

  • 21下载积分 打赏210.00元   3天前

    用户:zhengdai

  • 21下载积分 打赏210.00元   3天前

    用户:w993263495

  • 21下载积分 打赏10.00元   3天前

    用户:烟雨

  • 21下载积分 打赏60.00元   3天前

    用户:gsy幸运

  • 21下载积分 打赏70.00元   3天前

    用户:铁蛋锅

  • 21下载积分 打赏65.00元   3天前

    用户:xzxbybd

  • 21下载积分 打赏60.00元   3天前

    用户:jh0355

  • 21下载积分 打赏60.00元   3天前

    用户:w178191520

  • 21下载积分 打赏20.00元   3天前

    用户:jh03551

  • 21下载积分 打赏20.00元   3天前

    用户:sun2152

  • 21下载积分 打赏20.00元   3天前

    用户:kk1957135547

  • 21下载积分 打赏25.00元   3天前

    用户:w1966891335

  • 21下载积分 打赏20.00元   3天前

    用户:xuzhen1

  • 21下载积分 打赏15.00元   3天前

    用户:x15580286248

  • 21下载积分 打赏25.00元   3天前

    用户:pcb

  • 21下载积分 打赏20.00元   3天前

    用户:bhacker

  • 21下载积分 打赏15.00元   3天前

    用户:liqiang9090

推荐下载