推荐星级:
  • 1
  • 2
  • 3
  • 4
  • 5

面向存算一体芯片的模拟计算阵列中存算一体芯片的存算一体芯片在推荐系统中的大规模部署与性能优化.do

资料介绍

面向存算一体芯片的模拟计算阵列中存算一体芯片的存算一体芯片在推荐系统中的大规模部署与性能优化

摘要

推荐系统是AI算力需求最大的应用场景之一,每天需要处理数十亿次推理请求,对计算系统的吞吐量、延迟和成本提出了极高要求。传统方案使用GPU集群进行推荐推理,功耗高、成本大。本文基于ISSCC 2026上清华、华为和字节跳动联合发布的28nm混合存算芯片研究成果,分析了存算一体芯片在推荐系统中的部署优化方案。该芯片在推荐系统核心运算中实现了QPS提升66倍、能效提升181倍的显著效果,直接解决了大模型长上下文和RAG检索的高功耗、高延迟痛点。

一、推荐系统的计算特征

1.1 大规模稀疏特征处理

推荐系统的输入包含大量稀疏特征(如用户ID、商品ID、类别标签等),这些特征通过嵌入表(Embedding Table)转换为稠密向量后参与后续计算。嵌入表查找是推荐系统的核心瓶颈之一——对于万亿级参数的推荐模型,嵌入表的存储容量可达TB级,每次推理需要查找数千个嵌入向量,查找延迟和带宽消耗极大。

1.2 矩阵乘法的计算密度

推荐系统的主要计算负载是嵌入层后的全连接层矩阵乘法,矩阵规模通常为1024×1024至4096×4096。矩阵乘法的计算量可达每次推理10-100 GFLOPs,在每秒数万次推理的吞吐量下,总计算量达到数百TFLOPs。


部分文件列表

文件名 大小
面向存算一体芯片的模拟计算阵列中存算一体芯片的存算一体芯片在推荐系统中的大规模部署与性能优化.docx 37K

全部评论(0)

暂无评论

上传资源 上传优质资源有赏金

  • 打赏
  • 30日榜单
  • 21下载积分 打赏60.00元   3天前

    用户:gsy幸运

  • 21下载积分 打赏70.00元   3天前

    用户:铁蛋锅

  • 21下载积分 打赏65.00元   3天前

    用户:xzxbybd

  • 21下载积分 打赏60.00元   3天前

    用户:jh0355

  • 21下载积分 打赏60.00元   3天前

    用户:w178191520

  • 21下载积分 打赏20.00元   3天前

    用户:jh03551

  • 21下载积分 打赏20.00元   3天前

    用户:sun2152

  • 21下载积分 打赏20.00元   3天前

    用户:kk1957135547

  • 21下载积分 打赏25.00元   3天前

    用户:w1966891335

  • 21下载积分 打赏20.00元   3天前

    用户:xuzhen1

  • 21下载积分 打赏15.00元   3天前

    用户:x15580286248

  • 21下载积分 打赏25.00元   3天前

    用户:pcb

  • 21下载积分 打赏20.00元   3天前

    用户:bhacker

  • 21下载积分 打赏15.00元   3天前

    用户:liqiang9090

  • 21下载积分 打赏25.00元   3天前

    用户:有理想666

  • 21下载积分 打赏15.00元   3天前

    用户:godbox

  • 21下载积分 打赏15.00元   3天前

    用户:aetek

  • 21下载积分 打赏5.00元   3天前

    用户:mulanhk

  • 21下载积分 打赏5.00元   3天前

    用户:JuneLin61

推荐下载