推荐星级:
  • 1
  • 2
  • 3
  • 4
  • 5

面向存算一体芯片的模拟计算阵列中存算一体芯片在车载智能座舱中的端侧大模型推理加速.docx

资料介绍

面向存算一体芯片的模拟计算阵列中存算一体芯片在车载智能座舱中的端侧大模型推理加速

摘要

智能座舱需要本地运行7B-13B参数规模的大语言模型,实现语音交互、情感识别、个性化推荐等AI功能,对芯片的算力、内存带宽和功耗提出了极高要求。传统方案使用座舱SoC中的NPU进行推理,受限于片外存储带宽,大模型推理的延迟较大、功耗较高。本文针对车载智能座舱的端侧大模型推理需求,设计了一种面向存算一体芯片的推理加速方案,通过存算一体阵列在存储域直接完成Transformer的矩阵乘法运算,将大模型推理的延迟降低至200ms以内,芯片功耗仅为10W,为智能座舱提供了高能效的端侧大模型推理解决方案。

一、智能座舱大模型推理的需求

1.1 端侧大模型推理的挑战

7B参数大模型在FP16精度下的权重存储需求约为14GB,在INT4量化下约为3.5GB。传统方案需要将权重从片外LPDDR加载到NPUSRAM中,每次推理的权重加载量约为1-3GB,受限于LPDDR带宽(约50GB/s),权重加载延迟约为20-60ms,占总推理延迟的60%以上。

1.2 实时性要求

智能座舱的语音交互延迟要求小于500ms,才能提供流畅的用户体验。在7B模型推理中,传统NPU方案的推理延迟约为300-500ms,加上权重加载延迟,总延迟可能超过500ms,无法满足实时性要求。

二、存算一体大模型推理方案


部分文件列表

文件名 大小
面向存算一体芯片的模拟计算阵列中存算一体芯片在车载智能座舱中的端侧大模型推理加速.docx 37K

全部评论(0)

暂无评论

上传资源 上传优质资源有赏金

  • 打赏
  • 30日榜单
  • 21下载积分 打赏60.00元   3天前

    用户:gsy幸运

  • 21下载积分 打赏70.00元   3天前

    用户:铁蛋锅

  • 21下载积分 打赏65.00元   3天前

    用户:xzxbybd

  • 21下载积分 打赏60.00元   3天前

    用户:jh0355

  • 21下载积分 打赏60.00元   3天前

    用户:w178191520

  • 21下载积分 打赏20.00元   3天前

    用户:jh03551

  • 21下载积分 打赏20.00元   3天前

    用户:sun2152

  • 21下载积分 打赏20.00元   3天前

    用户:kk1957135547

  • 21下载积分 打赏25.00元   3天前

    用户:w1966891335

  • 21下载积分 打赏20.00元   3天前

    用户:xuzhen1

  • 21下载积分 打赏15.00元   3天前

    用户:x15580286248

  • 21下载积分 打赏25.00元   3天前

    用户:pcb

  • 21下载积分 打赏20.00元   3天前

    用户:bhacker

  • 21下载积分 打赏15.00元   3天前

    用户:liqiang9090

  • 21下载积分 打赏25.00元   3天前

    用户:有理想666

  • 21下载积分 打赏15.00元   3天前

    用户:godbox

  • 21下载积分 打赏15.00元   3天前

    用户:aetek

  • 21下载积分 打赏5.00元   3天前

    用户:mulanhk

  • 21下载积分 打赏5.00元   3天前

    用户:JuneLin61

推荐下载