推荐星级:
  • 1
  • 2
  • 3
  • 4
  • 5

车规计算芯片的AI加速器内核微架构设计.docx

更新时间:2026-09-18 14:43:45 大小:38K 上传用户:他山之石可攻玉查看TA发布的资源 标签:车规芯片NPUAI加速器微架构脉动阵列 下载积分:2分 评价赚积分 (如何评价?) 打赏 收藏 评论(0) 举报

资料介绍

车规计算芯片的AI加速器内核微架构设计

一、NPU计算阵列的微架构设计

NPU的计算核心是 乘累加(MAC)阵列,它决定了芯片的峰值算力。典型的MAC阵列以脉动阵列(Systolic Array)或树形加法网络方式组织。脉动阵列中,输入数据和权值以流水线方式在阵列中传播,每个处理单元(PE)执行一次乘累加操作。Google TPUNVIDIA的深度学习加速器均采用这种架构,其优势在于数据复用率高、控制逻辑简单。

2026年旗舰车规NPUMAC阵列规模在 409616384MAC单元 之间,INT8精度下可实现数百TOPS的推理算力。为提高Transformer模型的处理效率,新一代NPU增加了专用矩阵乘法单元(MatMul Unit),支持从中等尺寸到大尺寸的稠密矩阵乘法。这些MatMul单元与脉动阵列并行工作,在混合负载(CNN+Transformer)场景下显著提升整体利用率。

二、数据流与数据复用策略

NPU的效能不仅取决于MAC阵列的规模,更取决于数据流的效率。三种经典的数据流策略各有侧重:权重固定(Weight Stationary 将权重数据保存在片上寄存器中,输入特征图数据在阵列中流动,适用于权重不易频繁替换的场景;输入固定(Input Stationary 反之,适用于输入特征图重复使用的场景;输出固定(Output Stationary 则优化了部分和的累积过程。

2026年先进NPU普遍采用 混合数据流 策略——根据计算图的各层特性自动切换数据流模式。卷积层通常使用权重固定策略,全连接层使用输入固定策略,而Transformer层则使用专门优化的数据流。片上存储层次的设计也围绕数据复用展开——兆字节级的片上SRAM被划分为多个缓冲层,通过编译器自动优化各层的数据放置,最大化数据的片上命中率。


部分文件列表

文件名 大小
35-车规计算芯片的AI加速器内核微架构设计.docx 38K

全部评论(0)

暂无评论

上传资源 上传优质资源有赏金

  • 打赏
  • 30日榜单
  • 21下载积分 打赏60.00元   3天前

    用户:gsy幸运

  • 21下载积分 打赏70.00元   3天前

    用户:铁蛋锅

  • 21下载积分 打赏65.00元   3天前

    用户:xzxbybd

  • 21下载积分 打赏60.00元   3天前

    用户:jh0355

  • 21下载积分 打赏60.00元   3天前

    用户:w178191520

  • 21下载积分 打赏20.00元   3天前

    用户:jh03551

  • 21下载积分 打赏20.00元   3天前

    用户:sun2152

  • 21下载积分 打赏20.00元   3天前

    用户:kk1957135547

  • 21下载积分 打赏25.00元   3天前

    用户:w1966891335

  • 21下载积分 打赏20.00元   3天前

    用户:xuzhen1

  • 21下载积分 打赏15.00元   3天前

    用户:x15580286248

  • 21下载积分 打赏25.00元   3天前

    用户:pcb

  • 21下载积分 打赏20.00元   3天前

    用户:bhacker

  • 21下载积分 打赏15.00元   3天前

    用户:liqiang9090

  • 21下载积分 打赏25.00元   3天前

    用户:有理想666

  • 21下载积分 打赏15.00元   3天前

    用户:godbox

  • 21下载积分 打赏15.00元   3天前

    用户:aetek

  • 21下载积分 打赏5.00元   3天前

    用户:mulanhk

  • 21下载积分 打赏5.00元   3天前

    用户:JuneLin61

推荐下载