推荐星级:
  • 1
  • 2
  • 3
  • 4
  • 5

张量并行-横向模型并行概述

更新时间:2026-07-29 09:00:43 大小:16K 上传用户:江岚查看TA发布的资源 标签:大模型 下载积分:2分 评价赚积分 (如何评价?) 打赏 收藏 评论(0) 举报

资料介绍

核心概念与起源

张量并行(Tensor Parallelism),也常被称为横向模型并行,是大语言模型与深度神经网络训练中常用的模型并行策略之一,核心思想是将单个神经网络层中的权重张量拆分到多个计算设备(GPU/AI加速卡)上存储与计算,从而解决单设备显存容量不足无法容纳超大模型参数的问题。

在深度学习模型训练发展早期,多数中小型模型可以完整放置在单块GPU显存中完成计算,随着模型参数量从百万级增长到十亿、百亿甚至万亿级,单块GPU的显存容量已经无法存储全部模型参数,也就催生了各种模型并行策略。张量并行作为最直观的拆分方案,最早在AlexNet的训练中就有雏形,当时研究者将卷积层的权重拆分到两块GPU上分别计算,再合并结果,实现了更大规模模型的训练。随着Transformer架构和大语言模型的兴起,张量并行经过优化后被广泛应用在GPTLLaMA等主流大模型的分布式训练中,成为万亿参数模型训练的标准组件之一。

核心原理

张量并行的核心逻辑是对权重张量按维度切分,拆分计算任务到多个设备,最终合并结果,根据拆分维度的不同,最常见的实现分为两种:按行拆分和按列拆分,在Transformer架构中,张量并行通常应用在注意力层和前馈网络的权重矩阵上。

1. 线性层的张量切分逻辑

神经网络中最常见的计算是线性变换,形式为 ,其中$X$ 是输入张量,形状为 $$W$ 是权重矩阵,形状为 $$Y$ 是输出张量。

· 按列拆分权重矩阵:将 $W$ 沿列方向切分为 ,每个子矩阵的形状是 $,分别存储到n个不同设备上。每个设备独立计算 ,得到n个输出子矩阵,最终只需要按列拼接所有就能得到完整的 $Y$,这个过程只需要在最后一步做一次聚合通信,中间计算完全独立,通信开销较低。


部分文件列表

文件名 大小
张量并行-横向模型并行概述.docx 16K

全部评论(0)

暂无评论

上传资源 上传优质资源有赏金

  • 打赏
  • 30日榜单

推荐下载