推荐星级:
  • 1
  • 2
  • 3
  • 4
  • 5

大模型架构与规模拓展.docx

资料介绍

大模型架构与规模拓展

一、大模型基础核心架构

大语言模型乃至通用大模型的核心架构建立在Transformer基础之上,自2017Google提出Transformer架构后,其凭借自注意力机制的并行计算优势与全局特征捕捉能力,逐步取代RNNCNN成为大模型架构的主流选择,当前主流大模型如GPT系列、LLaMA系列、文心一言、通义千问均采用基于Transformer DecoderEncoder-Decoder的改进架构。

1. 原生Transformer架构核心

原生Transformer分为EncoderDecoder两个核心模块,Encoder模块负责对输入文本进行编码,捕捉上下文的全局语义信息,每个Encoder层包含多头自注意力机制和前馈神经网络两个子层;Decoder模块负责生成输出序列,包含掩码多头自注意力、编码器-解码器注意力和前馈神经网络三个子层,其中掩码自注意力确保生成当前token时只能依赖之前生成的token,符合自回归生成的逻辑。自注意力机制通过计算token之间的注意力权重,实现对任意距离语义关联的建模,解决了传统循环架构长距离依赖建模能力不足的问题,同时支持全序列并行计算,大幅提升了训练效率。

2. 当前主流大模型的架构分支

当前大模型架构主要分为三大分支:第一是仅Decoder架构,以GPT系列为代表,该架构仅保留Transformer Decoder模块,采用自回归方式生成文本,结构简洁且适合通用生成任务,是当前开源与闭源大模型应用最广泛的架构,LLaMAGPT-3GPT-4均采用该架构;第二是Encoder-Decoder架构,以T5BART为代表,Encoder处理输入文本、Decoder生成输出,更适合理解生成结合的任务,如翻译、摘要、问答;第三是仅Encoder架构,以BERT为代表,仅用于文本理解任务,无法直接用于生成,因此较少作为大生成模型的基础架构。


部分文件列表

文件名 大小
大模型架构与规模拓展.docx 17K

全部评论(0)

暂无评论

上传资源 上传优质资源有赏金

  • 打赏
  • 30日榜单

推荐下载