推荐星级:
  • 1
  • 2
  • 3
  • 4
  • 5

Vision Transformer(ViT)详解

更新时间:2026-02-28 13:08:15 大小:16K 上传用户:潇潇江南查看TA发布的资源 标签:ViT 下载积分:2分 评价赚积分 (如何评价?) 打赏 收藏 评论(0) 举报

资料介绍

Vision Transformer(ViT)是2020年由Google团队提出的基于Transformer架构的计算机视觉模型,其核心创新在于将自然语言处理(NLP)领域的Transformer结构直接应用于图像识别任务,打破了传统卷积神经网络(CNN)在视觉领域的垄断地位。与CNN通过卷积核局部感知不同,ViT通过自注意力机制实现全局信息交互,在大规模数据集上展现出优异的性能和可扩展性。


ViT首先将输入图像分割为固定大小的非重叠 patches(如16×16像素)。假设输入图像尺寸为H×W×C(高度×宽度×通道数),patch大小为P×P,则每个patch的特征维度为P×P×C。将所有patch展平为一维向量后,通过线性投影层将其映射到维度为D的潜在空间,得到patch嵌入序列。数学表示如下:

设图像分块数量为N = (H/P)×(W/P),则嵌入序列长度为N,每个元素维度为D。例如,224×224×3的图像使用16×16 patch时,N = (224/16)² = 196,每个patch的原始维度为16×16×3=768,通过线性层映射为D=768的嵌入向量。


部分文件列表

文件名 大小
1772255068Vision_Transformer(ViT)详解.docx 16K

全部评论(0)

暂无评论

上传资源 上传优质资源有赏金

  • 打赏
  • 30日榜单
  • 21下载积分 打赏60.00元   3天前

    用户:gsy幸运

  • 21下载积分 打赏70.00元   3天前

    用户:铁蛋锅

  • 21下载积分 打赏65.00元   3天前

    用户:xzxbybd

  • 21下载积分 打赏60.00元   3天前

    用户:jh0355

  • 21下载积分 打赏60.00元   3天前

    用户:w178191520

  • 21下载积分 打赏20.00元   3天前

    用户:jh03551

  • 21下载积分 打赏20.00元   3天前

    用户:sun2152

  • 21下载积分 打赏20.00元   3天前

    用户:kk1957135547

  • 21下载积分 打赏25.00元   3天前

    用户:w1966891335

  • 21下载积分 打赏20.00元   3天前

    用户:xuzhen1

  • 21下载积分 打赏15.00元   3天前

    用户:x15580286248

  • 21下载积分 打赏25.00元   3天前

    用户:pcb

  • 21下载积分 打赏20.00元   3天前

    用户:bhacker

  • 21下载积分 打赏15.00元   3天前

    用户:liqiang9090

  • 21下载积分 打赏25.00元   3天前

    用户:有理想666

  • 21下载积分 打赏15.00元   3天前

    用户:godbox

  • 21下载积分 打赏15.00元   3天前

    用户:aetek

  • 21下载积分 打赏5.00元   3天前

    用户:mulanhk

  • 21下载积分 打赏5.00元   3天前

    用户:JuneLin61

推荐下载