- 1
- 2
- 3
- 4
- 5
Vision Transformer(ViT)详解
资料介绍
Vision Transformer(ViT)是2020年由Google团队提出的基于Transformer架构的计算机视觉模型,其核心创新在于将自然语言处理(NLP)领域的Transformer结构直接应用于图像识别任务,打破了传统卷积神经网络(CNN)在视觉领域的垄断地位。与CNN通过卷积核局部感知不同,ViT通过自注意力机制实现全局信息交互,在大规模数据集上展现出优异的性能和可扩展性。
ViT首先将输入图像分割为固定大小的非重叠 patches(如16×16像素)。假设输入图像尺寸为H×W×C(高度×宽度×通道数),patch大小为P×P,则每个patch的特征维度为P×P×C。将所有patch展平为一维向量后,通过线性投影层将其映射到维度为D的潜在空间,得到patch嵌入序列。数学表示如下:
设图像分块数量为N = (H/P)×(W/P),则嵌入序列长度为N,每个元素维度为D。例如,224×224×3的图像使用16×16 patch时,N = (224/16)² = 196,每个patch的原始维度为16×16×3=768,通过线性层映射为D=768的嵌入向量。
部分文件列表
| 文件名 | 大小 |
| 1772255068Vision_Transformer(ViT)详解.docx | 16K |
最新上传
-
tangyu1 打赏1.00元 3天前
-
jjjjkkkkk 打赏1.00元 3天前
-
emlimei 打赏1.00元 3天前
-
21ic小能手 打赏5.00元 3天前
-
21ic小能手 打赏3.00元 3天前
资料:低频功率放大器的设计.
-
21ic小能手 打赏3.00元 3天前
-
21ic小能手 打赏3.00元 3天前
-
21ic小能手 打赏3.00元 3天前
-
21ic小能手 打赏3.00元 3天前
-
21ic小能手 打赏5.00元 3天前
资料:51单片机数字频率计
-
21ic小能手 打赏5.00元 3天前
-
21ic小能手 打赏5.00元 3天前
-
21ic小能手 打赏5.00元 3天前
-
13573902396 打赏1.00元 3天前
-
21下载积分 打赏310.00元 3天前
用户:江岚
-
21下载积分 打赏310.00元 3天前
用户:潇潇江南
-
21下载积分 打赏60.00元 3天前
用户:他山之石可攻玉
-
21下载积分 打赏310.00元 3天前
用户:小猫做电路
-
21下载积分 打赏210.00元 3天前
用户:zhengdai
-
21下载积分 打赏210.00元 3天前
用户:w993263495
-
21下载积分 打赏10.00元 3天前
用户:烟雨
-
21下载积分 打赏60.00元 3天前
用户:gsy幸运
-
21下载积分 打赏70.00元 3天前
用户:铁蛋锅
-
21下载积分 打赏65.00元 3天前
用户:xzxbybd
-
21下载积分 打赏60.00元 3天前
用户:jh0355
-
21下载积分 打赏60.00元 3天前
用户:w178191520
-
21下载积分 打赏20.00元 3天前
用户:jh03551
-
21下载积分 打赏20.00元 3天前
用户:sun2152
-
21下载积分 打赏20.00元 3天前
用户:kk1957135547
-
21下载积分 打赏25.00元 3天前
用户:w1966891335
-
21下载积分 打赏20.00元 3天前
用户:xuzhen1
-
21下载积分 打赏15.00元 3天前
用户:x15580286248
-
21下载积分 打赏25.00元 3天前
用户:pcb
-
21下载积分 打赏20.00元 3天前
用户:bhacker
-
21下载积分 打赏15.00元 3天前
用户:liqiang9090
-
21下载积分 打赏25.00元 3天前
用户:有理想666
-
21下载积分 打赏15.00元 3天前
用户:godbox
-
21下载积分 打赏15.00元 3天前
用户:aetek
-
21下载积分 打赏5.00元 3天前
用户:mulanhk
-
21下载积分 打赏5.00元 3天前
用户:JuneLin61




全部评论(0)