Skip to content

Attention Is All You Need

2017 年提出 Transformer 的原始论文(Vaswani et al.),现代大模型结构的共同源头。

它是做什么的

当时主流序列模型依赖 RNN(尤其 LSTM/GRU)或卷积,再叠 Attention。RNN 把位置对齐到时间步,天然难以在样本内并行;卷积方案虽能并行,但任意两位置之间的依赖路径会随距离变长。本文提出只靠 Attention 的编解码架构(Transformer),去掉 recurrence 与卷积,用 self-attention 把任意位置依赖压到常数步(代价是注意力加权带来的分辨率损失,用 Multi-Head 缓解)。机器翻译实验显示:质量更好、更易并行、训练时间更短。作者还在英语成分句法分析上验证了泛化能力。论文摘要给出的结果包括:WMT 2014 英德 28.4 BLEU;英法单模型 41.8 BLEU(8 GPU 训练约 3.5 天)——具体数字以 arXiv 原文为准。后续 GPT、BERT 等均从此架构分支出去(解码器-only / 编码器-only 变体)。

要点

  • Scaled Dot-Product AttentionAttention(Q,K,V)=softmax(QK^T/√d_k)V;用 √d_k 缓解点积过大导致的 softmax 饱和
  • Multi-Head Attention:把 Q/K/V 投影成多组,并行做 attention,再拼接并投影;论文认为单头平均会抑制不同子空间信息
  • Encoder / Decoder 栈:文中各 N=6 层;每层子层带残差连接与 LayerNorm;d_model=512
  • Decoder 因果掩码:禁止看到未来位置,保证自回归生成合法
  • 位置编码:无 recurrence,用正弦/余弦(或可学习)positional encoding 注入顺序
  • 并行友好:相对 RNN 逐步依赖,训练时更易在序列维度并行

适合谁

  • 要引一手出处(论文、面试、综述、技术分享)
  • 已有图解直觉,想对照公式、原图与超参设定
  • 实现或阅读 Transformer / GPT 代码时需要对照设计动机

官方入口

建议怎么用

不必第一遍精读每一节。优先顺序:Abstract → Introduction → §3 Model Architecture(尤其 Scaled Dot-Product、Multi-Head、Encoder/Decoder 栈与掩码)→ 自己画一张「输入 embedding → 各层 → 输出」草图,标出 Q/K/V 从哪来。训练日程、正则、附录与解析实验按实现或面试需要再回看。可与 The Illustrated Transformer 对照;写代码时可跟 Karpathy「Let's build GPT」或 PyTorch 官方 Transformer 教程,把公式落到 batch、seq、head、dim 形状上。

本站为个人非经营性学习导航。免责声明:信息仅供学习参考,不构成建议或背书;外链与第三方产品归其权利人。详情见 关于本站 · 隐私政策