Transformer 注意力机制

AI 是如何「理解」你的话的?

Transformer Self-Attention 多头注意力

阅读时间 约 12 分钟

Chapter 01

为什么需要注意力?

考虑这句话:

"小明把苹果给了小红,因为很饿"

"她"指的是谁?你能毫不犹豫地回答"小红"——因为你的大脑自动完成了一次注意力聚焦:看到"她"时,你的认知系统飞速扫描了上下文,锁定了最相关的词。

但对于传统的逐词处理模型来说,这并不简单。RNN 按顺序读句子,等读到"她"时,"小红"的信息可能已经衰减了。注意力机制的革命性在于:它让模型可以直接"看到"整个句子的每一个词,不受距离限制

Interactive / 点击词语查看注意力连线

点击上方任意词语,查看它关注句中其他词的程度

注意力机制就像你读书时的"视线焦点"——看到"她"时,你的视线自然跳回前文找到"小红"。Transformer 赋予了 AI 同样的能力。
Chapter 02

Q/K/V 三兄弟

注意力的核心是三个向量:Query(查询)Key(键)Value(值)。每个词都会生成这三个向量,它们各司其职。

想象你走进一座图书馆

你用 Q 去匹配每本书的 K,找到最相关的,然后取出对应的 V 来阅读。就是这么简单!

Interactive / Q·K·V 向量生成过程
Q 是你的"提问",K 是每个词的"标签",V 是实际"内容"。Q 和 K 对上了,就取出对应的 V。这就是注意力的全部秘密。
Chapter 03

注意力分数是如何计算的?

有了 Q、K、V,注意力分数的计算遵循一个优雅的公式:

Attention(Q, K, V) = softmax( Q · KT / √dk ) × V

分三步理解:

  1. Q · KT — 计算每对词之间的"相关度"(点积越大,越相关)
  2. ÷ √dk — 缩放因子,防止数值过大导致 softmax 梯度消失
  3. softmax — 归一化为概率分布(所有权重加起来为 1)

最后用这些权重对 V 做加权求和,得到融合了上下文信息的新表示。

Interactive / 注意力热力图 — 悬停查看分数

悬停查看注意力权重 · 颜色越亮 = 注意力越高

注意力分数就像考试时的"关注度"——你会把更多精力放在重要的题目上。"去"关注"北京"(去哪里),"北京"关注"烤鸭"(文化联想),每对词之间都有一个关注度分数。
Chapter 04

多头注意力:多角度理解

只用一组 Q/K/V 可能不够——就像只从一个角度看问题。Transformer 使用多个注意力头(Multi-Head Attention),每个头学习关注不同的模式:

Interactive / 切换不同注意力头查看模式
多头注意力就像多个侦探同时调查同一个案件——一个关注"谁做了什么",一个关注"在哪里",一个关注"为什么"。最后把所有线索综合起来,得到全面的理解。
Chapter 05

Self-Attention 全景

现在让我们把所有部分拼起来,看看一个完整的 Transformer 层是如何工作的。这是一个精妙的"理解循环"——先看上下文(注意力),再深度思考(前馈网络),不断加深理解。

Interactive / Transformer 层流程 — 点击播放

每一层都在上一层的输出基础上继续深化理解。GPT-3 有 96 层,也就是要经过 96 次这样的"理解循环",难怪它能理解如此复杂的语言!

一个 Transformer 层就像一次"理解循环"——先看上下文(注意力),再思考(FFN),不断加深理解。残差连接确保信息不会在深层网络中丢失。
Chapter 06

总结

注意力 = 聚焦

让模型能"看到"整个句子,不受距离限制,直接建立任意词之间的联系。

Q/K/V 分工明确

Query 发问,Key 提供索引,Value 提供内容。三者配合完成信息检索。

多头 = 多视角

不同的注意力头学习不同的模式——语法、语义、位置,综合得到全面理解。

堆叠 = 深度理解

多层 Transformer 层堆叠,每一层都在前一层基础上加深理解,涌现出惊人能力。

"注意力让 AI 不再逐字阅读,而是像人类一样'抓重点'。"

下一篇

模型量化:如何让大模型"瘦身"