AI 是如何「理解」你的话的?
阅读时间 约 12 分钟
考虑这句话:
"小明把苹果给了小红,因为她很饿"
"她"指的是谁?你能毫不犹豫地回答"小红"——因为你的大脑自动完成了一次注意力聚焦:看到"她"时,你的认知系统飞速扫描了上下文,锁定了最相关的词。
但对于传统的逐词处理模型来说,这并不简单。RNN 按顺序读句子,等读到"她"时,"小红"的信息可能已经衰减了。注意力机制的革命性在于:它让模型可以直接"看到"整个句子的每一个词,不受距离限制。
点击上方任意词语,查看它关注句中其他词的程度
注意力的核心是三个向量:Query(查询)、Key(键)和Value(值)。每个词都会生成这三个向量,它们各司其职。
想象你走进一座图书馆:
你用 Q 去匹配每本书的 K,找到最相关的,然后取出对应的 V 来阅读。就是这么简单!
有了 Q、K、V,注意力分数的计算遵循一个优雅的公式:
分三步理解:
最后用这些权重对 V 做加权求和,得到融合了上下文信息的新表示。
悬停查看注意力权重 · 颜色越亮 = 注意力越高
只用一组 Q/K/V 可能不够——就像只从一个角度看问题。Transformer 使用多个注意力头(Multi-Head Attention),每个头学习关注不同的模式:
现在让我们把所有部分拼起来,看看一个完整的 Transformer 层是如何工作的。这是一个精妙的"理解循环"——先看上下文(注意力),再深度思考(前馈网络),不断加深理解。
每一层都在上一层的输出基础上继续深化理解。GPT-3 有 96 层,也就是要经过 96 次这样的"理解循环",难怪它能理解如此复杂的语言!
让模型能"看到"整个句子,不受距离限制,直接建立任意词之间的联系。
Query 发问,Key 提供索引,Value 提供内容。三者配合完成信息检索。
不同的注意力头学习不同的模式——语法、语义、位置,综合得到全面理解。
多层 Transformer 层堆叠,每一层都在前一层基础上加深理解,涌现出惊人能力。