AI 怎么学会「说人话」?从预训练到对齐
阅读时间约 10 分钟大语言模型(LLM)在预训练阶段学会了一项惊人的能力:预测下一个 Token。它阅读了互联网上数万亿个词语,学会了语法、知识、甚至推理。
但问题在于:它从所有互联网数据中学习——包括有害内容、偏见言论、虚假信息和不礼貌的表达。一个原始的预训练模型可能会生成有毒的、不准确的、甚至危险的回复。
这就是为什么我们需要对齐(Alignment)——让模型变得 Helpful(有帮助)、Harmless(无害)、Honest(诚实),也就是所谓的 "3H" 原则。
同一个问题,两种截然不同的回答风格:
预训练像学了所有语言(包括脏话),对齐像学会了礼貌——知道什么该说什么不该说。
RLHF(Reinforcement Learning from Human Feedback,人类反馈强化学习)是目前最主流的对齐方法。它包含三个核心步骤:
点击"下一步"观察每个阶段如何衔接:
用人工编写的高质量问答数据对预训练模型进行微调。这一步让模型学会"对话的格式"——知道如何正确地回答问题,而不是漫无目的地续写文本。
让人类标注员对同一问题的多个回答进行排序(A 好于 B),然后训练一个模型来预测人类的偏好。这个模型就是"奖励模型",它为每个回答打分。
用奖励模型的分数作为"奖励信号",通过 PPO(Proximal Policy Optimization)算法反复优化 LLM,让它生成得分更高的回答。同时使用 KL 散度约束,防止模型偏离太远。
SFT 是教科书学习,Reward Model 是老师的评分标准,RL 是反复练习提高分数。
奖励模型是 RLHF 的核心组件。它的训练数据来自人类标注员的偏好排序:给定同一个问题的两个回答 A 和 B,标注员选择哪个更好。
通过大量这样的比较数据,奖励模型学会了预测人类的偏好——它不会自己回答问题,但能判断回答的好坏。
不过,奖励模型也有一个经典问题:Reward Hacking(奖励黑客)。模型可能会找到"捷径"——生成看起来高分但实际上并不好的回答。比如过度使用赞美词、重复强调安全声明等。
扮演标注员,点击你认为更好的回答:
奖励模型就像美食评委——不会做菜,但能分辨好吃和难吃。
RLHF 虽然有效,但系统复杂度很高:需要单独训练奖励模型,还要运行不稳定的 RL 训练循环。研究者们一直在寻找更简洁的替代方案。
DPO(Direct Preference Optimization) 是 2023 年提出的突破性方法。它跳过了奖励模型,直接从人类偏好数据中优化 LLM。数学上证明,DPO 的目标函数等价于 RLHF,但实现简单得多。
Constitutional AI 是 Anthropic 提出的方法:让模型根据一组"宪法原则"进行自我批评和修正,减少对人类标注的依赖。
RLAIF(AI 反馈强化学习) 则用 AI 生成的反馈代替人类反馈,大幅降低标注成本。
点击卡片查看每种方法的详细流程:
RLHF 是请教练指导训练,DPO 是看比赛录像自学,Constitutional AI 是对着镜子自我纠正。
预训练模型只学会了语言能力,但不知道什么该说、什么不该说。对齐是从"会说话"到"说好话"的关键一步。
RLHF 的核心洞见:通过收集人类对回答的偏好排序,将"好"与"不好"的标准数据化。
奖励模型不生成回答,只判断回答的好坏——它是 RLHF 系统中的"品味裁判"。
DPO 和 Constitutional AI 等新方法正在让对齐变得更简单、更高效,推动了开源模型的快速进步。
RLHF 的本质:让 AI 不只是「能说」,而是「会说」——从语言能力到社交智慧。