为什么「想一想再回答」能让 AI 变聪明?
阅读时间约 10 分钟诺贝尔经济学奖得主 Daniel Kahneman 在《思考,快与慢》中提出了著名的双系统理论:人类的思维分为系统 1(快速、直觉)和系统 2(缓慢、审慎)。这个类比完美地解释了普通 LLM 和推理模型的区别。
系统 1(标准 LLM):看到问题就立即输出答案。它依赖模式匹配——训练中见过无数次类似的问题,所以能迅速"脱口而出"。问 "2+2=?",它瞬间回答 "4"。
系统 2(推理模型):在回答之前先"想一想"。它会生成一连串的思考 Token,把复杂问题拆解成小步骤,逐步推导出答案。遇到"证明勾股定理",它会一步步写出推理过程。
点击卡片,观察两种模型面对同一问题的不同反应:
普通 LLM 像抢答,推理模型像深思——抢答赢速度,深思赢准确率。
2022 年,Google 研究员发现了一个惊人的现象:只要在 Prompt 中加入 "Let's think step by step",大语言模型在数学和逻辑推理任务上的准确率就会大幅提升。这就是 Chain-of-Thought(CoT,思维链)。
不使用思维链时,模型直接给出答案——往往容易出错:
Q: 17 x 24 = ? A: __(可能给出错误答案)
使用思维链后,模型"展示解题过程",准确率显著提升:
Q: 17 x 24 = ? Let me think: 17x20=340, 17x4=68, 340+68=408 ✓
更进一步,o1、R1、QwQ 等推理模型在训练过程中就学会了自动生成思维链。它们会产出数百甚至数千个思考 Token,然后才给出最终答案——这就是 Extended Thinking(扩展思考)。
思维链就像考试要求「写出解题过程」——过程对了,答案自然对。
从 2024 年起,各大 AI 实验室纷纷推出自己的推理模型,开启了一场全新的竞赛:
OpenAI o1/o3:率先提出"test-time compute scaling"概念——模型在推理阶段投入更多计算,思考越久答案越好。o1 在数学竞赛和编程任务上表现惊艳。
DeepSeek R1:开源推理模型,从 671B 的混合专家模型(MoE)蒸馏出 1.5B 到 70B 的多种尺寸。证明了小模型也能拥有强大的推理能力。
Qwen QwQ:阿里巴巴的推理模型,展示了中文环境下的强大推理表现。
这些模型的核心发现是一致的:学会在更难的问题上分配更多计算资源。
能力分数越高,条越长(基于公开 Benchmark 归一化,满分 100):
| 模型 | 厂商 | 数学 | 编程 | 推理 |
|---|---|---|---|---|
| o3 | OpenAI | |||
| o1 | OpenAI | |||
| DeepSeek R1 | DeepSeek | |||
| QwQ-32B | Alibaba | |||
| R1-Distill-7B | DeepSeek |
推理模型就像考生学会了「难题多花时间」——不是更聪明,而是更会分配精力。
传统的 AI 变强路径是 Training-time Compute(训练时算力):用更多数据、更大模型、更长时间来训练。OpenAI 的 Scaling Law 就是这条路线的理论基础。
但推理模型开辟了第二条路径:Test-time Compute(推理时算力)。同一个模型,在面对更难的问题时思考更久,生成更多思考 Token,从而提高准确率。
这带来了一个重要的 权衡:推理模型更慢,消耗更多 Token(思考 Token 也要计费)。但对于复杂任务,准确率的提升远超额外的成本。关键在于——收益递减:思考太久,提升会越来越小。
拖动滑块调整"思考预算"(允许生成的思考 Token 数量),观察准确率变化:
Test-time compute 就像「开卷考试给更多时间」——同样的知识,多想一会儿就能做对更难的题。
面对复杂问题,逐步推理比直觉回答更可靠。推理模型用"系统2思维"攻克难题。
让模型"写出解题过程",准确率在数学、逻辑、编程任务上显著提升。
Test-time compute 是一种全新的 Scaling 维度:同一模型思考越久,表现越好。
DeepSeek R1 证明,大模型的推理能力可以蒸馏到 7B 甚至 1.5B 的小模型中。
推理模型的本质启示:AI 变强不只靠更大的模型,也靠更深的思考。