AI 新技术 · 第 1 章
推理模型:2026 年为什么 o3-pro、DeepSeek V4、Qwen3.8 会"想一会儿"再回答
你有没有这种体验:问普通大模型一道数学题,它张嘴就答,还经常算错 ;换成推理模型,它先"吭哧吭哧"打一长串草稿,最后才给答案,正确率明显更高。这背后就是思维链(Chain-of-Thought) 和测试时计算(test-time compute) 这两件事——让 AI 从"凭直觉抢答"变成"打草稿、一步步推"。
⓪ 本章怎么学(约 40 分钟)
1 直觉对比(8 分钟) 读①:快思考 vs 慢思考。
2 概念表(10 分钟) 读②:CoT、test-time、RL。
3 看例子+防坑(12 分钟) 读③④,记三个易错点。
4 自测+复述(10 分钟) 做⑤⑥,费曼三问讲一遍。
本章小目标 学完你要能:说清慢思考好在哪、为什么 test-time compute 更贵、RL 怎么训出推理能力、什么时候别用推理模型。
① 一句话搞懂:快思考 vs 慢思考
心理学家卡尼曼说人有两套系统:系统 1 快思考 (凭直觉,一秒反应),系统 2 慢思考 (坐下来演算)。普通对话模型用的是系统 1,推理模型专门练的是系统 2。
对比 普通对话模型(如 GPT-5.1 Flash) 推理模型(o3-pro / DeepSeek V4-Pro)
回答方式 直接吐答案,像抢答 先内部"打草稿",再给结论
擅长 聊天、写文案、翻译、 summarization 数学、编程、逻辑推理、复杂规划
速度/成本 快、便宜 慢、token 贵(想很久)
可看思考过程 一般直接给答案 常输出思维链(CoT)给你看
核心直觉 推理模型不是"更聪明的大脑",而是被训练成愿意花更多算力去想 。多花的 token 就是它的"草稿纸"——草稿打得越久,难题越不容易错。
② 关键概念表
名词 大白话
思维链 CoT 把"因为→所以→下一步"一步步写出来,而不是直接跳结论
测试时计算 推理阶段多花算力(多想、多试几条路),换来更准答案
RL 强化学习 不靠人工标答案,而是奖励"做对了"的推理路径,让模型自己学会怎么想
开源代表(2026.9) DeepSeek V4-Pro(MIT)、Qwen3.8-Max(Apache 2.0,2.4T-A95B MoE)、Kimi K3;闭源:OpenAI o3-pro / GPT-6 Astra、Gemini 3 Pro Deep Think、Claude Opus 4.8
它是怎么练出来的
先用监督微调让模型"学会把思考过程写出来",再用强化学习(RL) 奖励那些最终答案正确的长推理链——做对了就奖励、做错了或中途跑偏就惩罚。于是模型自己摸索出:遇到难题要多分支试、要回头检查。DeepSeek R1 是开山之作,2026 年的 V4-Pro(2026.8.13) 与 Qwen3.8-Max 把这条路推到了 2.4T 参数、Agent 能力第一梯队,证明开源也能打闭源旗舰。
SFT 学格式 先示范"分步写",让模型学会打草稿。
RL 奖对的 奖励最终做对的推理链,自己摸索策略。
采样 多试路 同一题多生成几条路,挑最靠谱的。
验证 回头查 自己检查中间步骤,错了再修正。
slow vs fast 一句话 fast(普通模型)= 系统 1,凭直觉抢答;slow(推理模型)= 系统 2,坐下来慢慢推。二者不是替代,而是按题选用 。
③ 三个例子
例 1 · 一道鸡兔同笼(CoT 怎么写)
问:鸡兔同笼,头 35 个、脚 94 只,鸡兔各几只?
快思考: 直接猜"鸡 20 兔 15",错。慢思考(CoT): 假设全是鸡 → 应有 70 只脚,实际 94,多了 24 只;每把一只鸡换成兔多 2 只脚 → 兔 = 24/2 = 12 只,鸡 = 35-12 = 23 只。验证: 23×2+12×4 = 46+48 = 94 ✓
例 2 · test-time compute 调多大
同一道题,给推理模型不同"思考预算"。
预算小(想 1 秒):可能仍出错;预算大(想 30 秒、多分支搜索):正确率从 60% 涨到 90%。这就是用算力换准确率 ——贵,但难题值。
例 3 · 一个编程 bug
普通模型说"代码没问题";推理模型自己在脑子里跑一遍逻辑,发现:边界条件 i < n 应为 i <= n,并解释为什么会越界。
它不是背答案,而是在内部模拟执行了一遍代码 ,才抓到隐藏 bug。
④ 防坑提醒
坑 1:以为所有问题都该用推理模型 写邮件、翻译、聊天气这种简单活,用普通模型又快又省;推理模型是杀鸡用牛刀,还慢还贵。难题才上慢思考。
坑 2:以为思维链写得长就一定对 CoT 也会"一本正经地错"——中间一步错了,后面全跟着错。长思考不等于可靠,关键步骤仍要核对。
坑 3:把"看不见的思考"当成它有意识 o1/o3 的内部推理过程对用户是封闭的,那是工程上的搜索与试算,不是人类那种主观意识。别拟人化。
⑤ 折叠自测(点开即答)
基础1 推理模型和普通对话模型最大的区别是什么?
解析 普通模型直接答 (快思考),推理模型先内部打草稿、一步步推理 再答(慢思考),所以在数学、逻辑、编程难题上明显更强,但更慢更贵。
中档2 "测试时计算(test-time compute)"是什么意思?
解析 指在推理阶段(不是训练阶段)多花算力 ——多想几轮、多试几条分支、多检查,用更高的 token 消耗换取更高的正确率。
拔高3 为什么说 RL(强化学习)能训出"会推理"的能力?
解析 不直接标"标准答案长这样",而是奖励最终做对的推理链 。模型在大量试错中自己摸索出:该分步、该验证、该回头。DeepSeek R1 就是靠这条路,开源复现了推理能力。
⑥ 费曼三问(合上讲,自己讲给自己听)
用大白话回答,讲不顺就是没懂
问 1: 为什么推理模型答数学题更准?它多做了哪一步?
问 2: "用算力换准确率"具体换的是什么?贵在哪?
问 3: 日常聊天该不该默认开推理模型?为什么?
快思考 vs 慢思考: 直觉抢答 / 打草稿一步步推 系统1 vs 系统2
CoT 思维链: 把因为所以一步步写出来 不跳结论
测试时计算: 推理阶段多花 token 换正确率 贵但准
训练方式: SFT 学格式 + RL 奖励做对的推理 2026 代表:DeepSeek V4-Pro、Qwen3.8-Max
选用原则: 难题上慢思考,简单活别用 省成本
📖 名词速查
名词 大白话
o3-pro / GPT-6 Astra OpenAI 2026 旗舰:o3-pro Agent 能力第一,GPT-6 Astra 最新闭源
DeepSeek V4-Pro / V4.1 Flash 2026.8 开源推理旗舰:V4-Pro 对标 Qwen3.8-Max,V4.1 Flash MIT 协议 $0.30/$1.20
Qwen3.8-Max / Flash 阿里 2.4T-A95B MoE;Flash 编码追平 V4-Pro 但价格 1/4(2026.8.26)
Gemini 3 Pro Deep Think Google 多模态推理 95 分第一;Gemini 3.8 Flash 廉价推理(2026.9.2)
Claude 4.5 Sonnet / Opus 4.8 Anthropic,带 thinking 开关模式
Kimi K3 / LongCat-2.5 Kimi 2.8T hybrid KDA+MLA;美团 LongCat-2.5 原生 1M 上下文
CoT 思维链 把推理一步步写出来,不跳结论
test-time compute 推理阶段多花算力换准确率
RL 强化学习 奖励做对的推理链,训出"会想"
🛠 实战场景:什么时候该开"慢思考"
任务 用哪个 原因
写一封请假邮件 普通模型 简单,快又省
解奥数/高考压轴题 推理模型 需要多步推导
写一个复杂 SQL 并验证 推理模型 容易错,要打草稿
闲聊、翻译、润色 普通模型 直觉活,无需慢想
调试一段棘手代码 推理模型 要逐步模拟执行
经验法则:需要"一步步推导、容易一步错满盘输"的,开慢思考;剩下的,普通模型又快又省。
🧪 生活联想
1 开车 老司机凭直觉转弯(fast),科目三考试则每步默念要领(slow)。
2 算账 买东西凑单大概估(fast),报销要列清单加总(slow)。
3 写代码 改个文案秒回,查内存泄漏要逐步调试(slow)。
对照自己 遇到难题先别急着让模型"马上答",给它一句"请一步步思考",往往准确率立刻上去。
⚡ 高频 FAQ
问:推理模型是不是一定比普通模型好? 不是。它只是更会做"需要多步推导"的难题;简单聊天它又慢又贵,普通模型更好用。
问:它思考的过程我能看到吗? 有些开源/开放模型(DeepSeek V4、Qwen3.8)支持"思考模式开关",能把思维链打出来给你看;闭源旗舰(o3-pro、GPT-6 Astra)的内部推理过程对用户是封闭的,只给你最终答案。
问:为什么它更贵? 因为它在"思考"时生成了大量内部 token,这些都算钱。想越久越贵。
🔁 5 天复习计划
天 任务 自检
第 1 天 读①②,理清快慢思考与概念表 说清 CoT 是什么
第 2 天 读③④,跟一遍三个例子 讲清 test-time compute
第 3 天 做⑤折叠自测 三题全对
第 4 天 读⑥费曼三问,不看资料讲 能举例
第 5 天 名词速查 + 口诀默写 脱稿说清 RL 怎么训
三句口诀 ① 慢思考先打草稿再给答案;② test-time 用算力换准确率;③ 难题才上推理模型,简单活别用。
📌 知识链路
前置知识 先懂普通大语言模型是怎么对话、怎么生成文字的,再看"多想一步"带来的差别。
本节位置 AI 新技术线的第 1 站:模型变"会想",后面多模态、长上下文都是在给它加感官和记忆。
下一步 接着看原生多模态,理解它怎么从"认字"走到"看图听音"。