← 返回 AI 基础 首页 / 算法与AI / AI 新技术 · 推理模型
AI 新技术 · 第 1 章

推理模型:2026 年为什么 o3-pro、DeepSeek V4、Qwen3.8 会"想一会儿"再回答

你有没有这种体验:问普通大模型一道数学题,它张嘴就答,还经常算错;换成推理模型,它先"吭哧吭哧"打一长串草稿,最后才给答案,正确率明显更高。这背后就是思维链(Chain-of-Thought)和测试时计算(test-time compute)这两件事——让 AI 从"凭直觉抢答"变成"打草稿、一步步推"。

⓪ 本章怎么学(约 40 分钟)

1直觉对比(8 分钟)
读①:快思考 vs 慢思考。
2概念表(10 分钟)
读②:CoT、test-time、RL。
3看例子+防坑(12 分钟)
读③④,记三个易错点。
4自测+复述(10 分钟)
做⑤⑥,费曼三问讲一遍。
本章小目标学完你要能:说清慢思考好在哪、为什么 test-time compute 更贵、RL 怎么训出推理能力、什么时候别用推理模型。

① 一句话搞懂:快思考 vs 慢思考

心理学家卡尼曼说人有两套系统:系统 1 快思考(凭直觉,一秒反应),系统 2 慢思考(坐下来演算)。普通对话模型用的是系统 1,推理模型专门练的是系统 2。

对比普通对话模型(如 GPT-5.1 Flash)推理模型(o3-pro / DeepSeek V4-Pro)
回答方式直接吐答案,像抢答先内部"打草稿",再给结论
擅长聊天、写文案、翻译、 summarization数学、编程、逻辑推理、复杂规划
速度/成本快、便宜慢、token 贵(想很久)
可看思考过程一般直接给答案常输出思维链(CoT)给你看
核心直觉推理模型不是"更聪明的大脑",而是被训练成愿意花更多算力去想。多花的 token 就是它的"草稿纸"——草稿打得越久,难题越不容易错。

② 关键概念表

名词大白话
思维链 CoT把"因为→所以→下一步"一步步写出来,而不是直接跳结论
测试时计算推理阶段多花算力(多想、多试几条路),换来更准答案
RL 强化学习不靠人工标答案,而是奖励"做对了"的推理路径,让模型自己学会怎么想
开源代表(2026.9)DeepSeek V4-Pro(MIT)、Qwen3.8-Max(Apache 2.0,2.4T-A95B MoE)、Kimi K3;闭源:OpenAI o3-pro / GPT-6 Astra、Gemini 3 Pro Deep Think、Claude Opus 4.8

它是怎么练出来的

先用监督微调让模型"学会把思考过程写出来",再用强化学习(RL)奖励那些最终答案正确的长推理链——做对了就奖励、做错了或中途跑偏就惩罚。于是模型自己摸索出:遇到难题要多分支试、要回头检查。DeepSeek R1 是开山之作,2026 年的 V4-Pro(2026.8.13)与 Qwen3.8-Max 把这条路推到了 2.4T 参数、Agent 能力第一梯队,证明开源也能打闭源旗舰。

SFT学格式
先示范"分步写",让模型学会打草稿。
RL奖对的
奖励最终做对的推理链,自己摸索策略。
采样多试路
同一题多生成几条路,挑最靠谱的。
验证回头查
自己检查中间步骤,错了再修正。
slow vs fast 一句话fast(普通模型)= 系统 1,凭直觉抢答;slow(推理模型)= 系统 2,坐下来慢慢推。二者不是替代,而是按题选用。

③ 三个例子

例 1 · 一道鸡兔同笼(CoT 怎么写)
问:鸡兔同笼,头 35 个、脚 94 只,鸡兔各几只?
快思考:直接猜"鸡 20 兔 15",错。
慢思考(CoT):假设全是鸡 → 应有 70 只脚,实际 94,多了 24 只;每把一只鸡换成兔多 2 只脚 → 兔 = 24/2 = 12 只,鸡 = 35-12 = 23 只。验证:23×2+12×4 = 46+48 = 94 ✓
例 2 · test-time compute 调多大
同一道题,给推理模型不同"思考预算"。
预算小(想 1 秒):可能仍出错;预算大(想 30 秒、多分支搜索):正确率从 60% 涨到 90%。这就是用算力换准确率——贵,但难题值。
例 3 · 一个编程 bug
普通模型说"代码没问题";推理模型自己在脑子里跑一遍逻辑,发现:边界条件 i < n 应为 i <= n,并解释为什么会越界。
它不是背答案,而是在内部模拟执行了一遍代码,才抓到隐藏 bug。

④ 防坑提醒

坑 1:以为所有问题都该用推理模型写邮件、翻译、聊天气这种简单活,用普通模型又快又省;推理模型是杀鸡用牛刀,还慢还贵。难题才上慢思考。
坑 2:以为思维链写得长就一定对CoT 也会"一本正经地错"——中间一步错了,后面全跟着错。长思考不等于可靠,关键步骤仍要核对。
坑 3:把"看不见的思考"当成它有意识o1/o3 的内部推理过程对用户是封闭的,那是工程上的搜索与试算,不是人类那种主观意识。别拟人化。

⑤ 折叠自测(点开即答)

基础1推理模型和普通对话模型最大的区别是什么?
普通模型直接答(快思考),推理模型先内部打草稿、一步步推理再答(慢思考),所以在数学、逻辑、编程难题上明显更强,但更慢更贵。
中档2"测试时计算(test-time compute)"是什么意思?
指在推理阶段(不是训练阶段)多花算力——多想几轮、多试几条分支、多检查,用更高的 token 消耗换取更高的正确率。
拔高3为什么说 RL(强化学习)能训出"会推理"的能力?
不直接标"标准答案长这样",而是奖励最终做对的推理链。模型在大量试错中自己摸索出:该分步、该验证、该回头。DeepSeek R1 就是靠这条路,开源复现了推理能力。

⑥ 费曼三问(合上讲,自己讲给自己听)

用大白话回答,讲不顺就是没懂
问 1:为什么推理模型答数学题更准?它多做了哪一步?
问 2:"用算力换准确率"具体换的是什么?贵在哪?
问 3:日常聊天该不该默认开推理模型?为什么?
快思考 vs 慢思考:直觉抢答 / 打草稿一步步推 系统1 vs 系统2
CoT 思维链:把因为所以一步步写出来 不跳结论
测试时计算:推理阶段多花 token 换正确率 贵但准
训练方式:SFT 学格式 + RL 奖励做对的推理 2026 代表:DeepSeek V4-Pro、Qwen3.8-Max
选用原则:难题上慢思考,简单活别用 省成本

📖 名词速查

名词大白话
o3-pro / GPT-6 AstraOpenAI 2026 旗舰:o3-pro Agent 能力第一,GPT-6 Astra 最新闭源
DeepSeek V4-Pro / V4.1 Flash2026.8 开源推理旗舰:V4-Pro 对标 Qwen3.8-Max,V4.1 Flash MIT 协议 $0.30/$1.20
Qwen3.8-Max / Flash阿里 2.4T-A95B MoE;Flash 编码追平 V4-Pro 但价格 1/4(2026.8.26)
Gemini 3 Pro Deep ThinkGoogle 多模态推理 95 分第一;Gemini 3.8 Flash 廉价推理(2026.9.2)
Claude 4.5 Sonnet / Opus 4.8Anthropic,带 thinking 开关模式
Kimi K3 / LongCat-2.5Kimi 2.8T hybrid KDA+MLA;美团 LongCat-2.5 原生 1M 上下文
CoT 思维链把推理一步步写出来,不跳结论
test-time compute推理阶段多花算力换准确率
RL 强化学习奖励做对的推理链,训出"会想"

🛠 实战场景:什么时候该开"慢思考"

任务用哪个原因
写一封请假邮件普通模型简单,快又省
解奥数/高考压轴题推理模型需要多步推导
写一个复杂 SQL 并验证推理模型容易错,要打草稿
闲聊、翻译、润色普通模型直觉活,无需慢想
调试一段棘手代码推理模型要逐步模拟执行

经验法则:需要"一步步推导、容易一步错满盘输"的,开慢思考;剩下的,普通模型又快又省。

🧪 生活联想

1开车
老司机凭直觉转弯(fast),科目三考试则每步默念要领(slow)。
2算账
买东西凑单大概估(fast),报销要列清单加总(slow)。
3写代码
改个文案秒回,查内存泄漏要逐步调试(slow)。
对照自己遇到难题先别急着让模型"马上答",给它一句"请一步步思考",往往准确率立刻上去。

⚡ 高频 FAQ

问:推理模型是不是一定比普通模型好?不是。它只是更会做"需要多步推导"的难题;简单聊天它又慢又贵,普通模型更好用。
问:它思考的过程我能看到吗?有些开源/开放模型(DeepSeek V4、Qwen3.8)支持"思考模式开关",能把思维链打出来给你看;闭源旗舰(o3-pro、GPT-6 Astra)的内部推理过程对用户是封闭的,只给你最终答案。
问:为什么它更贵?因为它在"思考"时生成了大量内部 token,这些都算钱。想越久越贵。

🔁 5 天复习计划

天任务自检
第 1 天读①②,理清快慢思考与概念表说清 CoT 是什么
第 2 天读③④,跟一遍三个例子讲清 test-time compute
第 3 天做⑤折叠自测三题全对
第 4 天读⑥费曼三问,不看资料讲能举例
第 5 天名词速查 + 口诀默写脱稿说清 RL 怎么训
三句口诀① 慢思考先打草稿再给答案;② test-time 用算力换准确率;③ 难题才上推理模型,简单活别用。

📌 知识链路

前置知识先懂普通大语言模型是怎么对话、怎么生成文字的,再看"多想一步"带来的差别。
本节位置AI 新技术线的第 1 站:模型变"会想",后面多模态、长上下文都是在给它加感官和记忆。
下一步接着看原生多模态,理解它怎么从"认字"走到"看图听音"。
← 上一章 · Agent 架构 返回 AI 基础总览