Thinking / 推理模型与普通指令模型
推理模型先写一段思维链再回答;分数更高,但延迟、成本、过度思考都是代价。
三种模式
| 模式 | 例子 | 行为 |
|---|---|---|
| 无思考 | Gemma 3、Kimi K2-0905、Llama 4 | 直接回答,最快 |
| 可开关 | Claude 4.5、Qwen3-32B、GLM-4.6、DeepSeek-V3.2 | 同一权重,按请求决定是否思考 |
| 默认开 / 不可关 | GPT-5、Qwen3-*-Thinking-2507、Kimi K2 Thinking | 总是先想 |
思考带来什么
- 考试型推理(AIME、GPQA、HLE)大幅提升:Qwen3-32B 开思考后 AIME 从 ~20% 到 72.9%。
- 工程型推理(SWE-bench、Terminal-bench)提升较温和,更依赖 agent 训练与工具使用。
- 成本:思考 token 按输出计费。GPT-5 high effort 一条复杂请求可能产生 10K+ 隐藏 token。
- 延迟:首 token 时间从几百毫秒变成几秒到几十秒。
常见坑
- 过度思考:Qwen3-235B-Thinking 对「1+1」也会写几百 token。简单任务用 Instruct 版或 effort=low。
- 思维链不可见(GPT-5、Gemini):调试推理错误只能看摘要。
- 交错思考(Kimi K2 Thinking、MiniMax-M2、Claude):思考与工具调用交替,多轮时必须回传历史思考内容,否则质量崩。
- 蒸馏版:小模型的思考能力往往是从大模型蒸馏的,考试分好看,泛化弱。
本站怎么标
详情顶栏的「推理模型」徽章 + 「可关」后缀;「训练与推理行为」节写默认状态与开关方式。