架构图鉴

Thinking / 推理模型与普通指令模型

推理模型先写一段思维链再回答;分数更高,但延迟、成本、过度思考都是代价。

三种模式

模式例子行为
无思考Gemma 3、Kimi K2-0905、Llama 4直接回答,最快
可开关Claude 4.5、Qwen3-32B、GLM-4.6、DeepSeek-V3.2同一权重,按请求决定是否思考
默认开 / 不可关GPT-5、Qwen3-*-Thinking-2507、Kimi K2 Thinking总是先想

思考带来什么

  • 考试型推理(AIME、GPQA、HLE)大幅提升:Qwen3-32B 开思考后 AIME 从 ~20% 到 72.9%。
  • 工程型推理(SWE-bench、Terminal-bench)提升较温和,更依赖 agent 训练与工具使用。
  • 成本:思考 token 按输出计费。GPT-5 high effort 一条复杂请求可能产生 10K+ 隐藏 token。
  • 延迟:首 token 时间从几百毫秒变成几秒到几十秒。

常见坑

  1. 过度思考:Qwen3-235B-Thinking 对「1+1」也会写几百 token。简单任务用 Instruct 版或 effort=low。
  2. 思维链不可见(GPT-5、Gemini):调试推理错误只能看摘要。
  3. 交错思考(Kimi K2 Thinking、MiniMax-M2、Claude):思考与工具调用交替,多轮时必须回传历史思考内容,否则质量崩。
  4. 蒸馏版:小模型的思考能力往往是从大模型蒸馏的,考试分好看,泛化弱。

本站怎么标

详情顶栏的「推理模型」徽章 + 「可关」后缀;「训练与推理行为」节写默认状态与开关方式。