Gemini 3.1 Pro
Gemini 3.1 专业版 · Google 谷歌 · 发布 2026-02-19 · Preview
Google 当前 Pro 旗舰(仍 preview),抽象推理第一。
- 类型
- 未披露
- 注意力
- 未披露
- 层数
- 未披露
- 专家
- 未披露
- 隐藏维
- 未披露
- 词表
- 未披露
未披露。延续 Gemini 3 系列的稀疏 MoE、原生多模态设计;支持 thinking_level 调节推理深度,另有 Deep Think 模式。
类型:未披露(Google 仅说明沿用 Gemini 3 系列的稀疏 MoE Transformer、原生多模态)。
已知:
- 输入:文本、图像、音频、视频、PDF;输出文本
- 1M token 上下文,64K 输出
thinking_level可调推理深度;Deep Think 模式另行提供- 托管工具:Google Search grounding、代码执行、URL 上下文
- 官方称相较 Gemini 3 Pro 在同等任务上 token 消耗更低
参考:Gemini 3.1 Pro 模型卡(deepmind.google/models/model-cards/gemini-3-1-pro/)。
闭源模型,无自建选项,不提供显存表。
无自建选项。
成本参考(2026-08-28 定价页):
| 档位 | 输入 $/M | 输出 $/M |
|---|---|---|
| 标准 ≤200K | 2.00 | 12.00 |
| 标准 >200K | 4.00 | 18.00 |
| Batch / Flex ≤200K | 1.00 | 6.00 |
| Priority ≤200K | 3.60 | 21.60 |
缓存输入 $0.20(≤200K)/ $0.40(>200K)。
警示:单次 1M 上下文请求输入费可达 $4,务必配合 context caching;高 thinking_level 下输出 token 消耗显著。
编程SWE-bench Verified 80.6%、LiveCodeBench Pro Elo 2887、Terminal-Bench 2.0 68.5%(官方模型卡)。
推理GPQA Diamond 94.3%、HLE 44.4%(无工具)、ARC-AGI-2 77.1%(官方)。
数学AIME 2025 官方未单列;官方以 ARC-AGI-2 与 HLE 为主。
Agenttau2-bench 零售 90.8% / 电信 99.3%、BrowseComp 85.9%、APEX-Agents 33.5%(官方)。
多模态MMMU-Pro 80.5%(官方)。
中文MMMLU 92.6%(官方),中文能力强。
考试型推理顶级:HLE 无工具 44.4%(带搜索 + 代码 51.4%)、GPQA 94.3%、ARC-AGI-2 77.1%。工程型推理由 Gemini 3 Pro 的 76.2% 提升到 80.6%(SWE-bench Verified),tau2-bench 零售 90.8% / 电信 99.3%,agent 可靠性显著改善。长程 agent 任务(APEX-Agents 33.5%)仍是短板。失败模式:超长上下文里中段信息偶有遗漏;工具调用格式偶有偏差;高 thinking_level 下 token 消耗大。
- 1.ARC-AGI-2 77.1%、GPQA Diamond 94.3%,考试型推理与抽象推理第一梯队
- 2.SWE-bench Verified 80.6%、Terminal-Bench 2.0 68.5%,工程与 agent 能力较 Gemini 3 Pro 大幅提升
- 3.1M 上下文 + 原生音视频输入,MRCR v2 128K 84.9%
- 1.发布半年仍是 preview 接口,无 GA 承诺,配额与行为可能调整
- 2.>200K 上下文价格翻倍,1M 是能力上限不是默认预算
- 3.首 token 延迟高(AA 实测 TTFT 约 24 s),不适合交互式低延迟场景
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LMArena Text Elo人类偏好 Elo | 1487 | LMArena Text (style control) | 2026-08-28 | 独立复测 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 48 | Artificial Analysis Intelligence Index v3 | 2026-08-28 | 独立复测 |
| SWE-bench Verified真实仓库修 bug | 80.6% | Google 官方模型页 | 2026-08-28 | 厂商公布 |
| GPQA Diamond研究生级科学问答 | 94.3% | Google 官方模型页 | 2026-08-28 | 厂商公布 |
| Humanity's Last Exam人类最后考试 | 44.4% | Google 官方模型页 | 2026-08-28 | 厂商公布 |
| Terminal-Bench终端 agent | 68.5% | Google 官方模型页 | 2026-08-28 | 厂商公布 |
| MMMU多模态理解 | 80.5% | Google 官方模型页 | 2026-08-28 | 厂商公布 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 48 | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| GPQA Diamond研究生级科学问答 | 94.1% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Humanity's Last Exam人类最后考试 | 47% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| SciCode科学计算编程 | 58.9% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench Hard终端 agent(AA 困难子集) | 53.8% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| τ²-Bench Telecom工具调用 agent(电信域) | 95.6% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| MMMU-Pro多模态理解(Pro) | 82.4% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| IFBench指令遵循 | 77.1% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench终端 agent | 73.8% | Artificial Analysis · Terminal-Bench 2.1 | 2026-08-28 | 独立复测 |
| τ³-Bench Banking工具调用 agent(银行域) | 21.4% | Artificial Analysis · τ³-Bench Banking | 2026-08-28 | 独立复测 |
| LMArena Chinese Elo中文人类偏好 Elo | 1531 | LMArena Text · Chinese (style control) | 2026-08-28 | 独立复测 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。