闭源仅 API推理模型多模态Preview可商用 · Proprietary
Google logo

Gemini 3.1 Pro

Gemini 3.1 专业版 · Google 谷歌 · 发布 2026-02-19 · Preview

Google 当前 Pro 旗舰(仍 preview),抽象推理第一。

参数
未披露
上下文
1M
输出 64K
价格 / 1M tok
$2.00 / $12
Google AI 定价页 · 2026-08-28
API 速度
API ≈115 tok/s
首 token 23.93s · Artificial Analysis
Arena Elo1487
2026-08-28
AA 综合指数48
2026-08-28
真实仓库修 bug80.6
2026-08-28
GPQA 推理94.1
2026-08-28
类型
未披露
注意力
未披露
层数
未披露
专家
未披露
隐藏维
未披露
词表
未披露

未披露。延续 Gemini 3 系列的稀疏 MoE、原生多模态设计;支持 thinking_level 调节推理深度,另有 Deep Think 模式。

类型:未披露(Google 仅说明沿用 Gemini 3 系列的稀疏 MoE Transformer、原生多模态)。

已知:

  • 输入:文本、图像、音频、视频、PDF;输出文本
  • 1M token 上下文,64K 输出
  • thinking_level 可调推理深度;Deep Think 模式另行提供
  • 托管工具:Google Search grounding、代码执行、URL 上下文
  • 官方称相较 Gemini 3 Pro 在同等任务上 token 消耗更低

参考:Gemini 3.1 Pro 模型卡(deepmind.google/models/model-cards/gemini-3-1-pro/)。

Token Embedding未披露× ? 层注意力(未披露)FFN / MoE(未披露)厂商未公开内部结构LM Head参数未披露实线 = 已公开 · 虚线 = 未披露

闭源模型,无自建选项,不提供显存表。

无自建选项。

成本参考(2026-08-28 定价页):

档位输入 $/M输出 $/M
标准 ≤200K2.0012.00
标准 >200K4.0018.00
Batch / Flex ≤200K1.006.00
Priority ≤200K3.6021.60

缓存输入 $0.20(≤200K)/ $0.40(>200K)。

警示:单次 1M 上下文请求输入费可达 $4,务必配合 context caching;高 thinking_level 下输出 token 消耗显著。

编程SWE-bench Verified 80.6%、LiveCodeBench Pro Elo 2887、Terminal-Bench 2.0 68.5%(官方模型卡)。

推理GPQA Diamond 94.3%、HLE 44.4%(无工具)、ARC-AGI-2 77.1%(官方)。

数学AIME 2025 官方未单列;官方以 ARC-AGI-2 与 HLE 为主。

Agenttau2-bench 零售 90.8% / 电信 99.3%、BrowseComp 85.9%、APEX-Agents 33.5%(官方)。

多模态MMMU-Pro 80.5%(官方)。

中文MMMLU 92.6%(官方),中文能力强。

逻辑能力

考试型推理顶级:HLE 无工具 44.4%(带搜索 + 代码 51.4%)、GPQA 94.3%、ARC-AGI-2 77.1%。工程型推理由 Gemini 3 Pro 的 76.2% 提升到 80.6%(SWE-bench Verified),tau2-bench 零售 90.8% / 电信 99.3%,agent 可靠性显著改善。长程 agent 任务(APEX-Agents 33.5%)仍是短板。失败模式:超长上下文里中段信息偶有遗漏;工具调用格式偶有偏差;高 thinking_level 下 token 消耗大。

亮点
  1. 1.ARC-AGI-2 77.1%、GPQA Diamond 94.3%,考试型推理与抽象推理第一梯队
  2. 2.SWE-bench Verified 80.6%、Terminal-Bench 2.0 68.5%,工程与 agent 能力较 Gemini 3 Pro 大幅提升
  3. 3.1M 上下文 + 原生音视频输入,MRCR v2 128K 84.9%
  1. 1.发布半年仍是 preview 接口,无 GA 承诺,配额与行为可能调整
  2. 2.>200K 上下文价格翻倍,1M 是能力上限不是默认预算
  3. 3.首 token 延迟高(AA 实测 TTFT 约 24 s),不适合交互式低延迟场景
适合:科学 / 数学 / 抽象推理 · 视频 / 音频 / 大量图片理解 · 百万 token 级长文档分析
不适合:需要 GA 接口与 SLA 的生产线 · 低延迟对话产品 · 私有化部署
基准分数来源日期证据
LMArena Text Elo人类偏好 Elo1487LMArena Text (style control)2026-08-28独立复测
Artificial Analysis Intelligence IndexAA 综合指数48Artificial Analysis Intelligence Index v32026-08-28独立复测
SWE-bench Verified真实仓库修 bug80.6%Google 官方模型页2026-08-28厂商公布
GPQA Diamond研究生级科学问答94.3%Google 官方模型页2026-08-28厂商公布
Humanity's Last Exam人类最后考试44.4%Google 官方模型页2026-08-28厂商公布
Terminal-Bench终端 agent68.5%Google 官方模型页2026-08-28厂商公布
MMMU多模态理解80.5%Google 官方模型页2026-08-28厂商公布
Artificial Analysis Intelligence IndexAA 综合指数48Artificial Analysis (v4.1.1)2026-08-28独立复测
GPQA Diamond研究生级科学问答94.1%Artificial Analysis (v4.1.1)2026-08-28独立复测
Humanity's Last Exam人类最后考试47%Artificial Analysis (v4.1.1)2026-08-28独立复测
SciCode科学计算编程58.9%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench Hard终端 agent(AA 困难子集)53.8%Artificial Analysis (v4.1.1)2026-08-28独立复测
τ²-Bench Telecom工具调用 agent(电信域)95.6%Artificial Analysis (v4.1.1)2026-08-28独立复测
MMMU-Pro多模态理解(Pro)82.4%Artificial Analysis (v4.1.1)2026-08-28独立复测
IFBench指令遵循77.1%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench终端 agent73.8%Artificial Analysis · Terminal-Bench 2.12026-08-28独立复测
τ³-Bench Banking工具调用 agent(银行域)21.4%Artificial Analysis · τ³-Bench Banking2026-08-28独立复测
LMArena Chinese Elo中文人类偏好 Elo1531LMArena Text · Chinese (style control)2026-08-28独立复测

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。