闭源仅 API推理模型多模态已被替代可商用 · Proprietary
Google logo

Gemini 3 Pro

Gemini 3 专业版 · Google 谷歌 · 发布 2025-11-18 · 已被替代Gemini 3.1 Pro

2025 年底榜单第一的多模态旗舰,1M 上下文。

参数
未披露
上下文
1M
输出 64K
价格 / 1M tok
$2.00 / $12
Google AI 定价页 · 2025-12-20
API 速度
API
无自建选项
Arena Elo1501
2025-12-20
AA 综合指数
真实仓库修 bug76.2
2025-12-20
GPQA 推理91.9
2025-12-20
类型
未披露
注意力
未披露
层数
未披露
专家
未披露
隐藏维
未披露
词表
未披露

未披露。Google 仅说明为稀疏 MoE Transformer,原生多模态。thinking_level 参数(low / high)。

类型:稀疏 MoE Transformer(Google 官方描述),细节未披露。

已知:

  • 原生多模态:文本、图像、音频、视频统一输入
  • 1M token 上下文,64K 输出
  • thinking_level:low / high
  • 支持 Google Search grounding、代码执行、URL 上下文等托管工具
Token Embedding未披露× ? 层注意力(未披露)FFN / MoE(未披露)厂商未公开内部结构LM Head参数未披露实线 = 已公开 · 虚线 = 未披露

闭源模型,无自建选项,不提供显存表。

无自建选项。

成本参考:≤200K 上下文 $2 / $12;>200K $4 / $18。缓存输入 $0.20。

警示:1M 上下文下一次请求输入费可达 $4;请配合 context caching。

编程SWE-bench Verified 76.2%、LiveCodeBench Pro Elo 2439(官方)。

推理GPQA 91.9%、HLE 37.5%、ARC-AGI-2 31.1%(官方)。

数学AIME 2025 95%(无工具,官方)。

AgentTerminal-bench 2.0 54.2%(官方)。

多模态MMMU-Pro 81%、Video-MMMU 87.6%(官方),当前最强。

中文中文能力强,多语言 MMMLU 91.8%。

逻辑能力

考试型推理当前第一:HLE、GPQA、ARC-AGI-2 均领先。工程型推理(SWE-bench 76.2%)优秀但非第一。thinking_level=high 时会做大量内部搜索式推理;low 更接近 Flash 行为。失败模式:在极长上下文里偶尔遗漏中段信息;工具调用格式偶有偏差。

亮点
  1. 1.LMArena 文本榜首次突破 1500 Elo
  2. 2.HLE 37.5%、GPQA 91.9%,考试型推理断层领先
  3. 3.原生视频 / 音频 / 图像输入 + 1M 上下文,长多模态任务无对手
  1. 1.preview 状态,接口行为与配额可能变动
  2. 2.超过 200K 上下文后价格翻倍,1M 是能力不是默认预算
  3. 3.Agent 长任务稳定性略逊于 Claude Opus 4.5(Terminal-bench / tau2 差距)
适合:视频 / 音频 / 大量图片理解 · 超长文档(百万 token 级)分析 · 科学 / 数学推理
不适合:需要稳定 GA 接口的生产线(等 GA) · 私有化部署
基准分数来源日期证据
LMArena Text Elo人类偏好 Elo1501LMArena Text (style control)2025-12-20独立复测
SWE-bench Verified真实仓库修 bug76.2%Google 官方模型页2025-12-20厂商公布
GPQA Diamond研究生级科学问答91.9%Google 官方模型页2025-12-20厂商公布
Humanity's Last Exam人类最后考试37.5%Google 官方模型页2025-12-20厂商公布
AIME 2025美国数学邀请赛95%Google 官方模型页2025-12-20厂商公布
τ²-bench工具调用 agent85.4%Google 官方模型页2025-12-20厂商公布
Terminal-Bench终端 agent54.2%Google 官方模型页2025-12-20厂商公布
MMMU多模态理解81%Google 官方模型页2025-12-20厂商公布
LMArena Chinese Elo中文人类偏好 Elo1490LMArena Text · Chinese2025-12-20独立复测

更新 2025-12-20 · 排名供选型参考,基准会饱和、会泄漏、会过时。