闭源仅 API推理模型多模态已被替代可商用 · Proprietary
Gemini 3 Pro
Gemini 3 专业版 · Google 谷歌 · 发布 2025-11-18 · 已被替代 → Gemini 3.1 Pro
2025 年底榜单第一的多模态旗舰,1M 上下文。
参数
未披露
上下文
1M
输出 64K
价格 / 1M tok
$2.00 / $12
Google AI 定价页 · 2025-12-20
API 速度
API
无自建选项
Arena Elo1501
2025-12-20
AA 综合指数—
真实仓库修 bug76.2
2025-12-20
GPQA 推理91.9
2025-12-20
架构简图
- 类型
- 未披露
- 注意力
- 未披露
- 层数
- 未披露
- 专家
- 未披露
- 隐藏维
- 未披露
- 词表
- 未披露
未披露。Google 仅说明为稀疏 MoE Transformer,原生多模态。thinking_level 参数(low / high)。
类型:稀疏 MoE Transformer(Google 官方描述),细节未披露。
已知:
- 原生多模态:文本、图像、音频、视频统一输入
- 1M token 上下文,64K 输出
thinking_level:low / high- 支持 Google Search grounding、代码执行、URL 上下文等托管工具
闭源模型,无自建选项,不提供显存表。
无自建选项。
成本参考:≤200K 上下文 $2 / $12;>200K $4 / $18。缓存输入 $0.20。
警示:1M 上下文下一次请求输入费可达 $4;请配合 context caching。
编程SWE-bench Verified 76.2%、LiveCodeBench Pro Elo 2439(官方)。
推理GPQA 91.9%、HLE 37.5%、ARC-AGI-2 31.1%(官方)。
数学AIME 2025 95%(无工具,官方)。
AgentTerminal-bench 2.0 54.2%(官方)。
多模态MMMU-Pro 81%、Video-MMMU 87.6%(官方),当前最强。
中文中文能力强,多语言 MMMLU 91.8%。
逻辑能力
考试型推理当前第一:HLE、GPQA、ARC-AGI-2 均领先。工程型推理(SWE-bench 76.2%)优秀但非第一。thinking_level=high 时会做大量内部搜索式推理;low 更接近 Flash 行为。失败模式:在极长上下文里偶尔遗漏中段信息;工具调用格式偶有偏差。
亮点
- 1.LMArena 文本榜首次突破 1500 Elo
- 2.HLE 37.5%、GPQA 91.9%,考试型推理断层领先
- 3.原生视频 / 音频 / 图像输入 + 1M 上下文,长多模态任务无对手
坑
- 1.preview 状态,接口行为与配额可能变动
- 2.超过 200K 上下文后价格翻倍,1M 是能力不是默认预算
- 3.Agent 长任务稳定性略逊于 Claude Opus 4.5(Terminal-bench / tau2 差距)
适合:视频 / 音频 / 大量图片理解 · 超长文档(百万 token 级)分析 · 科学 / 数学推理
不适合:需要稳定 GA 接口的生产线(等 GA) · 私有化部署
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LMArena Text Elo人类偏好 Elo | 1501 | LMArena Text (style control) | 2025-12-20 | 独立复测 |
| SWE-bench Verified真实仓库修 bug | 76.2% | Google 官方模型页 | 2025-12-20 | 厂商公布 |
| GPQA Diamond研究生级科学问答 | 91.9% | Google 官方模型页 | 2025-12-20 | 厂商公布 |
| Humanity's Last Exam人类最后考试 | 37.5% | Google 官方模型页 | 2025-12-20 | 厂商公布 |
| AIME 2025美国数学邀请赛 | 95% | Google 官方模型页 | 2025-12-20 | 厂商公布 |
| τ²-bench工具调用 agent | 85.4% | Google 官方模型页 | 2025-12-20 | 厂商公布 |
| Terminal-Bench终端 agent | 54.2% | Google 官方模型页 | 2025-12-20 | 厂商公布 |
| MMMU多模态理解 | 81% | Google 官方模型页 | 2025-12-20 | 厂商公布 |
| LMArena Chinese Elo中文人类偏好 Elo | 1490 | LMArena Text · Chinese | 2025-12-20 | 独立复测 |
更新 2025-12-20 · 排名供选型参考,基准会饱和、会泄漏、会过时。