关键词:工具精选 | 产品实验室 | 人工智能工具

Google Gemini 2.5 Pro于2025年发布,是Google DeepMind的旗舰大模型之一。百度文心5.0正式版于2026年1月22日发布,是百度原生全模态大模型的最新版本。以下从多个公开基准测试维度整理两款模型的数据。
| 参数项 | Gemini 2.5 Pro | 百度文心5.0 |
|--------|---------------|-------------|
| 发布日期 | 2025年 | 2026年1月22日 |
| 参数规模 | 未公开 | 2.4万亿(超稀疏MoE架构) |
| 上下文窗口 | 100万tokens(API支持200万tokens) | 未公开具体数值 |
| 架构类型 | 专有闭源 | 超稀疏混合专家架构,激活参数比<3% |
| API定价(输入) | 1.25美元/百万tokens | 通过百度千帆平台调用 |
| API定价(输出) | 10美元/百万tokens | 通过百度千帆平台调用 |
SWE-bench Verified是评估AI模型自主修复真实GitHub问题的行业标准基准。
| 模型 | SWE-bench Verified得分 |
|------|----------------------|
| Gemini 2.5 Pro | 约63%-68.9%(不同评测来源) |
| 文心5.0 | 百度官方未公布该基准具体分数 |
注:在同一基准中,Claude Sonnet 4.6得分72.7%-82.1%,Claude Opus 4.6得分80.8%,GPT-4.1得分约54%,供横向参考。
HumanEval测试模型从函数描述生成正确代码的能力。
| 模型 | HumanEval得分 |
|------|-------------|
| Gemini 2.5 Pro | 87.2%-93.7%(不同评测来源) |
| 文心5.0 | 百度官方未公布该基准具体分数 |
| 文心ERNIE-Code(历史版本) | 英文HumanEval 49.8%,HumanEval-CN 56.7% |
根据BenchLM.ai 2026年6月的综合评测数据:
| 指标 | Gemini 2.5 Pro |
|------|---------------|
| 综合排名 | 第50名/124个模型 |
| 综合得分 | 63分/100分 |
| Agentic排名 | 第32名,得分57.2 |
| 编码类别排名 | 第61名,得分48.5 |
| 推理排名 | 第37名,得分59.0 |
| 知识排名 | 第46名,得分64.9 |
| 数学排名 | 第30名,得分73.5 |
| 多语言排名 | 第34名,得分68.9 |
| 多模态排名 | 第13名,得分85.2 |
| 指令遵循排名 | 第71名,得分59.0 |
文心5.0在LMArena全球大模型竞技场文本榜以1460分位列国内第一、全球第八(2026年1月15日数据),超过GPT-5.1-High、Gemini-2.5-Pro等模型。
| 指标 | Gemini 2.5 Pro |
|------|---------------|
| 文本综合 | 1446分(124,473票) |
| 编码 | 1465分(26,514票) |
| 数学 | 1442分(7,638票) |
| 指令遵循 | 1440分(34,211票) |
百度在文心5.0发布会现场展示了以下代码能力:输入一段博主复刻App的教程视频,文心5.0自动拆解步骤、理解核心交互逻辑,并生成可运行的前端代码。
文心5.0的代码能力主要面向以下场景:
- Python、Java等主流语言的代码生成与Debug
- 从视频内容理解并生成代码
- 代码解释与优化建议
| 基准测试 | Gemini 2.5 Pro | 文心5.0 |
|---------|---------------|---------|
| 百度官方40余项基准综合 | — | 超越GPT-5-High、Gemini-2.5-Pro |
| MMLU | 91.8%(部分来源) | 未公开具体分数 |
| GPQA | 83.7% | 未公开具体分数 |
| MATH | 97.1%(部分来源) | 未公开具体分数 |
| LiveCodeBench | 参与测试 | 未公开具体分数 |
| Terminal-Bench 2.0 | 参与测试 | 未公开具体分数 |
注:文心5.0官方发布信息中提及在40余项权威基准测试中综合表现超越GPT-5-High和Gemini-2.5-Pro,但未公布各项基准的详细得分。文心快码(基于文心大模型的编程工具)的个人版可免费使用,企业版需付费订阅。