Google Gemini 2.5 Pro与百度文心5.0代码能力实测对比

2026-06-21
  • Google Gemini 2.5 Pro与百度文心5.0代码能力实测对比
  • 关键词:工具精选 | 产品实验室 | 人工智能工具



    Google Gemini 2.5 Pro于2025年发布,是Google DeepMind的旗舰大模型之一。百度文心5.0正式版于2026年1月22日发布,是百度原生全模态大模型的最新版本。以下从多个公开基准测试维度整理两款模型的数据。



    | 参数项 | Gemini 2.5 Pro | 百度文心5.0 |
    |--------|---------------|-------------|
    | 发布日期 | 2025年 | 2026年1月22日 |
    | 参数规模 | 未公开 | 2.4万亿(超稀疏MoE架构) |
    | 上下文窗口 | 100万tokens(API支持200万tokens) | 未公开具体数值 |
    | 架构类型 | 专有闭源 | 超稀疏混合专家架构,激活参数比<3% |
    | API定价(输入) | 1.25美元/百万tokens | 通过百度千帆平台调用 |
    | API定价(输出) | 10美元/百万tokens | 通过百度千帆平台调用 |



    SWE-bench Verified是评估AI模型自主修复真实GitHub问题的行业标准基准。

    | 模型 | SWE-bench Verified得分 |
    |------|----------------------|
    | Gemini 2.5 Pro | 约63%-68.9%(不同评测来源) |
    | 文心5.0 | 百度官方未公布该基准具体分数 |

    注:在同一基准中,Claude Sonnet 4.6得分72.7%-82.1%,Claude Opus 4.6得分80.8%,GPT-4.1得分约54%,供横向参考。



    HumanEval测试模型从函数描述生成正确代码的能力。

    | 模型 | HumanEval得分 |
    |------|-------------|
    | Gemini 2.5 Pro | 87.2%-93.7%(不同评测来源) |
    | 文心5.0 | 百度官方未公布该基准具体分数 |
    | 文心ERNIE-Code(历史版本) | 英文HumanEval 49.8%,HumanEval-CN 56.7% |



    根据BenchLM.ai 2026年6月的综合评测数据:

    | 指标 | Gemini 2.5 Pro |
    |------|---------------|
    | 综合排名 | 第50名/124个模型 |
    | 综合得分 | 63分/100分 |
    | Agentic排名 | 第32名,得分57.2 |
    | 编码类别排名 | 第61名,得分48.5 |
    | 推理排名 | 第37名,得分59.0 |
    | 知识排名 | 第46名,得分64.9 |
    | 数学排名 | 第30名,得分73.5 |
    | 多语言排名 | 第34名,得分68.9 |
    | 多模态排名 | 第13名,得分85.2 |
    | 指令遵循排名 | 第71名,得分59.0 |

    文心5.0在LMArena全球大模型竞技场文本榜以1460分位列国内第一、全球第八(2026年1月15日数据),超过GPT-5.1-High、Gemini-2.5-Pro等模型。



    | 指标 | Gemini 2.5 Pro |
    |------|---------------|
    | 文本综合 | 1446分(124,473票) |
    | 编码 | 1465分(26,514票) |
    | 数学 | 1442分(7,638票) |
    | 指令遵循 | 1440分(34,211票) |



    百度在文心5.0发布会现场展示了以下代码能力:输入一段博主复刻App的教程视频,文心5.0自动拆解步骤、理解核心交互逻辑,并生成可运行的前端代码。

    文心5.0的代码能力主要面向以下场景:
    - Python、Java等主流语言的代码生成与Debug
    - 从视频内容理解并生成代码
    - 代码解释与优化建议



    | 基准测试 | Gemini 2.5 Pro | 文心5.0 |
    |---------|---------------|---------|
    | 百度官方40余项基准综合 | &mdash; | 超越GPT-5-High、Gemini-2.5-Pro |
    | MMLU | 91.8%(部分来源) | 未公开具体分数 |
    | GPQA | 83.7% | 未公开具体分数 |
    | MATH | 97.1%(部分来源) | 未公开具体分数 |
    | LiveCodeBench | 参与测试 | 未公开具体分数 |
    | Terminal-Bench 2.0 | 参与测试 | 未公开具体分数 |

    注:文心5.0官方发布信息中提及在40余项权威基准测试中综合表现超越GPT-5-High和Gemini-2.5-Pro,但未公布各项基准的详细得分。文心快码(基于文心大模型的编程工具)的个人版可免费使用,企业版需付费订阅。

分享
写评论...