谷歌Gemini 2.0突然上线,多模态能力碾压GPT-4o

2026-07-19

谷歌Gemini 2.0突然上线,多模态能力碾压GPT-4o


谷歌毫无预警地发布了Gemini 2.0,这次更新在多模态能力上实现了质的飞跃。与之前版本相比,Gemini 2.0在图像理解、视频分析、音频处理等方面都有显著提升,多家第三方评测机构的数据显示其综合表现已超过GPT-4o。


最引人注目的是Gemini 2.0的原生多模态能力。此前的多模态模型大多是分别训练不同模态的模块然后拼接在一起,而Gemini 2.0从训练初期就同时处理文本、图像、音频和视频数据。这种训练方式让模型能够真正理解不同模态之间的关联,而不是简单地将它们分别处理。


在实际测试中,Gemini 2.0展现出了令人印象深刻的能力。比如,用户上传一段篮球比赛视频,模型不仅能识别出球员和动作,还能分析战术配合、预测下一步动作,甚至生成比赛解说词。这种深度理解能力在之前的模型中是难以见到的。


谷歌同时大幅降低了Gemini 2.0的API价格,输入token价格比上一代降低了50%。这一策略显然是在与OpenAI打价格战,吸引更多开发者从GPT-4迁移到Gemini。谷歌云CEO Thomas Kurian在发布会上表示,谷歌的目标是让所有开发者都能用上最先进的AI能力。


不过,也有评测者指出Gemini 2.0在某些特定任务上仍然存在不足。比如在需要精确推理的数学问题上,GPT-4o的表现仍然略胜一筹。此外,Gemini 2.0在处理中文内容时的表现虽然比前代有进步,但与国内大模型相比仍有差距。


谷歌表示将在未来几周内逐步向更多用户开放Gemini 2.0,开发者可以通过Google AI Studio和Vertex AI平台申请访问。

分享
写评论...