关键词:热门话题 | 科技公司新闻 | 企业动态

2026年上半年,中美两家科技巨头在AI大模型领域相继推出重要迭代产品。Google DeepMind于2月19日发布Gemini 3.1 Pro Preview,阿里巴巴则在1月26日推出通义千问Qwen3-Max-Thinking。两款模型均代表了各自公司当前最强的技术能力,并在全球AI竞争格局中占据关键位置。
上线时间与发布背景
Google DeepMind的Gemini 3.1 Pro于2026年2月19日以Preview版本形式发布。这是Google首次采用".1"版本号跳跃来标注重大能力提升,此前Google通常以".5"作为中期重大改进的版本标识。Gemini 3 Pro于3月26日正式停止服务,Vertex AI文档明确要求所有项目迁移至Gemini 3.1 Pro Preview。
阿里巴巴的Qwen3-Max-Thinking于2026年1月26日正式发布,是通义千问系列的旗舰推理模型。该模型总参数规模超过1万亿,预训练数据量达36T Tokens。这是阿里通义实验室在2026年开年的首个重大模型发布。
Gemini 3.1 Pro功能特性
Gemini 3.1 Pro采用Mixture-of-Experts(MoE)架构,配备三层思考机制。其核心功能特性包括:
- 上下文窗口:1,048,576 tokens(1M)输入,65,536 tokens输出,可单次处理约750页PDF、8.4小时音频或1小时视频
- 原生多模态:同时支持文本、代码、图像、音频、视频五种模态,无需转录中间层
- 知识截止:2026年1月
- 代码执行:内置代码执行能力
- API定价:输入$2/百万tokens,输出$12/百万tokens
Qwen3-Max-Thinking功能特性
Qwen3-Max-Thinking的核心技术创新包括:
- 自适应工具调用:模型可自主判断并调用搜索引擎、代码解释器、记忆功能等外部工具
- 测试时扩展技术(Test-Time Scaling):通过多轮迭代式自我反思与经验提取,在相同上下文窗口内实现更高效的推理计算
- 参数规模:总参数超过1万亿
- 预训练数据:36T Tokens
- 平台接入:已上线Qwen Chat平台,同步开放API,阿里云百炼提供企业级API服务
Benchmark数据对比
| 基准测试 | Gemini 3.1 Pro | Qwen3-Max-Thinking | 测试维度 |
|---------|---------------|-------------------|---------|
| ARC-AGI-2(抽象推理) | 77.1% | — | 通用推理 |
| MMLU-Pro(知识) | 89.4% | — | 知识覆盖 |
| GPQA Diamond(博士级科学) | 88.2%-94.3% | 领先记录 | 科学推理 |
| SWE-Bench Verified(编程) | 80.6%-87.9% | — | 代码工程 |
| AIME 2025(数学) | 94.0% | 100%(预览期) | 数学推理 |
| LiveCodeBench(代码) | 75% | 优异成绩 | 代码编程 |
| Video-MME(视频QA) | 82.6% | — | 视频理解 |
| IMO-AnswerBench(数学) | — | 全球纪录 | 数学竞赛 |
Gemini 3.1 Pro在ARC-AGI-2抽象推理基准上得分77.1%,是上一代Gemini 3 Pro得分的两倍多。在GPQA Diamond博士级科学问题上,该模型以94.3%的得分领先所有商用模型。在Artificial Analysis Intelligence Index v4.0(2026年4月)中,Gemini 3.1 Pro与GPT-5.4并列第一(均为57分,评估覆盖339个模型)。
Qwen3-Max-Thinking在19项权威基准测试中实现领先性能。在AIME 25和HMMT 25等高难度数学推理测试中,预览阶段即实现100%准确率。在LiveCodeBench代码编程基准上取得优异成绩,在GPQA、HLE、IMO-AnswerBench等多项关键推理基准上超越Gemini 3 Pro。
市场定位与接入方式
Gemini 3.1 Pro面向Google AI Pro订阅用户($19.99/月)和Google AI Ultra订阅用户($249.99/月)开放,开发者可通过Google AI Studio和Vertex AI获取API访问权限。
Qwen3-Max-Thinking已在Qwen Chat平台上线,面向普通用户开放试用,企业用户可通过阿里云百炼平台获取API服务。千问APP也已接入该模型。
两款模型的技术路线差异
Gemini 3.1 Pro的核心优势在于原生多模态处理能力——可同时理解文本、图像、音频和视频输入,无需通过转录或其他中间转换步骤。其1M tokens的上下文窗口使其在长文档分析、代码库理解和视频内容处理方面具备优势。
Qwen3-Max-Thinking的核心创新集中在推理能力的深度优化上。其自适应工具调用能力允许模型在对话中自主选择并调用内置功能,无需用户手动干预。测试时扩展技术则通过在推理阶段动态分配额外计算资源,实现多轮自我迭代和经验提炼。
产业影响
Gemini 3.1 Pro的发布标志着Google在推理模型领域的重大进步,ARC-AGI-2得分77.1%是当时所有商用模型中的最高分。该模型与GPT-5.4并列Artificial Analysis Intelligence Index榜首,确立了Google在2026年上半年AI第一梯队的位置。
Qwen3-Max-Thinking的发布则代表了中国大模型在推理能力上的重要突破。阿里官方将其定位为"迄今为止最接近国际顶尖模型的国内AI大模型",在数学推理和编程能力上展现了与国际顶级模型竞争的实力。