Google TPU v6:自研芯片支撑Gemini训练

2026-06-30
  • Google TPU v6:自研芯片支撑Gemini训练
  • 关键词:最新快讯 | 芯片 | 算力



    Google于2025年5月在Google I/O开发者大会上正式发布了第六代张量处理单元(TPU v6),代号"Trillium"。作为Google Cloud AI基础设施的核心组件,TPU v6在训练和推理性能上均实现了大幅提升,为Gemini系列大模型的持续迭代提供了底层算力支撑。

    TPU v6采用台积电4纳米制程工艺,单芯片峰值算力在BF16精度下达到2.5 petaFLOPS,较TPU v5的1.1 petaFLOPS提升超过2倍。Google通过重新设计矩阵乘法单元(MXU)和增加片上高带宽内存(HBM)容量来实现这一性能跃升。每颗TPU v6配备64GB HBM3显存,带宽达到2.8TB/s,可以更高效地处理参数规模不断增长的AI模型。

    在架构层面,TPU v6引入了稀疏计算加速功能。该功能可以自动识别神经网络中的稀疏权重和激活值,跳过零值计算,从而在实际工作负载中实现最高2倍的等效性能提升。对于大型语言模型中常见的注意力机制,TPU v6还增加了专用的Softmax和LayerNorm硬件加速器,减少了这些操作对通用计算资源的占用。

    互联技术是TPU v6的另一项重要升级。Google为其定制了名为"Inter-Chip Interconnect"(ICI)的高速通信链路,单链路带宽达到100Gbps,每颗芯片提供64个ICI端口。通过ICI网络,最多4096颗TPU v6可以组成一个超大规模计算集群,协同完成万亿参数模型的训练任务。Google表示,在TPU v6集群上训练Gemini Ultra级别的模型,所需时间较TPU v5集群减少约55%。

    在推理优化方面,TPU v6支持动态批处理和请求合并功能。这些特性使得TPU v6在处理高并发的在线推理请求时,可以更高效地利用计算资源,降低每个请求的平均延迟。Google Cloud的测试数据显示,在Gemini Pro模型的推理任务中,TPU v6的每美元性能较TPU v5提升约3倍。

    Google将TPU v6作为其AI战略的核心差异化要素。与向所有客户开放的NVIDIA GPU不同,TPU v6目前主要提供给Google Cloud的客户使用,且与Google的AI开发工具深度绑定。通过Vertex AI平台,开发者可以便捷地在TPU v6上训练和部署模型,无需关心底层硬件的细节。

    Google DeepMind首席科学家Jeff Dean在技术博客中表示,TPU v6的设计充分考虑了下一代AI模型的计算需求,特别是多模态模型和超长上下文模型的特点。Google正在开发的Gemini 2系列模型将充分利用TPU v6的稀疏计算和大规模集群训练能力。

    TPU v6已于2025年第二季度在Google Cloud的部分区域上线,预计第三季度实现全球可用。Google还宣布,到2026年底将在印第安纳州和弗吉尼亚州新建两座大型数据中心,专门用于部署TPU v6集群,总投资额超过100亿美元。

    分享
    写评论...