关键词:热门话题 | 芯片 | 算力
NVIDIA于2025年3月在其年度GTC大会上正式发布了基于Blackwell Ultra架构的新一代AI加速芯片。这一架构作为Blackwell系列的增强版本,在制程工艺、内存带宽和计算密度三个核心维度实现了显著升级,进一步巩固了NVIDIA在数据中心AI加速器市场的领先地位。
Blackwell Ultra架构采用台积电4纳米增强型制程工艺,晶体管数量达到2080亿个,相比上一代Hopper架构的800亿晶体管实现了翻倍以上的增长。芯片封装方面,NVIDIA继续采用Chiplet设计理念,将两个独立制造的计算裸片通过NVLink-HBI(High Bandwidth Interface)技术互联,形成一个统一的逻辑GPU。这种设计在保证良品率的同时,有效提升了芯片的集成度和计算密度。
在计算性能方面,Blackwell Ultra引入了第五代Tensor Core,支持FP4和FP6精度格式。在FP4精度下,单芯片的峰值算力达到20 petaFLOPS,相比Hopper架构提升约4倍。这一性能提升对于大规模语言模型的推理和训练具有重要意义,因为低精度计算可以在保持模型精度的前提下,大幅降低显存占用和计算延迟。此外,Blackwell Ultra还新增了微张量缩放(Micro-Tensor Scaling)技术,通过更细粒度的数值范围调整,进一步优化了低精度计算的稳定性。
内存子系统是Blackwell Ultra的另一大升级点。该架构搭载了新一代HBM3e高带宽显存,单芯片显存容量提升至288GB,带宽达到8TB/s。更大的显存容量使得单张GPU可以加载参数规模更大的AI模型,减少了多卡并行时的通信开销。对于当前主流的大语言模型,如GPT-4级别的万亿参数模型,Blackwell Ultra可以在较少的GPU数量下完成全量微调任务。
能效比方面,Blackwell Ultra在每瓦性能指标上较前代提升了约2.5倍。NVIDIA通过动态电压频率调整(DVFS)技术和更精细的电源门控设计,使芯片在不同负载场景下都能保持较高的能源利用效率。这一改进对于数据中心运营商而言具有直接的经济价值,因为电力成本在AI训练集群的总拥有成本中占比持续上升。
在软件生态方面,Blackwell Ultra完整支持NVIDIA的CUDA、TensorRT和Triton推理服务器等开发工具链。NVIDIA表示,现有的CUDA应用程序可以通过重新编译在Blackwell Ultra上运行,无需进行大规模的代码重构。这一向后兼容性降低了用户迁移至新硬件的技术门槛。
Blackwell Ultra系列芯片预计于2025年下半年正式出货,首批客户包括微软Azure、Google Cloud和亚马逊AWS等主要云服务商。NVIDIA创始人兼CEO黄仁勋在发布会上表示,Blackwell Ultra的推出标志着AI计算进入了一个新的效率时代,将为下一代AI模型的研发和部署提供更强大的基础设施支撑。