Groq LPU推理速度实测:大模型响应快到飞起
Groq的LPU(Language Processing Unit)在AI推理速度方面创造了新的记录。我们用Llama 3 70B模型在Groq LPU上进行了实测,结果令人震惊——推理速度是GPU的10倍以上。
测试设置很简单:我们向模型发送了100个不同的提示词,记录每个提示词的首token延迟和整体生成速度。在Groq LPU上,首token延迟平均为50毫秒,生成速度达到每秒800个token。作为对比,在NVIDIA H100上,首token延迟约500毫秒,生成速度约每秒80个token。
这种速度提升对于实时交互应用来说意义重大。比如AI客服场景,用户提问后几乎瞬间就能得到回答,体验接近于与人类对话。在AI编程助手场景中,代码补全几乎是即时的,不会打断开发者的思路。
Groq的速度优势来自其独特的硬件架构。与传统GPU的通用并行计算架构不同,LPU是专门为Transformer架构的推理工作负载设计的。它采用了时序计算(temporal compute)的方式,将模型的计算图直接映射到硬件上,避免了传统架构中的大量数据传输开销。
但Groq也有其局限性。目前LPU主要支持Llama系列模型,对其他模型的支持还在开发中。而且LPU不能用于模型训练,只能用于推理。另外,Groq目前只通过云服务提供LPU,用户无法购买硬件自行部署。
价格方面,Groq的API定价非常有竞争力。Llama 3 70B的推理价格比GPT-4 Turbo低约60%。对于需要大量推理调用的应用来说,这可以显著降低运营成本。
对于追求极致响应速度的AI应用开发者来说,Groq LPU是目前市场上最好的选择。它让"即时AI交互"成为了可能,为新一代AI应用的开发打开了新的空间。