Meta Llama 4 泄露,开源社区提前狂欢
Meta尚未正式发布的Llama 4模型意外在Hugging Face上泄露,虽然很快就被删除,但模型权重已经被大量下载。开源社区迅速开始分析和微调这个模型,各种评测结果和微调版本在短时间内涌现。
从泄露的信息来看,Llama 4采用了MoE(混合专家)架构,参数量达到了惊人的4000亿,但实际推理时只激活约1000亿参数。这种设计在保持强大能力的同时降低了推理成本。训练数据量达到了15万亿token,覆盖超过30种语言。
早期评测显示,Llama 4在多项基准测试中的表现与GPT-4相当,在部分代码和数学任务上甚至有所超越。这对于开源社区来说是一个巨大的鼓舞,意味着开源模型与顶级闭源模型之间的差距正在快速缩小。
Meta对这次泄露事件反应强烈,发表声明谴责未经授权的分发行为。但业内人士普遍认为,这次泄露对Meta来说未必是坏事。它让社区提前了解了Llama 4的能力,产生了大量免费的宣传效果。而且开源模型的价值很大程度上来自社区的贡献,提前泄露实际上给了社区更多的时间来准备微调工具和适配方案。
开源社区的反应异常热烈。Hugging Face上的Llama 4相关项目在泄露后的24小时内就收到了数千个star。各种微调版本开始出现,包括针对中文、法律、医疗等垂直领域的专门版本。一些开发者甚至开始尝试将Llama 4量化到可以在消费级硬件上运行的程度。
Meta表示将按原计划在未来几周内正式发布Llama 4,并同时发布详细的技术报告。公司对商用限制做了进一步放宽,允许企业在更多场景下免费使用Llama 4。