印度推出国产大模型BharatGPT,声称支持22种语言

2026-07-20

印度推出国产大模型BharatGPT,声称支持22种语言


印度科技界最近搞了个大新闻——国产大模型BharatGPT正式发布。这个由印度理工学院(IIT)和多家本土科技公司联合开发的模型,声称支持22种印度语言,目标是打造"真正属于印度人的AI"。


BharatGPT最大的卖点是多语言支持。除了英语和印地语,它还支持泰米尔语、泰卢固语、马拉地语、孟加拉语等多种印度地方语言。在印度这个语言极其多样化的国家,这一特性具有很强的实用价值。目前市面上的主流大模型在处理印度地方语言时的表现普遍不佳。


模型采用了与Llama类似的架构,但在训练数据上做了大量本地化工作。训练语料包括印度的新闻网站、维基百科、政府文件、文学作品等。团队还特别收集了大量口语化数据,让模型能够理解和生成更加自然的日常对话。


印度政府对此项目给予了大力支持。电子和信息技术部为BharatGPT的开发提供了资金和政策支持,并计划在政府部门中率先采用这个模型。印度总理莫迪在社交媒体上发文称赞BharatGPT是"印度技术自主的重要里程碑"。


不过,客观评测显示BharatGPT与GPT-4、Gemini等顶级模型仍有明显差距。在标准英语基准测试中的得分大约相当于GPT-3.5的水平。但在印度地方语言的任务上,它的表现确实优于其他开源模型。


BharatGPT的发布也引发了关于"技术民族主义"的讨论。有批评者认为,强行推进国产AI可能会让印度与国际技术前沿脱节。但支持者则认为,拥有自己的基础模型对于数据主权和国家安全至关重要。无论如何,BharatGPT的推出标志着印度正式加入了全球大模型竞赛。

分享
写评论...