新加坡国立大学发布东南亚首个开源大模型SEA-LION
新加坡国立大学(NUS)研究团队发布了SEA-LION(Southeast Asian Languages In One Network),这是东南亚地区首个专门针对本地语言训练的开源大模型。
SEA-LION支持超过20种东南亚语言,包括印尼语、泰语、越南语、菲律宾语、马来语、缅甸语等。项目负责人Bryan Hooi教授表示,现有的主流大模型在处理东南亚语言时的表现普遍不佳,SEA-LION的目标就是填补这一空白。
训练数据是SEA-LION的核心竞争力。研究团队花了超过一年时间收集了高质量的东南亚语言语料,包括新闻文章、维基百科、政府文件、社交媒体内容等。特别值得一提的是,团队还与多个东南亚国家的本地机构合作,收集了大量的口语化对话数据。
在标准评测中,SEA-LION在东南亚语言任务上的表现明显优于同规模的其他开源模型。比如在印尼语文本分类任务上,SEA-LION的准确率比Llama 2高出约15个百分点。这对于本地化的AI应用开发来说是一个重要的进步。
新加坡政府对SEA-LION项目给予了大力支持。新加坡国立研究基金会(NRF)为项目提供了超过500万新元的研究经费。政府还计划将SEA-LION用于公共服务领域,比如多语言的政府网站、智能客服等。
SEA-LION采用Apache 2.0许可证开源发布,任何人都可以免费使用和商用。研究团队表示,欢迎东南亚各国的开发者和机构参与到模型的改进和完善中来。未来,团队计划进一步扩大语言覆盖范围,增加更多东南亚少数民族语言的支持。