关键词:最新快讯 | 人工智能工具 | 人工智能前沿
2025年,AI语音技术领域竞争加剧。语音合成、语音克隆和实时对话能力的提升,正在改变内容创作、客户服务和无障碍辅助等多个领域的技术格局。
ElevenLabs在2025年实现了快速增长。该公司在年初发布了第三代语音模型"Eleven 3.0",在语音自然度和情感表达能力上较上一代有显著提升。ElevenLabs表示,新版本支持超过40种语言的文本到语音转换,包括多种低资源语言。公司披露其年度经常性收入(ARR)在2025年突破了1亿美元,较2024年增长超过400%。ElevenLabs在2025年1月完成了2.5亿美元的C轮融资,估值达到33亿美元。
产品层面,ElevenLabs在2025年推出了"Voice Design"功能,允许用户通过文本描述创建自定义虚拟声音,无需提供参考音频。该功能在播客制作、游戏开发和有声读物领域获得了广泛应用。ElevenLabs还与Spotify合作,为播客创作者提供AI配音工具,支持跨语言内容分发。
OpenAI在语音技术方面持续更新。2025年3月,OpenAI向ChatGPT Plus用户开放了改进版的语音对话模式,新系统支持更自然的打断、多轮对话中的上下文保持以及情感语调识别。OpenAI在发布说明中表示,新语音模式基于改进版的Whisper语音识别模型和新一代语音合成引擎,延迟降低至平均320毫秒。
OpenAI在2025年6月发布了语音引擎"Voice Engine 2",该技术支持仅15秒参考音频即可实现高质量语音克隆。OpenAI采取了审慎的发布策略,仅向经过审核的企业合作伙伴开放API访问,并要求使用者明确标注AI生成内容。
Google DeepMind的SoundStorm项目在2025年取得了研究进展。该项目采用非自回归架构,实现了比自回归模型快100倍的语音合成速度,同时保持了自然音质。相关论文在ICASSP 2025上获得了最佳论文奖。不过,Google尚未将该技术商业化为面向消费者的产品。
Meta在2025年将其语音技术整合进了Meta AI助手。新版助手支持语音指令输入、多语言实时翻译和语音摘要功能。Meta表示,其语音模型已在超过10亿条多语言音频数据上进行了训练。
在学术领域,苏黎世联邦理工学院(ETH Zurich)的研究团队在2025年开发了"Neural Voice Codec"技术,能够在极低码率(3kbps)下实现高质量的语音传输和合成。该技术对网络条件较差的地区具有重要意义。
创业公司Hume AI在2025年推出了情感语音AI平台,能够识别和生成带有特定情感色彩的语音内容。该平台被应用于心理健康辅导和客户服务培训场景。Hume AI在2025年完成了5000万美元的B轮融资。
语音技术的应用场景在2025年持续扩展。据Gartner统计,全球企业级AI语音助手市场规模在2025年达到78亿美元,同比增长55%。客户服务、医疗记录转录和教育辅助是三大主要应用领域。
监管层面,美国联邦通信委员会(FCC)在2025年就AI生成语音电话提出了新的披露要求,规定使用AI语音技术的商业呼叫必须在通话开始时明确告知接收方。欧盟AI法案也将语音克隆技术列为高风险类别,要求进行严格的透明度和同意管理。