小米开源OmniVoice多语言语音克隆TTS:支持跨语言克隆
创始人
2026-05-07 23:26:27
0

PChome 5月7日消息,小米技术官微官宣,小米AI实验室新一代Kaldi团队开源了OmniVoice多语言语音克隆TTS模型,该模型以其极简架构和超强性能,首次实现了对超过600种语言的语音克隆支持,打破了多语言语音合成的语种局限。

据悉,OmniVoice采用创新的双向Transformer架构,仅用一个网络直接实现文本到语音的转换,是目前最简单的非自回归TTS模型之一。尽管架构极简,但其性能却超越预期。在中英文测试中,OmniVoice的语音合成质量优于当前主流模型,训练和推理速度也极具优势,一天可完成10万小时训练,推理速度可达40倍实时。

该模型最大的亮点在于其强大的多语言能力。基于50个开源语音数据集构建的训练集涵盖646种语种,总时长58万小时。通过低资源语种动态上采样训练策略,OmniVoice即使在训练数据不足10小时的小语种上也能实现高质量合成。在24种语言的测试中,其语音相似度和可懂度均超越多款商用系统;在102种语言的测试中,其语音可懂度甚至逼近真实语音。

OmniVoice的另一大特色是跨语言克隆能力,用户只需提供一种语言的参考音频,即可生成其他语言的语音,真正实现了“说一种语言,通万国语言”。此外,模型还支持自定义音色设计、带噪参考音频适配、丰富语气表达和发音精准纠正等多维度可控功能,极大提升了实用性和灵活性。

相关内容

热门资讯

AI重塑民办教育:走到转型路口 在中国现代教育发展史上,鲜有一个阶段像当下这样,多重变量同时作用于同一体系之中。学龄人口结构的阶段性...
小米开源OmniVoice多语... PChome5月7日消息,小米技术官微官宣,小米AI实验室新一代Kaldi团队开源了OmniVoic...
5月7日ST南都跌19.35%... 证券之星消息,5月7日ST南都(300068)跌19.35%创60日新低,收盘报5.71元,换手率3...
把脸借给AI短剧,我却拿不回来... 就在平台花重金采购明星肖像、打造AI艺人库的时候,无数普通人的脸,也正在被AI短剧免费征用。我的同事...
靠谱的AI定制化哪个供应商好 AI转型浪潮下,不管是中小微商家还是中大型企业,都想靠AI降本提效,但找不对定制供应商,要么是套模板...
谷歌内部测试全新AI数字管家“... 观点网讯:5月7日,据媒体报道,谷歌正为其Gemini项目开发一款名为“Remy”的全新AI个人代理...
马斯克要建“世界最大AI芯片工... 参考消息网5月7日报道据英国《每日电讯报》网站5月6日报道,埃隆·马斯克的太空探索技术公司准备斥资1...
中小银行如何突围“AI竞赛” 2025年,银行继续加码数字化建设,14家在年报中披露数据的银行,2025年金融科技合计投入1845...
5月7日东方钽业涨6.00%,... 证券之星消息,5月7日东方钽业(000962)涨6.00%,收盘报49.11元,换手率5.56%,成...
英伟达力荐,小团队两个月开源一... 机器之心编辑部智能体时代的核心是算力。尤其是在CodingAgent爆发之后,算力问题变得前所未有地...