Seed-TTS:高质量多功能语音生成模型家族Seed-TTS:高质量多功能语音生成模型家族

引言

Seed-TTS是由字节跳动Seed团队开发的一系列前沿文本转语音(TTS)模型。该模型家族能够生成几乎与人类语音无异的语音,作为语音生成的基础模型,Seed-TTS在语音上下文学习中表现出色,在客观和主观评估中,其在说话人相似度和自然度方面的表现均与真实人类语音相匹配。

性能表现

通过微调,Seed-TTS在这些指标上获得了更高的主观评分。Seed-TTS在情感等多种语音属性上提供了卓越的可控性,能够为多样化的说话人生成高度表达力和多样化的语音。此外,我们提出了一种用于语音因子分解的自蒸馏方法,以及一种增强模型鲁棒性、说话人相似度和可控性的强化学习方法。

Seed-TTSDiT: 非自回归变体

我们还推出了一种非自回归(NAR)变体的Seed-TTS模型,名为Seed-TTSDiT。该变体采用完全基于扩散的架构,与以往基于NAR的TTS系统不同,Seed-TTSDiT无需依赖预估的音素持续时间,通过端到端处理进行语音生成。我们证明了该变体在客观和主观评估中均能达到与基于语言模型的变体相当的性能,并展示了其在语音编辑中的有效性。

推荐链接

Seed-TTS: A Family of High-Quality Versatile Speech Generation Models

数据统计

相关导航

暂无评论

none
暂无评论...