写点什么

语音生成领域模型又填一名猛将

作者:felix
  • 2022-12-28
    北京
  • 本文字数:579 字

    阅读完需:约 2 分钟

TTS 即 Text-to-speech 文本转语音是近几年 AI 研究领域的一大热点,该类模型语音合成领域有着非常广阔的应用。


尤其是这两年有声书非常火热,有很多前几年积累的网络小说,经过 TTS 模型后,就变成了有声书,然后在喜马拉雅或蜻蜓 FM 等类似频道就可以上线售卖。又把该类模型的应用价值直接拉满。


但一个好的语音合成模型却非常难得,一方面要生成的对,即准确率要高;另一方面生成的语音要真实、机械感低。尤其是第二个方面非常难得。人类对于语句的朗读是有抑扬顿挫的,有时又要结合句子含义,有感情的变化。这对于模型是非常难以学习训练的。


此外还有多语种结合问题:如中文夹杂英文的情况;声色问题,即根据少量的声纹特点,合成具体声色的语音。比如男中音、女高音等。因此一个简洁好用的 TTS 模型可遇不可求。



目前主流的模型设计方案是分为两个部分:声学模型和声码器。声学模型主要采用类 BERT 类模型,把输入的文字经过 NLP 处理,预测出声学特征。声码器主要采用 GAN 类模型,把声学特征转换成声波信息。


AI 模型市场最近上线了一款新的 TTS 模型,我们通过和作者的沟通,发现作者就是使用了上述的模型经过,在经过 10 几个小时的大数据量训练,成功孵化出一款优秀的 TTS 模型。实测下来发现,模型的准确度、速度、真实性都调教的非常均衡,还支持中英文~


有需要的小伙伴欢迎来 AI 模型市场(aimodelmarket.cn)试用,快来围观这款语音生成领域的猛将是如何玩转 TTS 的~


用户头像

felix

关注

还未添加个人签名 2018-10-17 加入

还未添加个人简介

评论

发布
暂无评论
语音生成领域模型又填一名猛将_深度学习_felix_InfoQ写作社区