6 阿飞哥 1小时前 205次点击
今天经过开发同学的不懈努力,终于我们嗯复活了飞言 TTS 的声音克隆。该声音克隆模型就是这几天我们在忙着接入的 Minimax 语音模型。它的效果大家在我的上一篇帖子也有目共睹了,非常的强悍。也就是在拟人度和口水词。的朗读上,听起来真的就跟活人没什么区别。之所以要从豆包换成 Minimax 就是这个原因。除了拟人度,豆包声音克隆比不过之外,要驱使使我们去换成 Minimax 的就是价格了。Minimax 复刻一个音色为9块钱,豆包的要150元。这钱,说实话,真心付不起。无论是我还是大家都不愿意承担这个成本。所以我们才换成了 Minimax ,9块9一个音色,希望大家应该能接受这个价格。九块九真的很便宜了!九块九你上哪去找这么好听且具有拟人感的音色?哪怕你本地部署一个模型,本地部署的模型你也不能拿它来听小说,你也不能拿它来当语音库用。咳咳。跑题了,回到正题。之所以合成速度会这么慢,这是因为我们的测试服在香港,网络链路异常,效果 就没那么理想。不过大家请放心,正式版会有网络延迟,但没有这次演示这么的严重。我们的正式服在中国境内。到时候正式版出来,无论是从合成的质量还是速度都会比今天的演示会快上不少。当然肯定是会有延迟的,毕竟没办法嘛。在线 TTS ,哪怕我们优化再好,网络一波动,我们也没办法啊,我们总不可能将一整个 Minimax 模型部署到大家的手机上吧?那这不现实。
太好了,这样之后我就能做自己喜欢听的声音了。嗯,虽然延迟挺大的,不过偶尔听听或者弄成库语音库也不错。
郑文不是说了吗?正式版会尽量降低延迟。之所以这个演示听起来延迟这么大,那是因为我们的测试服在香港。
这个延迟太大了
厉害
一点都不厉害,TTS 注册是 AI 帮我们完成的。只要将系统级 TTS 这个链路打通,就可以通过这个接口调用第三方模型来作为系统级语音库了呀。
哈哈哈哈延迟降低后,我就可以直接当语音库使用了
到时候还希望你能够付费支持一下,毕竟弄这玩意还挺烧钱的。虽然比豆包的声音复刻便宜不少,但每个音色也需要 消耗9块钱的人民币才能创建啊。
那你就说够不够还原吧。关键是遇到嗯等口水词,都表现得比较真实,不再是像我们现在用的内置讯飞语音库那样子,遇到嗯啊等口水词。词念出来就比较机械。正常操作手机还好,要是看一篇新闻,看一篇 文章,那真的就是没有什么代入感。相关的情绪也只能够自行脑补了。
那这样的话,我们要上传哪样多长的音频呀?
30秒以内的,不用太长,30秒的音频就已经能足够让模型知道这个人的说话习惯、口癖和声学特征了。总不可能上传一个 G 的吧?就算人家模型能支持,我这服务器也顶不住啊。
绝对可以为爱买单。
这个郑文不是说了吗?这个版本只是我们内部测试的一个版本,还不能上线呐。要不然延迟怎么可能会这么大?就是因为我们内部的服务器是一台垃圾的香港服务器,网络带宽比较小。要不然以我们正式服的距离和带宽,不可能会这么卡合成的语音。
怎么的也得买八个十个的。
要是延迟低,付费不是问题。
哈哈,你们恢复的可是真全面,把他口音都弄出来了。
先纠正一下,这个效果是 Minimax 的效果,我们只是将它作为了语音库进行调用。之所以正文要说到让你们收费支持,这些费用大部分都是给这些模型厂商的调用费用。要不然以我们的水平,我们可做不出来这么厉害的语音模型。
因为这个音频的样本,原素材就是雷军的年度演讲录像呢。
我去刚听的时候,我真以为是本人在说话。
怎么可能是本人在说话?我哪有这个面子让雷军配合我演这么一出戏?如果我真有的话,我还在这社区发帖干什么?早就入职小米了。
拿来当第二语音库是不是有点太小瞧 Minimax 了?
行,等明天我把正式版赶出来了,再让他读一遍,Are You OK?
本楼来自:
我的世界肝帝玩家的资源库
有本地的,但是我们读屏和手机要调用就很麻烦。
?
我知道啊,雷军这个音色我肯定不会拿去商用啊。之所以用雷军的声音拿来演示,那是因为雷军的普通话比较特别,录出来的效果会 很好。
牛