什么?我居然将雷军的声音作为天坦读屏的主语音库了。

14 阿飞哥 3周前 803次点击


今天经过开发同学的不懈努力,终于我们嗯复活了飞言 TTS 的声音克隆。该声音克隆模型就是这几天我们在忙着接入的 Minimax 语音模型。它的效果大家在我的上一篇帖子也有目共睹了,非常的强悍。也就是在拟人度和口水词。的朗读上,听起来真的就跟活人没什么区别。之所以要从豆包换成 Minimax 就是这个原因。除了拟人度,豆包声音克隆比不过之外,要驱使使我们去换成 Minimax 的就是价格了。Minimax 复刻一个音色为9块钱,豆包的要150元。这钱,说实话,真心付不起。无论是我还是大家都不愿意承担这个成本。所以我们才换成了 Minimax ,9块9一个音色,希望大家应该能接受这个价格。九块九真的很便宜了!九块九你上哪去找这么好听且具有拟人感的音色?哪怕你本地部署一个模型,本地部署的模型你也不能拿它来听小说,你也不能拿它来当语音库用。咳咳。跑题了,回到正题。之所以合成速度会这么慢,这是因为我们的测试服在香港,网络链路异常,效果 就没那么理想。不过大家请放心,正式版会有网络延迟,但没有这次演示这么的严重。我们的正式服在中国境内。到时候正式版出来,无论是从合成的质量还是速度都会比今天的演示会快上不少。当然肯定是会有延迟的,毕竟没办法嘛。在线 TTS ,哪怕我们优化再好,网络一波动,我们也没办法啊,我们总不可能将一整个 Minimax 模型部署到大家的手机上吧?那这不现实。

共 91 条评论

太好了,这样之后我就能做自己喜欢听的声音了。嗯,虽然延迟挺大的,不过偶尔听听或者弄成库语音库也不错。

阿飞哥 [楼主] 3周前

郑文不是说了吗?正式版会尽量降低延迟。之所以这个演示听起来延迟这么大,那是因为我们的测试服在香港。

这个延迟太大了

彼岸 3周前
666,不知道的以为是本人。

厉害

阿飞哥 [楼主] 3周前

一点都不厉害,TTS 注册是 AI 帮我们完成的。只要将系统级 TTS 这个链路打通,就可以通过这个接口调用第三方模型来作为系统级语音库了呀。

哈哈哈哈延迟降低后,我就可以直接当语音库使用了

阿飞哥 [楼主] 3周前

到时候还希望你能够付费支持一下,毕竟弄这玩意还挺烧钱的。虽然比豆包的声音复刻便宜不少,但每个音色也需要 消耗9块钱的人民币才能创建啊。

这个普通话。哈哈哈,挺真实的
阿飞哥 [楼主] 3周前

那你就说够不够还原吧。关键是遇到嗯等口水词,都表现得比较真实,不再是像我们现在用的内置讯飞语音库那样子,遇到嗯啊等口水词。词念出来就比较机械。正常操作手机还好,要是看一篇新闻,看一篇 文章,那真的就是没有什么代入感。相关的情绪也只能够自行脑补了。

我说我没钱

那这样的话,我们要上传哪样多长的音频呀?

阿飞哥 [楼主] 3周前

30秒以内的,不用太长,30秒的音频就已经能足够让模型知道这个人的说话习惯、口癖和声学特征了。总不可能上传一个 G 的吧?就算人家模型能支持,我这服务器也顶不住啊。

是,等以后他延迟能变得小一点,我就去考虑搞一个

绝对可以为爱买单。

积木 2周前
用你的声音给我们做一个语音库

走开点,我肯定是男的,声音不好听,你去找小姐姐,甜美的甜美的声音多好

叶青青 2周前

有连衣宝宝的地方就有我

哎呀
积木 2周前
找啥姐姐呀?用你涟漪的那个声音做,直接一层,然后呢,延迟约200毫秒
肯定是我自己享受了,不给你。
积木 2周前
不给我就算了,我还是得费点的功夫,把你那手那个什么哥,你刚分享的那个给下载下来,然后呢,做一个简单的语音库
那个是花玲老师的,你可以直接收到他的作品,这样更简单一点
积木 2周前
你别说,这人唱歌声音确实挺好听的,我怎么也没想到,奶奶的,没想到还有这么甜的人生
不过先说好啊,你弄他的声音做语音库啥的就不要露出来不要分享了,可能会侵权的。
积木 2周前
啊啊啊,我要,我要,我要。用那个你说的那个什么什么老师的声音做的话,容易侵权,我还是用你这个涟漪的声音吧,我要,我要,快给我,我要做,虽然技术不行,但是。哎,我就是要做
没事的,你直接标明说是纳西达的声音就行了,因为他配过纳西达那个角色的,也可以搜纳西达。
阿飞哥 [楼主] 2周前

不是,你们能不能不要在我这撒狗粮啊?作为一个21岁的单身宅男,看到会有多么的吃醋嘛!

积木 2周前
我没有没有,我可没撒哈,这狗粮不是我撒的,我没有狗粮
积木 2周前
算了算了,我还是不做了吧,我估计这玩意一般人做不了,有点难,我还没这技术,等我学会了再做也不迟,音频就保存了
快点加入我们二次元吧,很多厉害的老师的,声音绝对让你耳朵有福。
积木 2周前
什么叫耳朵有福?放心,我的耳朵就算再甜的声音也不会有糊的,我的耳朵还是会竖起来的
积木 2周前
什么二次元啊?怎么加入啊?我也想加入,去听一下

你开始看动漫的时候,已经加入二次元了。

积木 2周前
原来如此

我们就是三次元,然后二次元的定义就是小说、动漫、游戏之类的吧。

还是要尊重一下他们的声音的。
阿飞哥 [楼主] 2周前

不是,你们要撒狗粮不要在我这撒,我还是个21岁单身小朋友呢。

能教一下我这怎么用的吗?我也想有这样的语音库。
阿飞哥 [楼主] 3周前

这个郑文不是说了吗?这个版本只是我们内部测试的一个版本,还不能上线呐。要不然延迟怎么可能会这么大?就是因为我们内部的服务器是一台垃圾的香港服务器,网络带宽比较小。要不然以我们正式服的距离和带宽,不可能会这么卡合成的语音。

怎么的也得买八个十个的。

要是延迟低,付费不是问题。

哈哈,你们恢复的可是真全面,把他口音都弄出来了。

阿飞哥 [楼主] 3周前

先纠正一下,这个效果是 Minimax 的效果,我们只是将它作为了语音库进行调用。之所以正文要说到让你们收费支持,这些费用大部分都是给这些模型厂商的调用费用。要不然以我们的水平,我们可做不出来这么厉害的语音模型。

9块9克隆一个音色,这太能接受了。
这么牛逼的吗,即使不拿来当读屏的语音库,也能给听书软件调用啊。
大厅回声都干出来了。
阿飞哥 [楼主] 3周前

因为这个音频的样本,原素材就是雷军的年度演讲录像呢。

我去刚听的时候,我真以为是本人在说话。

阿飞哥 [楼主] 3周前

怎么可能是本人在说话?我哪有这个面子让雷军配合我演这么一出戏?如果我真有的话,我还在这社区发帖干什么?早就入职小米了。

不错啊,这个拿来当副语音库还是不错的。
阿飞哥 [楼主] 3周前

拿来当第二语音库是不是有点太小瞧 Minimax 了?

我不是那个意思呀,只是发现这个当主语音库延迟有点那个啥而已。
云雪cat 3周前
听得我好想笑啊哈哈哈哈哈。
这高低得让他读一个,are you ok
阿飞哥 [楼主] 3周前

行,等明天我把正式版赶出来了,再让他读一遍,Are You OK?

嗯,好的,那我就等明天看看
要是有本地的就好了,延迟会直接暴跌,那就爽了

本楼来自:
我的世界肝帝玩家的资源库

阿飞哥 [楼主] 3周前

有本地的,但是我们读屏和手机要调用就很麻烦。

白衣 3周前
哈哈。笑死我了。去年国庆的小米酥七又回来了。
阿飞哥 [楼主] 3周前

那就行那就行
好家伙,真牛,不过我劝你最好不要商用,因为怕侵权
阿飞哥 [楼主] 3周前

我知道啊,雷军这个音色我肯定不会拿去商用啊。之所以用雷军的声音拿来演示,那是因为雷军的普通话比较特别,录出来的效果会 很好。

嚯,厉害!这都可以?
隋昊航 2周前
感觉挺不错。
本楼来自:托管平台
我用multiTTS也实现过类似的,但是你这个方案比我的那个更好
清欢 2周前
不过延迟咋那么大

如果没有楼主的读屏音效,我还以为是雷军本人太像了,真的很像。

楼主这个语音哭的反应速度太慢,
阿飞哥 [楼主] 2周前

都说了这是在线语音库,毕竟像这么高精度的呃模型,不可能在你们手机本地跑吧?哪怕是最新版本的 iPhone 17 Pro Max 来了都顶不住。

我好奇,如果这玩意真在本地跑,这得消耗多少

本楼来自:
我的世界肝帝玩家的资源库

没有狗粮啊
废纸篓 2周前
有种雷军开天坛发布会的感觉
200多万粉丝的
正常二创也没事。
回楼主阿飞哥 这是剧透了。 本楼来自:智慧人生
回楼主阿飞哥 很得意是吗?万一被滥用了怎么办?千万不要因小失大,感觉你有点魔怔了。 本楼来自:智慧人生
回楼主阿飞哥 舆论场> 个人声线被训练成AI语音包明码倒卖,央媒:莫让AI“偷声”击穿社会信任 姚湜/新华社 2026-08-18 11:03 只需十几秒的语音素材,就能精准复刻一个人的声线、模拟其情绪语气,生成任意话术。随着人工智能(AI)“克隆”声音技术不断迭代,并伴随社交平台走入日常生活,一些AI“偷声”滥用现象也不断出现,不仅暴露多重安全问题,甚至还成了诈骗的新方式,给社会治理带来新挑战。 声音是独属于每个人的“听觉身份证”,承载着专属身份属性与人格权益。然而当前部分个人声线未经许可被抓取训练成AI语音包,在短视频、带货广告中肆意商用,甚至被明码倒卖,导致人格权益遭受侵害。线下电信诈骗手段更借AI仿声不断“更新”。不法分子复刻、模仿子女和晚辈音色,编造车祸、急需医药费等紧急说辞,一些老人听见熟悉的声音便慌了神,来不及核实就转出养老积蓄。 乱象丛生的核心症结,在于AI“偷声”侵权成本低廉,维权却困难重重。记者在部分网络购物及二手交易平台上,搜到大批AI克隆软件安装包购买以及声音替换、定制音色服务,价格从十几元到几百元不等,部分店铺交易记录多达上千次。从购买者的使用评价看,这些软件操作简单,不仅可以克隆普通人说话,还能将声音逼真地转为名人和著名角色的声音。 更为重要的是,被侵权后,大部分时候受害人只能靠自己或朋友偶然发现。由于传播路径复杂,侵权音频常经多次剪辑、跨平台转载,技术链条又涉及数据提供方、模型开发者、平台运营方等多方角色,该起诉谁、如何取证,对受害人而言都有很大难度。 技术不能野蛮生长,个人声音不能被当成免费工具。当语音真假难辨,社会信任也将受到严重侵蚀。平台应升级音频鉴伪系统,清理非法售卖声模的交易;司法层面需细化声音权益认定标准,提高侵权、诈骗违法成本;监管方面需要求AI训练平台对数据来源进行合规审查,内容分发平台建立快速响应的侵权投诉处理机制。多方携手为AI应用划定明确的规范边界,才能确保技术以人为本、智能向善。 责任编辑:王建亮 图片编辑:陈飞燕 本楼来自:智慧人生
阿飞哥 [楼主] 2周前

我们知道,之后会加一个审核系统。

想克隆的音频都找好了,就等上线
阿飞哥 [楼主] 2周前

哎,有没有一种可能已经上线了呢?

楼主,能给个 QQ 群吗
或者软件的微信群
阿飞哥 [楼主] 2周前
扫描我加入飞言 TTS 用户交流群。

扫描上方这个二维码加入。

溪水 2周前

打开看看

菜猫 2周前

这个怎么弄?怎么弄雷军的声音?其实我更想弄豆包的声音。要是可以的话,王俊凯也想要。

阿飞哥 [楼主] 2周前

豆包和雷军的声音我都已经在飞言 TTS 上公开了呀。点击听书,更换音色,切到 Minimax 音色分类选公开音色,就能看到我公开的音色了呀。

菜猫 2周前

主要刚才下载了,每次要么重新把所有内容读一遍,要么就是找不到焦点。