我写的免费语音识别更新了

7 迷壶博士 1天前 262次点击

Hello,各位

之前分享了自己写的星空语音识别引擎,刚开始只有whisper一个引擎,现在已经扩展很多了,而且都是免费稳定的。来分享一下近期的更新日志吧

1.5

1.增加Sherpa-NCNN引擎的支持。此引擎支持中文,英语和法语的识别,速度更快,更轻量,效果不错

2.支持msc引擎,此引擎是在线引擎,需要下载插件包。支持中文、英语和部分地方话。支持添加识别热词,以提高这些词被识别出的概率

3.针对whisper进行了速度优化。一般的手机应该可以正常使用small模型了

4.其他bug修复

2.0

1.重构界面逻辑。底部被分为三个tab,模型、日志和设置。模型对应元模型管理页面,当软件出现识别异常时,可复制日志

2.设置界面分模型和通用设置

3.增加大模型修正和深度思考功能。启用后,可使用文本模型把语音输入结果进行一次不损失原文的修正,亲测识别常用字形,男他,女她,物他以及文言文都有不错的效果,但因为模型限制,不要问他如何制作炸弹。提示词无论如何调整,他只会给你安全准则

4.提升msc引擎和whisper的响应速度

5.增加通知保活,忽略电池优化和开机启动。避免软件被误杀,提升稳定性

6.增加了搜狗的在线和离线引擎

7.新增在线更新可在设置>通用。开启beta版计划和自动更新

8.模型下载完成,软件包下载成功都会有一个音效提示

9.增加赞助入口

10.标准化分组展开/折叠逻辑 ,现在读平可正常读取。感谢@今梦的实现思路

安装后即可在天坦输入法宝易输入法解说等app里免费调用

点击下载

接下来准备做转写功能,也就是大家熟知的录音转文字。对软件你们有什么期待呢?当一回许愿树,我在能力范围内来帮你们完成

共 17 条评论

感谢喽。这就是我需要的

⁦⁩ 1天前
0 
接口+1,未来可期。
狂胜 1天前
0 
支持,太牛逼了,不是有一个语音活动检测模型吗,能不能做一个音频识别字幕的功能
迷壶博士 [楼主] 1天前
0 

也就是说通过音频转文字功能,匹配时间戳,导出src字幕吗

狂胜 1天前
0 

对啊,某些模型支持输出字符级别的时间戳,Silero VAD可以检测不是人声的部分,把含人声的音频识别一下,在映射到真实音频的时间上,就差不多了。具体的编排映射,就需要楼主自己设计了

迷壶博士 [楼主] 1天前
0 
这个还真可以
狂胜 1天前
0 
另外楼主可以创一个qq群,交流一下
⁦⁩ 1天前
0 
楼主的这个链接我已经下载了五分钟,还没有下载好,速度一直在50KB左右。我有十来年没有体验过这么慢的网速了,也不知道是什么原因导致的,希望能下载成功吧。
狂胜 1天前
0 
点击下载app

用这个链接,速度快点

⁦⁩ 1天前
0 
谢谢,我已经安装上了。我用了一下,出现了一些问题,就是上面的大模型都下载不了,一直是0%。然后一直下载失败,我只能用最下面的搜狗在线引擎打字了。感觉准确率还可以,不过好像不能打长文本。长文本容易识别失败。只能一次打一句话,这样子还行。这段文本我就是用搜狗在线引擎打出来的。
狂胜 1天前
0 

这个好像要梯子

迷壶博士 [楼主] 1天前
0 
这,我试了一下,网络没问题,下载速度挺快的,可能是你那网络环境对git的访问限制
迷壶博士 [楼主] 1天前
0 

咳咳,贴的github原链接,可以用@狂胜的

0 

帮顶,楼主厉害

狂胜 1天前
0 

楼主可以把模型下载来源切换成国内的模搭社区,会快很多

迷壶博士 [楼主] 1天前
0 

现在我走的是github代理,社区上如果有,我看看能不能换掉

梦月 1天前
0 
可以看一下模哒的地址,然后呢?代理的话我这里有,然后昨天我下那些模型的时候下载速度挺快的,能达到七八兆每秒。
添加一条新评论

登录后可以发表评论 去登录