7 迷壶博士 1天前 262次点击
Hello,各位
之前分享了自己写的星空语音识别引擎,刚开始只有whisper一个引擎,现在已经扩展很多了,而且都是免费稳定的。来分享一下近期的更新日志吧
1.5
1.增加Sherpa-NCNN引擎的支持。此引擎支持中文,英语和法语的识别,速度更快,更轻量,效果不错
2.支持msc引擎,此引擎是在线引擎,需要下载插件包。支持中文、英语和部分地方话。支持添加识别热词,以提高这些词被识别出的概率
3.针对whisper进行了速度优化。一般的手机应该可以正常使用small模型了
4.其他bug修复
2.0
1.重构界面逻辑。底部被分为三个tab,模型、日志和设置。模型对应元模型管理页面,当软件出现识别异常时,可复制日志
2.设置界面分模型和通用设置
3.增加大模型修正和深度思考功能。启用后,可使用文本模型把语音输入结果进行一次不损失原文的修正,亲测识别常用字形,男他,女她,物他以及文言文都有不错的效果,但因为模型限制,不要问他如何制作炸弹。提示词无论如何调整,他只会给你安全准则
4.提升msc引擎和whisper的响应速度
5.增加通知保活,忽略电池优化和开机启动。避免软件被误杀,提升稳定性
6.增加了搜狗的在线和离线引擎
7.新增在线更新可在设置>通用。开启beta版计划和自动更新
8.模型下载完成,软件包下载成功都会有一个音效提示
9.增加赞助入口
10.标准化分组展开/折叠逻辑 ,现在读平可正常读取。感谢@今梦的实现思路
安装后即可在天坦输入法宝易输入法解说等app里免费调用
点击下载接下来准备做转写功能,也就是大家熟知的录音转文字。对软件你们有什么期待呢?当一回许愿树,我在能力范围内来帮你们完成
也就是说通过音频转文字功能,匹配时间戳,导出src字幕吗
对啊,某些模型支持输出字符级别的时间戳,Silero VAD可以检测不是人声的部分,把含人声的音频识别一下,在映射到真实音频的时间上,就差不多了。具体的编排映射,就需要楼主自己设计了
这个好像要梯子
咳咳,贴的github原链接,可以用@狂胜的
帮顶,楼主厉害
楼主可以把模型下载来源切换成国内的模搭社区,会快很多
现在我走的是github代理,社区上如果有,我看看能不能换掉
感谢喽。这就是我需要的