语音识别引擎更新,顺便发一下qq群

7 迷壶博士 1天前 222次点击

Hello大家

如题,这段时间给软件做了不少调整,同时软件有了qq群,群号是

980730146

欢迎感兴趣的大佬加入,一起来交流

以下是最新版本更新日志

新版本:2.8.2

发布日期:2026-08-15

星空语音识别引擎 v2.8.2

新功能:转写模块

底部标签页新增转写页,使用 Whisper 离线模型将本地音频文件转写为文字。

1. 添加转写任务

- 点击添加任务从文件管理器选择音频(支持 mp3/m4a/wav/flac/ogg 等格式)

- 音频自动复制到本地目录,进入任务设置页

2. 转写参数配置

- 模型选择:tiny / base / small / medium / large,高配手机推荐 medium 或 large

- 语种:96 种语言可选

- 推理线程:1-8 线程,高配手机建议 6-8

- 翻译为英语、采样温度、音频上下文等高级参数

- 大模型修正:转写完成后调用 BlueLM 自动修正错别字、标点和断句

- 深度思考:开启后大模型深度推理,效果更好但更慢

- 时间戳:开启后输出每段起止时间,用于导出 SRT 字幕

3. 大模型修正 + 时间戳无损对齐

- 始终提交纯文本给大模型修正,不干扰时间戳

- 修正后与原始段落逐段计算相似度,达到阈值的替换文本,达不到的保留原文

- 时间戳全程不变,文字和时间段精确对应

4. 转写结果页

- 播放音频:播放原音频,再次点击停止

- 复制文本:复制纯文本到剪贴板

- 导出 SRT:导出标准字幕文件(需开启时间戳)

- 导出 TXT:导出纯文本文件

- 显示时间戳开关:开启后按时间段分段显示

5. 转写设置(设置页,通用设置上方)

- 带时间戳文本点击动作:复制 / 播放对应音频段 / 无操作(默认:播放)

- 无时间戳文本点击动作:复制 / 无操作(默认:复制)

- 大模型文本修正对齐阈值:范围 1-100%(默认:80%)

- 播放中点击文本:跳转到对应位置继续往下播放

- 未播放点击文本:只播该段音频,播完自动停止

修复与优化

- 重写音频解码器,修复大音频文件解码时崩溃

- 应用堆内存提升,支持更长音频转写

- 时间戳功能底层修复,正确输出时间段数据

- 转写完成后自动释放模型资源,避免手机持续发烫

有音频转写需求的小伙伴可以用起来啦

共 12 条评论
这个和那个会员语音输入谁更好点呢?
本楼来自:好用的执链工具快进来看看
那么音频文件用完以后会不会自动删除啊?就是你刚才提到会将音频文件复制到目录中
迷壶博士 [楼主] 1天前
0 

下个版本做删除逻辑

0 
好,不过这个转写怎么那么慢呢?
⁦⁩ 23小时前
0 
没翻墙,不知道能不能下那个大模型,我试试哈。
迷壶博士 [楼主] 8小时前
0 

能的

普通群众 11小时前
0 
博士老师你好,请问视频和音频文件都能转文字,对吧
迷壶博士 [楼主] 8小时前
0 

视频很快支持

这个好。有木有考虑或者有木有已经做了实时语音转文本。。


本楼来自:关灯研究院
迷壶博士 [楼主] 9小时前
0 

哪种类型的实时

就是比如开会的时候打开它就能把整个会议记录转成文本存下来不用存录音。


本楼来自:关灯研究院
迷壶博士 [楼主] 7小时前
0 

哦这个啊,可以研究一下

添加一条新评论

登录后可以发表评论 去登录