6 迷壶博士 2天前 257次点击
Hello大家,语音识别更新了。,3.0版本更新内容很多,欢迎大家加群一起交流。群号是:980730146
下面是详细日志。
星言(元星空语音识别引擎) 3.0.0 版本更新详细日志
各位用户,星言 3.0.0 正式版终于与大家见面了。从 2.9.5 到 3.0.0,我们经历了 多个测试版本的打磨,本次是一次脱胎换骨的大版本。以下是详细更新内容。
一、软件更名
星空语音识别引擎正式更名为「星言」。名字更短更好记,功能不变,初心不变。感谢今梦提供灵感。
二、界面全新改版
2.1. 主界面全面迁移至 Material 3 设计语言,全新星言深色主题,自动跟随系统深浅色模式。
2.2. 底部导航改为四标签页:模型、转写、日志、设置,默认选中模型页。
2.3. 模型管理页原生重写:各引擎分组折叠卡片展示,下载进度条、启用、删除、重试按钮全部 Material 化,模型下载支持镜像加速。
2.4. 设置页原生重写:全部设置项迁移,每项独立焦点,开关自带选中状态朗读,开关行合并为单一无障碍焦点,双击整行任意位置即可切换。
2.5. 转写任务列表改为卡片式设计:彩色状态标签、实时进度条。
2.6. 无障碍深度适配:模型卡片信息区合并为单一焦点整体朗读,分组折叠使用标准展开/折叠语义,对话框单选按钮合并焦点,为屏幕阅读器用户提供一致的操作体验。
三、新增豆包大模型在线引擎
接入豆包 流式识别,支持边说边出字,识别速度快、准确率高,支持长语音 VAD 分段精修与标点优化,需登录星言账号使用。感谢🐈提供流式识别技术支持。
四、新增豆包离线引擎
下载官方离线模型(约 185MB)后完全断网可用,无需联网即可实时转写。断网识别与在线识别共用同一套调度,长按输入框语音输入、语音输入悬浮球均可触发。
五、新增讯飞 MSC 原生内置引擎
内置 64 位 MSC 库,免装插件开箱即用,也是首次安装未选择引擎时的默认引擎。MSC 卡片支持原生内置与插件版二选一,语言与热词设置两个版本共用。
六、新增 SenseVoice 离线引擎
接入阿里开源 SenseVoice 模型,中英日韩粤五语识别,提供量化版(158MB,手机推荐)与全量版(845MB)双版本下载,速度与准确率俱佳。
6.1. 转写新增「时间戳与自动分句」开关:开启后按语音活动自动分段、逐句显示起止时间,支持导出 SRT 字幕;关闭后仅返回纯文本长文,两种场景自由切换。
6.2. 长音频 VAD 分段转写:超长音频自动按语音活动切分逐段识别,内存占用稳定,长篇录音文件不再解码失败。
6.3. 段级音频事件显示:每段文本后自动附语言、情绪、音频事件标签(如背景音乐、掌声),与星言引擎检测结果共用设置开关,默认开启。
6.4. 标点能力:集成 CT-Transformer 双语标点模型(约 62MB),转写结果可自动添加标点,默认关闭,在设置中开启时自动弹出下载对话框,下载完成即刻启用,支持一键删除模型。
6.5. 识别参数可调:主要语言(自动检测/中文/英语/日语/韩语/粤语,用于引导识别倾向)、数字反规范化(一百二十三转123)等均可在设置中调整。
七、新增星言在线转写引擎
录音转写新增多个在线模型(含豆包 SeedASR、SenseVoice 等),支持说话人分离、情绪识别、性别与年龄检测、逐字时间戳等高级能力,模型参数界面由服务端动态下发,新模型上线无需更新软件。凭星言账号登录使用,欢迎注册体验。
八、语音输入辅助功能(新增)
8.1. 新增长按输入框语音输入:在任意应用的输入框上长按即可开始说话,松手自动识别上屏,按住时长可在 0.3 至 3.0 秒间自定义。按住不足等待时间松手则完全放行系统原生菜单,不打扰原有操作习惯。
8.2. 新增语音输入悬浮球:打开输入框后正上方自动出现悬浮球,点击开始识别,再次点击停止上屏,支持长按拖动调整位置并记忆,默认关闭,可在辅助功能设置中开启。
8.3. 新增兼容模式(默认关闭):针对长按完全无法触发的边缘设备,开启后通过真实触摸位置验证触发,仅长按输入框位置才响应,杜绝误触发。
8.4. 触发反馈:识别开始、完成、失败分别有对应震动与音效(原音调、升调、降调),可在震动反馈、震动加音效、音效反馈三种方式间选择。
8.5. 智能屏蔽干扰:触发语音输入时自动暂停正在播放的音频,录音期间媒体音量与无障碍音量自动静音,识别完成后恢复原状,全程不被音乐与读屏播报打扰。
8.6. 识别完成自动通知屏幕阅读器朗读识别结果;无屏幕阅读器运行时不发送公告,避免误播报。
8.7. 长按健壮性增强:语音输入会话期间自动拦截系统长按菜单等弹层干扰;长按说话不再被误判中断。
九、星星助理(新增)
9.1. 长按输入框以唤醒词开头说话,星星自动帮你删除、替换、插入输入框文本,唤醒词默认「星星同学」,可自定义。
9.2. 支持序号定位与批量指令:如"删除 第 2 个"你好",多指令一次说完逐条执行;也支持全选替换(如“把所有文本翻译成英语”)与空框直接插入。
9.3. 删除、替换、插入三个工具全部纯文本操作,每个工具可独立开关;工具未启用时会明确提示。
9.4. 执行结果 Toast 加读屏双通道反馈,明眼人与视障用户均可感知。
十、大模型修正(增强)
10.1. 原有的大模型修正开关升级为模式选择,三种修正模式自由切换:保守(仅修标点与识别错误)、去除口水词(删填充词并捋顺表达)、智能成文(完全书面化改写,信息点不丢),时间戳转写文本同步支持。
10.2. 新增大模型深度思考:修正时开启深度思考,复杂语句的整理质量更高。
10.3. 新增专业内容符号化:数学、化学等口语表达自动转为专业符号,如"x加y等于z"转"x+y=z"、"氢二氧"转"H₂O"、"百分之五十"转"50%"、"阿尔法"转"α",无法确定时保留原文,不过度转换日常用语。
10.4. 新增名词保护机制:数字、版本号、英文缩写、产品名、型号、内部代号默认正确,禁止大模型用自己的知识“纠正”用户口述的新版本号与专业术语,只有读音完全对不上时才允许修正。
10.5. 修正链路已覆盖全部引擎与全部场景:语音输入、录音转写、悬浮球输入统一生效,任何一个引擎的识别结果都支持二次修正。
十一、账号系统(新增)
11.1. 新增星言账号:登录、注册、账号信息一站式管理,星言在线引擎与豆包在线识别均需登录使用,未登录使用豆包在线识别会明确提示。
11.2. 设备与账号绑定:设备信息随账号在服务端安全保管,识别稳定性与安全性进一步提升。
11.3. 识别时长明细:账号页可查看时长流水,中文时长显示(如 6分25秒),读屏朗读更自然。
11.4. 公告系统:应用内可查看官方公告,支持列表与详情浏览。
感谢阅读者对账号系统开发的支持。
十二、安全与稳定性
12.1. 应用启动即预热:识别服务常驻待命,第二次起语音输入零延迟,彻底告别首次识别慢与部分设备冷启动失败。
12.2. 更新机制完善:支持必要更新(重要版本要求更新后使用),同版本提醒 24 小时内不重复弹出,自动检查更新常开。
12.3. 耗电优化:在线引擎空闲心跳从 3 秒延长至 30 秒,后台挂机不再频繁唤醒,锁屏耗电与发热显著下降。
12.4. 转写稳定性:修复转写进行中查看任务闪退、删除任务闪退、删除不彻底、说话人改名回滚、更新下载中途切后台界面消失等一系列问题。
12.5. 豆包识别稳定性:修复长语音分段结果丢失、长文本丢结尾、偶发不出结果、提示文字误上屏等一批问题,长语音结果完整上屏。
十三、其他
13.1. 关于页:新增软件介绍与加群交流入口。
13.2. 搜狗离线模型下载源迁移至自有服务器,下载更稳定。
13.3. 转写结果新增语种、音频时长显示开关,带时间戳与无时间戳文本的点击动作均可自定义(复制/播放/无操作)。
13.4. 大模型文本修正对齐阈值可调,导出 TXT 可选择是否包含说话人。
13.5. 赞助与鸣谢名单更新,感谢每一位支持者。
最后,感谢浅念提供开发支持。
点击下载。欢迎大家一起加群交流。
一个语音输入引擎,可以在任意界面长按输入框,或者使用悬浮球进行语音输入。也可以被天坦,宝义和解说输入法调用。
好东西,必须下载体验一下。
看到豆包的我心动了啊,我花在天坛这边的豆包语音输入上的钱都已经有十几块了,应该。
好奇下,楼主是不是那个双向奔赴学习机里面那个迷糊?我记得好像好像看到过一个。
是的
他这个用豆包有延迟吗?
和官方是一样的
这个支不支持自带的输入法呢,必须下载第三方的输入法吗
有辅助功能输入方式,在不切换输入法的情况下,也能语音输入
入群答案填写一下手机型号和安卓版本哦