分享应用AIService TTS

4 ծածկագիր 43分钟前 60次点击

一、产品定位与背景

vivo AIService TTS(Text-to-Speech,文字转语音)是 vivo 自研的语音合成服务,隶属于 vivo 端侧 AI 能力体系,是 vivo 面向通用人工智能时代构建的语音技术基础设施之一。它并非独立对外开放的云 API 服务,而是深度整合于 vivo 手机系统(OriginOS)及 BlueOS(蓝河操作系统) 生态中,为 vivo 设备上的应用提供系统级的文本转语音能力。

vivo 在 AI 语音领域持续投入研发,其语音合成技术经历了多年迭代。2022 年 vivo 开发者大会上,vivo AI 语音中心总监陈彬彬曾介绍,vivo 基于自研的个性化语音合成系统,持续研发出丰富多元的合成声音,支持多种音色与朗读风格的自由组合,相关技术已发表顶会论文 8 篇,并获两项国际赛事第一名,Jovi 语音助手和屏幕朗读的语音合成技术还获得了中国信通院和泰尔实验室认证。

2024 年,vivo 发布全新 AI 战略"蓝心智能",并推出自研蓝心大模型矩阵,其中包含语音大模型,进一步提升了语音合成的情感化、多语言及自然度表现。2025 年,蓝心语音大模型与多模态技术融合,支持无唤醒词下达指令、全双工语音交互等更自然的语音体验。

---

二、技术架构

vivo AIService TTS 依托 vivo 端侧 AI 三层能力架构运行:

2.1 端侧 AI 能力架构

vivo 面向开发者开放了应用级、原子级、部署级三层端侧 AI 能力:

层级 定位 TTS 相关能力

应用级 成熟 AI 业务能力,开箱即用 直接调用 TTS 接口完成语音播报

原子级 原子化 AI 能力,可自由组合 NLP、ASR、TTS 等算法服务灵活搭配

部署级 算法端侧部署加速 通过 VCAP 平台将自研 TTS 模型部署到端侧

2.2 VCAP 计算加速平台

TTS 算法的底层推理依赖 vivo 自研的 VCAP(vivo Computation Acceleration Platform) 计算加速平台。VCAP 支持将语音识别、语音合成等 AI 算法在 vivo 智能手机上快速部署、高效运行,充分利用 CPU、GPU、DSP、NPU 等硬件特性进行加速。

VCAP 支持 TensorFlow、PyTorch、ONNX 等主流模型格式转换,提供模型量化(int4/int8/fp16)、压缩、加密等工具,并支持高通、联发科、三星跨平台方案,确保 TTS 模型在不同 vivo 机型上均能高效运行。

2.3 语音大模型底座

2024 年后,vivo TTS 技术底座升级为蓝心语音大模型。该模型作为蓝心大模型矩阵的重要组成部分,与语言大模型、图像大模型、多模态大模型协同工作,使语音合成在情感表达、多语言支持、音色自然度等方面达到接近真人水平。

---

三、功能特性

3.1 双模型合成策略

vivo AIService TTS 提供两种音频生成模型,适配不同场景:

模型 适用场景 特点

ShortJovi 对话合成场景(如语音助手) 低延迟、高实时性,适合短句交互

LongDefault 长文本合成场景(如小说阅读、屏幕朗读) 支持长文本连续合成,韵律自然

3.2 丰富的音色与风格

vivo TTS 内置多种发音人(Speaker),覆盖不同性别、年龄和风格:

短音频发音人(ShortSpeaker):

- 奕雯、云野(温柔)、婉清、晓芙(少女)、小萌(女童)、依格、依依、小茗

长音频发音人(LongSpeaker):

- 奕雯、云野(温柔/稳重)、依格(甜美/稳重)、怀斌(浑厚)、兆坤(成熟)、亚恒(磁性)、海蔚(大气)、倩倩(清甜)、英文女声、晓云(稳重)

3.3 灵活的参数配置

开发者可通过 `TtsConfig` 精细控制合成效果:

参数 说明 可选值/范围

`engineType` 引擎类型 normal(普通)、enZh(中英文)、en(英文)、optimized(优化效果)

`audioType` 音频编码格式 Pcm、Opus

`sampleRate` 采样率 8000、16000、24000 Hz

`speed` 语速 0-100(默认 50)

`volume` 音量 1-100(默认 50)

`isStream` 流式返回 true(流式,默认)/ false(按标点分段)

3.4 流式合成与播放控制

支持流式音频返回,可实现"边合成边播放",显著降低首包延迟,提升实时交互体验。同时提供完整的播放控制接口:

- `connect()` — 连接 TTS 服务

- `send(data)` — 发送待合成文本

- `pauseAudio()` / `resumeAudio()` — 暂停/恢复播放

- `disconnect()` — 断开连接并释放资源

3.5 音频数据回调

支持两种音频输出方式:

1. 自动播放:设置 `isNeedPlay: true`,TTS 实例自动播放合成语音

2. 数据回调:设置 `isNeedPlay: false`,通过 `onMessage` 回调获取 `TtsResult.audio`(Uint8Array 格式的 PCM 数据),开发者可自行处理音频流

---

四、开发者接入指南

4.1 接入前提

开发者需在 `manifest.json` 中声明以下权限:

```json

{ "name": "blueos.network.webSocket" }

{ "name": "blueos.media.audio.mediaManager" }

```

4.2 身份认证

使用 TTS 服务前,需在 vivo 开发者平台 申请 `appId` 和 `appKey`,用于接口鉴权。

4.3 代码示例

```javascript

import speech from "@blueos.ai.speech"

// 创建 TTS 实例(以长文本模型为例)

const tts = speech.createTts({

auth: {

appId: "your_app_id",

appKey: "your_app_key"

},

model: speech.TtsModel.LongDefault,

config: {

speaker: speech.LongSpeaker.yige,

sampleRate: 24000,

speed: 50,

volume: 50,

isStream: true,

engineType: speech.EngineType.optimized

},

isNeedPlay: false // 自行处理音频数据

});

// 连接服务

tts.connect();

// 监听连接成功

tts.onConnected = () => {

console.log("TTS 服务已连接");

tts.send("你好,这是 vivo AIService TTS 的测试文本。");

};

// 接收合成音频数据

tts.onMessage = (result) => {

// result.audio: Uint8Array (PCM 数据)

// result.status: 0=开始, 1=合成中, 2=结束

// result.progress: 合成进度

// result.slice: 帧序号

console.log(`收到音频数据,状态: ${result.status}`);

};

// 播放控制回调

tts.onSpeakStarted = () => console.log("开始播放");

tts.onSpeakPaused = () => console.log("播放暂停");

tts.onSpeakResumed = () => console.log("恢复播放");

tts.onSpeakFinished = () => console.log("播放完毕");

// 错误处理

tts.onError = (data, code) => {

console.error(`TTS 错误: ${data}, 错误码: ${code}`);

};

// 释放资源(页面销毁时调用)

// tts.disconnect();

```

4.4 错误码说明

错误码 说明

10000 缺少请求参数或签名错误

10001 WebSocket 协议升级失败

10010-10012 数据格式/参数/签名错误

10030-10032 引擎服务异常/无可用引擎

11001-11010 引擎层错误(负载过大、参数错误、opus 压缩问题等)

20000 语音正在合成中,不允许发送新文字

20010 语音缓存已满

20030 语音服务已断连

---

五、应用场景

5.1 无障碍服务

vivo TTS 是无障碍功能的核心技术支撑,已应用于:

- vivo 听说:为听障人士提供实时语音转文字及文字转语音服务

- 无障碍通话:通话过程中实时将对方语音转为文字,或将文字转为语音回复

- 屏幕朗读:为视障用户朗读屏幕内容

5.2 智能语音助手

为 Jovi 语音助手 及 蓝心小V 提供对话语音合成能力。2024 年后,蓝心小V 与 Jovi 语音合并,依托蓝心语音大模型实现更自然的语音交互,支持无唤醒词指令、全双工对话等能力。

5.3 内容消费

- 小说阅读:长文本连续朗读,支持多种音色与语速调节

- 新闻播报:稳重音色适合新闻类内容播报

- 导航播报:低延迟短音频模型适合实时导航指令

5.4 IoT 与穿戴设备

通过 BlueOS,TTS 能力可延伸至 vivo 智能手表等 IoT 设备,支持:

- 蓝心小V 多轮对话语音交互

- AIGC 表盘语音生成

- 跨设备语音能力共享

---

六、技术演进路线

时间 里程碑

2021年 优化语音合成效果,增加多音字、韵律场景覆盖,全量上线端到端 TTS 算法

2022年 推出「vivo 听说」等无障碍功能;发表顶会论文 8 篇,获两项国际赛事第一

2024年 发布蓝心大模型矩阵,包含自研语音大模型;OriginOS 5 将蓝心小V 与 Jovi 语音合并

2025年 蓝心语音大模型与多模态技术融合,支持无唤醒词、全双工语音交互;BlueOS TTS API 正式对外开放

2026年 持续优化端侧语音大模型能力,情感化合成与多语言支持进一步增强

---

七、总结

vivo AIService TTS 是 vivo 自研的、面向端侧生态的语音合成服务,具有以下核心优势:

1. 系统级整合:深度融入 OriginOS 和 BlueOS,非第三方 SDK,系统权限与性能更优

2. 双模型架构:ShortJovi 适配实时对话,LongDefault 适配长文本朗读

3. 大模型底座:基于蓝心语音大模型,合成效果自然、支持情感化表达

4. 端侧优先:依托 VCAP 平台,支持离线合成,保护用户隐私,不受网络稳定性影响

5. 开发者友好:轻量级 API 接口,几行代码即可完成接入

如需接入开发,请访问 [vivo 开发者平台](https://developers.vivo.com.cn) 或 [BlueOS 开发文档](https://developers-watch.vivo.com.cn) 获取最新 SDK 与详细文档。

点击下载
共 4 条评论
积木 37分钟前
0 
不错不错总结的到位。
我都怀疑这玩意儿的完整名称带不带tts这三个字啊,在系统那一堆全部应用里面搜索,根本搜索不到tts相关

本楼来自:
我的世界肝帝玩家的资源库

ծածկագիր [楼主] 24分钟前
0 
他名称不带Tts
馒头菌 7分钟前
0 
不错不错,就是用这个。
添加一条新评论

登录后可以发表评论 去登录