跳转到文档正文
浏览文档

场景支持

让语音真正进入你的产品。

接口提供音色、短文本合成和可下载音频。以下八类场景说明现在能做什么,以及哪些环节需要由你的应用补齐。

所有场景共用的能力

  • 合成语言:英语、中文、德语、日语、法语、西班牙语、韩语、葡萄牙语、俄语、意大利语
  • 从音色库选择,或用已获授权的录音创建私有音色。首次参考会自动准备,后续请求复用声音 ID。
  • 输出 MP3 / WAV,每个排队任务最多 500 个规范化字符;直接语音请求最多 120 字符。
  • MP3 支持 0.5–2 倍语速。英文可选返回单词或实测词组时间戳,其他语言目前仅返回音频。
  • 成功结果需在 24 小时内下载,长期保存请存入自己的应用;使用量与区域数据规则仍然适用。

查看完整限制

当前可构建的八类场景

阅读与有声内容

把文章片段、资讯摘要和故事段落变成可保存、可重复播放的声音。

怎么接入

每个短段落提交一个任务;英文可选返回时间戳,在应用中实现单词或词组跟读高亮。

接入边界

文档提取、长文拆分和播放列表由应用处理。时间戳可能不可用,需保留普通播放作为回退。

相关接口文档

语言学习与教学

为单词卡、例句和课程讲解加入一致的声音,保存音频,随时复习。

怎么接入

传入教学文本和对应语言。MP3 支持 0.5–2 倍语速,将生成的例句与学习卡一起保存。

接入边界

不提供口语评分、语音识别或音素发音词典;教学素材发布前仍需听审。

相关接口文档

视频与广告配音

为短视频、产品介绍和广告文案生成旁白,下载后直接进入剪辑流程。

怎么接入

在控制台选择音色并复用区域 ID,按脚本片段提交任务,完成后取得音频文件。

接入边界

视频剪辑、口型同步、音乐和音效由制作工具完成。音色风格标签是描述,不是情绪控制参数。

相关接口文档

产品引导与语音通知

为新手引导、操作步骤、无障碍提示和语音通知提供统一、易辨识的声音。

怎么接入

提前生成常用提示语,在应用中保存文件,事件发生时直接播放。也可将音频接入已有电话系统。

接入边界

接口负责生成音频,不负责消息推送或电话接入;不承诺实时响应或安全关键告警时延。

相关接口文档

多语言本地化

为不同地区提供相应语言的解说、引导和内容配音,复用选定音色。

怎么接入

提供已写好的目标语言文本并传入语言代码,核对音色支持范围,在选定区域使用对应 ID。

接入边界

接口不会自动翻译,也不按页面语言合成。控制台可辅助识别文本语言,过短或混合文本需明确选择。

相关接口文档

角色台词与品牌声音

为游戏角色、故事人物或品牌建立持续使用的声音,按角色分别生成台词。

怎么接入

选用音色库,或创建已获授权的私有音色;维护角色与声音 ID 的映射,逐句生成。

接入边界

对话顺序、停顿和音频拼接由应用处理;当前不提供原生多说话人合成或文字设计新声音。

相关接口文档

AI 回答播报

为已有文字助手、知识库问答和摘要工具增加语音输出。

怎么接入

由业务系统先生成答案,再按接口长度限制拆分并提交语音任务,播放完成的文件。

接入边界

仅提供 TTS,不包含大模型回答、麦克风识别、轮次检测或可打断的实时对话。

相关接口文档

内容工作流自动化

为 CMS、课程制作平台和内部发布工具加入可重复执行的音频生产环节。

怎么接入

在工作区限制内创建短任务,保存任务 ID,退避轮询,并在结果过期前下载。

接入边界

批量调度、长期存储和发布由应用负责,不提供无限并发批量或整本书长任务接口。

相关接口文档

一套可以复用的接入流程

  1. 在控制台选好音色,保存对应区域的声音 ID,并在应用中使用同一账户与工作区。
  2. 准备文本、对应语言与输出格式。合成语言与界面语言、样本语言分别处理。
  3. 用稳定的 Idempotency-Key 提交短任务,保存任务 ID,退避查询,处理音色准备和资源排队。
  4. 成功后下载音频,接入播放器、剪辑工具或发布流程。相同成功请求使用原幂等键重试,不产生新的生成费。

Node.js 和 Python 客户端

当前未提供的原生能力

情绪指令、笑声或音效标签、发音词典、文字设计声音、多人对话项目、自动翻译和视频配音一体化尚不是公开接口能力。音色库中的风格标签用于筛选描述,不是合成控制参数。

当前公开版本未开放实时对话、可打断交互、流式输出、原生长篇或无限批量生成。对时间敏感的提示应提前生成,不应假定有延迟 SLA。

仅使用已获授权的声音与内容。场景可接入不等于每个音色都适合每种语言或制作风格,发布前请试听实际成品。