多语言声音克隆 API

你的声音,也能跨越语言。

准备一次已授权的录音,之后复用音色 ID,把文本变成语音,无需逐句重新录制。

10 种合成语言$8 / 百万字符MP3 / WAV
你的授权录音

自行录音 · 上传 · 邀请说话人

准备一次voice_id复用到新的文本
英语en中文zh德语de日语ja法语fr西班牙语es韩语ko葡萄牙语pt俄语ru意大利语it

流程示意。系统不会翻译你的文本。

从录音到 API

克隆一次,按需生成。

  1. 准备获得授权的录音

    使用自己的声音、上传有权使用的音频,或通过控制台发送录音邀请。确保录音清晰、转写准确。

  2. 等待音色准备完成

    注册时会处理合成所需的参考音频。保存返回的音色 ID;在已准备好的音色间切换,不需要再次注册。

  3. 提交目标语言的文本

    复用音色 ID,传入文本及其语言。SDK 处理区域路由和排队等待,返回生成的音频。

Node.js · 生成调用片段
import { VoiceAPI } from '@castreader/voice-api';

const client = new VoiceAPI();
// 填入已准备完成的授权克隆音色 ID。
const voiceId = 'YOUR_VOICE_ID';

const { audio } = await client.generate({
  voice: voiceId,
  text: '每一个故事,都值得被听见。',
  language: 'zh',
  output_format: 'mp3',
});

// 同一个音色 ID,不同语言的文本。
const english = await client.generate({
  voice: voiceId,
  text: 'Every story deserves to be heard.',
  language: 'en',
  output_format: 'mp3',
});

先安装 SDK 并设置 CASTREADER_API_KEY;每次成功生成分别计费。

注册参数与完整快速入门 →

按生成量付费,无需月度 API 订阅

$8 / 百万字符。

支持的合成语言使用同一用量单价。优先抵扣可用免费字符;排队等待和下载保留结果,不会再次产生生成费用。

计算使用费用

接入前,先了解能力边界。

声音克隆会翻译内容吗?

不会。中文语音需要中文文本,日语语音需要日语文本。短文本或混合语言的自动识别可能不确定,必要时请明确指定语言;发音和声音相似度会受到录音及语言影响。

可以生成长篇有声书或实时对话吗?

当前排队任务最多 500 字符,每个工作区最多 1 个并发生成。长内容需要应用端分段及组装音频;当前版本未开放流式输出、实时对话或情绪控制。

谁可以访问私有克隆音色?

私有克隆音色归属工作区,需要经过授权的 API 访问,不会加入公开音色展示。你必须获得说话人对克隆及具体使用目的的授权。

如何开始使用?

API 目前需邀请开通。开通后,在控制台准备音色、生成一段短语音,再复制接入示例。阅读应用订阅与 API 计费独立。