Skip to main content
POST

授权

Authorization
string
header
必填

##所有接口均需要使用Bearer Token进行认证##

获取 API Key:

访问 API Key 管理页面 获取您的 API Key

使用时在请求头中添加:

请求体

application/json

用一段真人录音创建音色。传了 audio_url 即为声音复刻,此时请省略设计用的 voice_prompt、preview_text、sample_rate、response_format。非空设计文本、非零采样率或非空格式返回 400;sample_rate: 0/null、response_format: ""/null 按未传处理。

model
enum<string>
默认值:voice-enrollment
必填

模型名称

可用选项:
voice-enrollment
示例:

"voice-enrollment"

audio_url
string<uri>
必填

待复刻的录音文件地址。传了本字段即为声音复刻,不能与 voice_prompt 同时传

地址要求:

  • HTTP 或 HTTPS,无需鉴权即可公开访问
  • 不能是本地或内网地址,否则返回 400(invalid_media_url)
  • 长度不超过 2048 字符
  • FTP 等非 HTTP(S) 协议返回 400(invalid_media_url)
  • 只支持链接,不支持 Base64;传 Base64 data URI 返回 400(invalid_parameter)

音频要求(不满足时任务可能失败):

  • 格式:WAV、MP3 或 M4A
  • 时长:不超过 60 秒;有效人声过短也会失败(实测 2 秒的录音失败)
  • 文件大小:不超过 10 MB
  • 采样率:16 kHz 及以上
  • 必须包含清晰的人声;无声、音乐等非人声音频会被拒绝

录音建议:

  • 时长 10 ~ 20 秒,其中至少有 5 秒连续、清晰的朗读,停顿不超过 2 秒
  • 单声道;双声道录音只取第一个声道
  • 无背景音乐、噪音和其他人声;正常说话,不要唱歌

音频无法下载或不符合要求时任务失败,积分全额退还

只能复刻你本人的声音,或已获得明确授权的声音

Maximum string length: 2048
Pattern: [^\u0009-\u000D\u0020\u0085\u00A0\u1680\u2000-\u200A\u2028\u2029\u202F\u205F\u3000]
示例:

"https://your-cdn.com/samples/my-voice.wav"

preferred_name
string
必填

音色名称前缀

约束:

  • 仅英文字母和数字,1 ~ 10 位(不支持下划线及其他符号)
  • 大写字母会被转成小写
  • 不要求唯一

生成的完整音色名:复刻为 qwen-audio-3.1-tts-flash-{preferred_name}-{32 位标识},设计为 qwen-audio-3.1-tts-flash-vd-{preferred_name}-{32 位标识}

如传入 myvoice,复刻出的音色名类似:qwen-audio-3.1-tts-flash-myvoice-5996beec833d41f4982158347ba97fae

Maximum string length: 10
Pattern: ^[a-zA-Z0-9]+$
示例:

"myvoice"

language
enum<string>

复刻时是录音中所说的语言,帮助模型更准确地提取音色;设计时是音色的语言倾向,建议与 preview_text 语种一致

不传时默认 zh

可用选项:
zh,
en,
ja,
ko,
de,
fr,
it,
ru,
pt,
es
示例:

"zh"

target_model
enum<string>
默认值:qwen-audio-3.1-tts-flash

音色将由哪个 TTS 模型驱动。目前只有一个取值,不传即为该值;传别的值返回 400

可用选项:
qwen-audio-3.1-tts-flash
示例:

"qwen-audio-3.1-tts-flash"

callback_url
string<uri>

任务完成后的HTTPS回调地址

回调时机:

  • 任务完成(completed)或失败(failed)时触发
  • 在计费确认完成后发送

安全限制:

  • 仅支持HTTPS协议
  • 禁止回调到内网IP地址(127.0.0.1、10.x.x.x、172.16-31.x.x、192.168.x.x等)
  • URL长度不超过2048字符

回调机制:

  • 超时时间:10秒
  • 失败后最多重试3次(会分别在失败的1秒/2秒/4秒后进行重试)
  • 回调响应体格式与任务查询接口返回的格式一致
  • 回调地址若返回2xx状态码视为成功,其他状态码会触发重试
示例:

"https://your-domain.com/webhooks/voice-completed"

响应

创建音色的任务已受理

created
integer

任务创建时间戳

示例:

1775123456

id
string

任务ID

示例:

"task-unified-1775123456-abcd1234"

model
string

实际使用的模型名称

示例:

"voice-enrollment"

object
enum<string>

任务的具体类型

可用选项:
audio.generation.task
progress
integer

任务进度百分比 (0-100)

必填范围: 0 <= x <= 100
示例:

0

status
enum<string>

任务状态

可用选项:
pending,
processing,
completed,
failed
示例:

"pending"

task_info
object

音频任务详细信息

type
enum<string>

任务的输出类型

可用选项:
audio
示例:

"audio"

usage
object

使用量和计费信息