Skip to main content
POST

授权

Authorization
string
header
必填

##所有接口均需要使用Bearer Token进行认证##

获取 API Key:

访问 API Key 管理页面 获取您的 API Key

使用时在请求头中添加:

请求体

application/json

prompt 和 input 至少提供一个非空文本;同时提供时内容必须一致。response_format 和 format 同时提供时取值必须一致。

prompt
string
必填

待合成的文本

约束:

  • 最多 5000 字符
  • 长文本请保留标点:没有句读的连续长段会被上游截断到约 1500 个输出 token(约 120 秒音频),任务仍报成功并按实际生成的 token 计费,网关无法检测这种截断
  • 也可用 input 传入,至少提供一个非空文本;建议只传一个,同时传入且内容不同时返回 400(parameter_conflict)
  • 文本须在所选音色支持的语言范围内,否则可能出现发音错误

情感与富语言标签: 可直接在文本中嵌入标签,无需额外参数;标签文字计入计费字符

  • 控制类标签:设定其后文本的情感或风格,直到遇到下一个控制类标签。[sad] 悲伤、[amazed] 惊叹、[deep and loud shouting] 深沉大声呐喊、[trembling] 颤抖、[angry] 愤怒、[excited] 兴奋、[sarcastic] 讽刺、[curious] 好奇、[like dracula] 低沉阴森、[bored] 无聊、[tired] 疲惫、[scornful] 轻蔑、[shouting] 大喊、[asmr] ASMR 轻柔耳语、[panicked] 恐慌、[mischievously] 调皮、[empathetic] 共情、[whispers] 耳语、[reluctantly] 不情愿、[crying] 哭泣、[serious] 严肃、[very slowly] 非常缓慢、[very fast] 非常快速
  • 富语言类标签:在当前位置插入一段拟声效果,不影响前后文本的情感。[gasp] 倒吸一口气、[sighing] 叹息、[clears throat] 清嗓、[giggles] 咯咯笑、[laughing] 大笑、[cough] 咳嗽、[snorts] 哼声

示例: [excited]今天的天气真不错![laughing]我们一起出去玩吧!

enable_ssml 为 true 时,本字段按 SSML 解析

Maximum string length: 5000
Pattern: \S
示例:

"我家的后面有一个很大的花园。"

model
enum<string>
默认值:qwen-audio-3.1-tts-flash
必填

模型名称

可用选项:
qwen-audio-3.1-tts-flash
示例:

"qwen-audio-3.1-tts-flash"

input
string

prompt 的别名,文本长度和使用规则与 prompt 相同

  • prompt 和 input 至少提供一个非空文本
  • 同时提供时内容必须一致,否则返回 400(parameter_conflict)
Maximum string length: 5000
示例:

"我家的后面有一个很大的花园。"

voice
string
默认值:longanhuan_v3.1

音色名称,区分大小写

  • 共 68 个系统音色,名称、性别、适用场景见 音色列表
  • 不传时默认使用 longanhuan_v3.1
  • 也可以传你自己用 Voice Enrollment 创建的音色:复刻的形如 qwen-audio-3.1-tts-flash-{前缀}-{32 位标识},设计的形如 qwen-audio-3.1-tts-flash-vd-{前缀}-{32 位标识}。只有创建它的账号能用;别的模型创建的音色(如 qwen-voice-design 的 qwen-tts-vd-…)不能用,返回 400(invalid_voice);不存在或不属于你的音色返回 404(voice_not_found)
  • 自定义音色默认有效期为 6 小时,从创建任务完成时起算;到期后合成返回 404(voice_expired),需重新调用 Voice Enrollment 创建音色
示例:

"longanhuan_v3.1"

response_format
enum<string>
默认值:mp3

输出音频格式,支持 mp3、wav、opus,默认 mp3

  • opus 为 Ogg Opus 封装
  • 也可用 format 传入;建议只传一个,同时传入且取值不同时返回 400(parameter_conflict)
可用选项:
mp3,
wav,
opus
示例:

"mp3"

format
enum<string>

response_format 的别名,支持 mp3、wav、opus

  • 两个字段都未提供时默认使用 mp3
  • 同时提供时取值必须一致,否则返回 400(parameter_conflict)
可用选项:
mp3,
wav,
opus
示例:

"mp3"

sample_rate
enum<integer> | null
默认值:24000

输出采样率(Hz)

  • response_format 为 opus 时不支持 22050 和 44100
  • 不传或传 null 时使用默认值;传 0 或列表以外的值返回 400
可用选项:
8000,
12000,
16000,
22050,
24000,
44100,
48000,
null
示例:

24000

volume
integer
默认值:50

音量,取值范围 0 ~ 100

必填范围: 0 <= x <= 100
示例:

50

speech_rate
number
默认值:1

语速倍数

  • 1.0:正常语速(默认)
  • 2.0:两倍速;0.5:半速

取值范围 0.5 ~ 2.0。调节语速不改变输出 token 数

必填范围: 0.5 <= x <= 2
示例:

1

pitch
number
默认值:1

音调倍数

  • 1.0:默认音调
  • 大于 1.0 声音更高,小于 1.0 声音更低

取值范围 0.5 ~ 2.0

注意:调节音调会同时改变语速和音频时长

  • 音调越高语速越快、时长越短,音调越低语速越慢、时长越长,时长大约按音调值的平方反比变化
  • 以一句 1.0 时约 2.8 秒的话为例:0.8 约 4.3 秒,1.2 约 2.1 秒,0.5 约 10.9 秒,2.0 约 0.7 秒
  • 建议在 0.8 ~ 1.2 之间微调;接近 0.5 或 2.0 时语音会明显过慢或过快
  • 同时传了不等于 1.0 的 speech_rate 时,pitch 不生效;两者不能叠加使用
  • 调节音调不改变输出 token 数
必填范围: 0.5 <= x <= 2
示例:

1

instruction
string

自然语言指令,用于控制情感、语气、角色、方言等表达方式

约束:

  • 不超过 100 计费字符:汉字(包括日文汉字、韩文汉字)按 2 计,其他字符按 1 计(假名、韩文字母均按 1 计;约 50 个汉字或 100 个英文字符),超出返回 400

示例:

  • 用欢快、热情的语气说
  • 请用上海话表达(多语种与方言音色)
  • Speak slowly in a calm and gentle tone

指令本身不计入输入 token,但会影响生成音频的时长,从而影响输出 token

参数名为 instruction(单数),传 instructions 会返回 400

示例:

"用欢快、热情的语气说"

language
enum<string>

目标语种提示,用于改善数字、缩写、符号的读法和小语种的合成效果

例如英文句子 hello, this is 110 传 zh 时,110 读作「幺幺零」

不传时由模型自动判断;本参数不会翻译文本

可用选项:
zh,
en,
fr,
de,
ja,
ko,
ru,
pt,
th,
id,
vi,
es,
it,
ms,
fil,
ar
示例:

"zh"

enable_ssml
boolean
默认值:false

是否按 SSML 解析 prompt

开启后可使用 SSML 标签,例如用 <break time="1s"/> 插入停顿: <speak>欢迎收听今天的节目。<break time="1s"/>我们马上开始。</speak>

SSML 插入的停顿不计入输出 token

示例:

false

hot_fix
object

自定义发音与文本替换,用于纠正多音字、专有名词等读音

  • pronunciation:为指定词语标注拼音(音节间用空格分隔,声调用数字标注,如 tian1 qi4),纠正默认读音
  • replace:合成前把指定词语替换为目标文本,按替换后的文本合成和计费;替换后的文本同样不能超过 5000 字符,超出返回 400(prompt_too_long)

两类词条合计最多 200 条(按对象中的键值对计数),超过返回 400(invalid_parameter)

两项至少传一项,每项为非空数组,数组元素为 {"词语": "值"} 形式的对象

示例:

enable_aigc_tag
boolean
默认值:false

是否在生成的音频中嵌入 AIGC 隐性标识(wav / mp3 / opus 格式生效)

示例:

false

callback_url
string<uri>

任务完成后的HTTPS回调地址

回调时机:

  • 任务完成(completed)或失败(failed)时触发;本模型不支持取消
  • 在计费确认完成后发送

安全限制:

  • 仅支持HTTPS协议
  • 禁止回调到内网IP地址(127.0.0.1、10.x.x.x、172.16-31.x.x、192.168.x.x等)
  • URL长度不超过2048字符

回调机制:

  • 超时时间:10秒
  • 失败后最多重试3次(会分别在失败的1秒/2秒/4秒后进行重试)
  • 回调响应体格式与任务查询接口返回的格式一致
  • 回调地址若返回2xx状态码视为成功,其他状态码会触发重试
示例:

"https://your-domain.com/webhooks/tts-completed"

响应

语音合成任务创建成功

created
integer

任务创建时间戳

示例:

1790000000

id
string

任务ID

示例:

"task-unified-1790000000-abcd1234"

model
string

实际使用的模型名称

示例:

"qwen-audio-3.1-tts-flash"

object
enum<string>

任务的具体类型

可用选项:
audio.generation.task
progress
integer

任务进度百分比 (0-100)

必填范围: 0 <= x <= 100
示例:

0

status
enum<string>

任务状态

可用选项:
pending,
processing,
completed,
failed
示例:

"pending"

task_info
object

音频任务详细信息

type
enum<string>

任务的输出类型

可用选项:
audio
示例:

"audio"

usage
object

使用量和计费信息