通过 EvoLink API 接入
适合:产品后端、批量任务、自动化工作流
在你的服务端直接调用 EvoLink 统一音色 API,自己控制模型 ID、参数、任务队列、callback 和结果存储。
- 1在 Playground 用真实 brief 验证效果和成本
- 2在控制台创建 EvoLink API Key
- 3按上方路由卡选择与任务匹配的模型 ID
- 4提交任务,通过轮询或 HTTPS callback 获取结果
通过 EvoLink 统一 API 接入 Qwen Audio 3.1 TTS Flash:68 个系统音色、声音复刻与设计。查看模型 ID、输入输出 Token 计费和异步语音合成流程。
用系统音色把文字合成语音;或把模型切换为 Voice Enrollment,复刻或设计自己的音色,创建后马上就能用。
创建语音合成任务
固定为 qwen-audio-3.1-tts-flash最多 5,000 字。可在文本里加 [excited]、[laughing] 这类标签来调整语气。
可以从右侧的列表里选系统音色,也可以在这里直接输入或粘贴音色名(包括自己创建的音色)。音色名区分大小写。请选择支持文本语言的音色。
可选。用来控制情感、语速或方言。最多 100 个计费字符(汉字每个按 2 个计,含日文里的汉字;假名、韩文及其他字符按 1 个计)。
可选,提示文本所用的语言。
调整音调会同时改变音频时长;语速不是 1.0 时音调不生效。
生成的音频会显示在这里。
语音合成按实际使用的 token 计费,输入和输出分开计价。创建自己的音色按个收一笔很小的固定费用。失败任务全额退款。
首次测试成本
一句短句 · 输入 14 + 输出 33 个 token一句短句
充值 $10 约可合成 158,139 句这样的短句。
在 Playground 里保持默认音色、输入一句话即可。提交时按文本长度预扣,完成后按实际使用的 token 结算,多退少补。
Qwen Audio 3.1 TTS Flash 测试预算参考
按你预计的测试次数选择充值金额。适合首次验证。
适合给一批文章或课程配音。
适合正式接入前的测试。
token 数为实测样例。实际用量与语言、音色和朗读方式有关:数字、大写字母和符号会被逐个读出,输出 token 更多。
qwen-audio-3.1-tts-flash| 计费项 | 对应内容 | 单价 | 计费方式 |
|---|---|---|---|
| 输出 token | 生成的语音。音频越长,输出 token 越多。 | $1.765/百万 token120 积分 | 按实际用量 |
| 输入 token | 你发送的文本。风格指令不计入。 | $0.221/百万 token15 积分 | 按实际用量 |
生成的语音。音频越长,输出 token 越多。
你发送的文本。风格指令不计入。
voice-enrollment| 计费项 | 对应内容 | 单价 | 计费方式 |
|---|---|---|---|
| 创建音色 | 声音复刻(audio_url)或声音设计(voice_prompt),价格相同。音色绑定 qwen-audio-3.1-tts-flash。 | $0.0001/个音色0.001 积分 | 按创建的音色个数 |
声音复刻(audio_url)或声音设计(voice_prompt),价格相同。音色绑定 qwen-audio-3.1-tts-flash。
计费说明
Qwen Audio 3.1 TTS Flash 把文字合成自然的语音,内置 68 个系统音色,可用一句指令控制情感、语速和方言。同一个页面上的 Voice Enrollment 用来给它创建你自己的音色:用一小段授权录音复刻声音,或用文字描述设计一个新音色。EvoLink 把两者都做成同一个音频接口上的异步任务,用同一个 API Key 调用。
qwen-audio-3.1-tts-flash语音合成。传 prompt 和可选的 voice,返回音频文件。按输入、输出 token 计费。
voice-enrollment给 Qwen Audio 3.1 TTS Flash 创建自己的音色。传 audio_url 用录音复刻声音,或传 voice_prompt 和 preview_text 用文字描述设计音色。按个收固定费用。
先列语音合成的参数,再列 voice-enrollment 用到的字段。完整的请求与响应结构见 API 页签。
promptstring默认值: 必填
要合成的文本,最多 5,000 字。可在文本里直接写 [excited] 这类情感标签。
voicestring默认值: longanhuan_v3.1
系统音色(区分大小写),或当前账号用 voice-enrollment 创建的音色。
instructionstring默认值: 无
用自然语言控制情感、语速或方言。最多 100 个计费字符。
response_formatenum默认值: mp3
mp3、wav 或 opus。opus 只支持 8、12、16、24、48 kHz。
speech_rate / pitchnumber默认值: 1.0
取值都是 0.5–2.0。调整 pitch 会同时改变音频时长;speech_rate 不是 1.0 时 pitch 不生效。
audio_urlstring · voice-enrollment默认值: 复刻时必填
公开的 HTTP(S) 录音链接,WAV、MP3 或 M4A,含清晰人声,最长 60 秒、不超过 10 MB。传它即为声音复刻。
voice_prompt + preview_textstring · voice-enrollment默认值: 设计时必填
最多 500 字的音色描述,加一句 15–200 字的试听文本。传它们即为声音设计。
preferred_namestring · voice-enrollment默认值: 必填
1–10 位英文字母或数字,会成为返回的音色名的一部分。
需要嵌入产品、运行批量任务时,直接使用 EvoLink API;需要快速创作、试验或让 Agent 完成接入时,可在 Codex、Claude 或 Gemini 中调用。两种方式共用 EvoLink API Key、余额、模型路由和任务记录。
适合:产品后端、批量任务、自动化工作流
在你的服务端直接调用 EvoLink 统一音色 API,自己控制模型 ID、参数、任务队列、callback 和结果存储。
适合:Codex、Claude、Gemini 中的创作与开发任务
把输出目标、素材和验收标准交给 Agent,它可以选择路由、组装请求、跟踪任务并返回结果,不需要你手写每一步。
示例展示最短可运行流程:创建任务、保存返回的 task ID,然后轮询或等待 HTTPS callback。完整参数与响应字段见 API 标签页。
curl -X POST https://api.evolink.ai/v1/audios/generations \
-H "Authorization: Bearer $EVOLINK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen-audio-3.1-tts-flash",
"prompt": "Hello, and welcome to EvoLink. This is a quick demo of Qwen Audio 3.1 TTS Flash.",
"voice": "Emily_v3.1",
"instruction": "Speak warmly, at a relaxed pace",
"response_format": "mp3"
}'
# Save the returned task ID, then query; the audio link is in results[0]:
curl https://api.evolink.ai/v1/tasks/{task_id} \
-H "Authorization: Bearer $EVOLINK_API_KEY"对照上方参数卡逐项检查:取值范围、可选枚举、素材数量和文件类型必须与所选路由一致。
检查 Authorization Bearer Token,并在控制台确认可用余额与任务计费。
检查肖像权、品牌素材、可读文字、敏感内容以及输入素材的合规性。
Qwen Audio 3.1 TTS Flash 任务最终状态为失败时不扣费。保留 task ID,查看最终状态,先判断是校验、审核还是执行环节出错,再决定是否重试。
callback_url 必须是公网 HTTPS 地址,不能是 localhost 或内网地址。始终保留 task ID 作为轮询兜底。
| 对比项 | 系统音色 | 声音复刻 | 声音设计 |
|---|---|---|---|
| 模型 ID | qwen-audio-3.1-tts-flash | voice-enrollment | voice-enrollment |
| 你需要提供 | 从列表里选一个音色名 | 一段声音样本(audio_url) | 音色描述 + 试听文本 |
| 你会得到 | 音频 | 音色名 | 音色名 + 试听音频 |
| 创建费用 | 无 | 每个音色约 $0.0001 | 每个音色约 $0.0001 |
| 适合 | 快速上手 | 复现某位已授权的说话人 | 全新音色、角色音、品牌语气探索 |
合成语音用 qwen-audio-3.1-tts-flash,创建音色用 voice-enrollment。两者都发到 POST /v1/audios/generations,并返回任务 ID。
轮询 /v1/tasks/{task_id} 或使用 callback_url 获取结果。完成时间随文本和音色操作变化,不保证固定延迟。音频链接在 24 小时后过期。
自己创建的音色只能用于 qwen-audio-3.1-tts-flash,并且只有创建它的账号能用。用别人的音色名调用会返回 404。音色在创建后 6 小时内有效。
未知参数、无效的音色名或超长文本会立即返回 400,而不是先预扣积分、稍后才失败。
一个 API Key 通用于 Qwen、Seed Audio、视频、图像和大语言模型。
在同一个控制台跟踪积分、消费和模型用量。
随时查看任务处于已提交、处理中、已完成还是失败状态,并显示真实的失败原因。
语音按实际 token 用量结算,失败任务预扣的积分全额退还。
此 EvoLink 路由采用异步 HTTP 任务,不支持 SSE 或 WebSocket 流式输出。向 POST /v1/audios/generations 提交请求,再通过 GET /v1/tasks/{task_id} 获取音频 URL。厂商的流式 API 使用不同协议。
不是。本页对应托管模型 qwen-audio-3.1-tts-flash。Qwen3-TTS、Qwen Audio TTS-Next 和 Qwen Audio Realtime 是不同模型,其模型 ID、参数、权重和流式能力不能直接用于本页型号。
语音合成用 qwen-audio-3.1-tts-flash,创建自己的音色用 voice-enrollment。两者都发到 POST /v1/audios/generations。
语音按实际使用的 token 计费,输入和输出分开计价,实时价格见价格板块。创建自己的音色按个收一笔很小的固定费用。失败任务全额退款。
token 数要合成完才知道,所以创建任务时先按文本长度预扣,通常比最后实际扣的多。任务完成后按实际使用的 token 结算,多的退回。数字、字母、符号这类会被逐个念出来的内容,实际用量可能超过预扣,这时会补扣差额。
调用 voice-enrollment:传 audio_url 复刻声音,或传 voice_prompt 和 preview_text 设计音色;从完成的任务里读取 result_data.voice,把它作为 voice 参数传给 qwen-audio-3.1-tts-flash。自己创建的音色在创建后 6 小时内有效,过期后需要重新创建。
声音复刻根据一小段录音复现真实说话人的声音,只返回音色名。声音设计根据文字描述创建全新音色,并额外返回一段试听音频。两者价格相同,都只能用于 qwen-audio-3.1-tts-flash。
必须满足:WAV、MP3 或 M4A,最长 60 秒、不超过 10 MB,采样率 16 kHz 及以上,且包含清晰人声。效果最佳的是 10–20 秒的单人录音:单声道、停顿不超过 2 秒、无背景音乐或噪声。
不能。自己创建的音色只有创建它的账号能用,其他账号用同一个音色名调用会返回 404。
只能复刻你自己的声音,或你已获得明确授权的声音。未经同意复刻他人声音是不允许的。
传一句简短的 instruction,例如“语气温柔、语速放慢”;也可以直接在文本里写 [excited] 这类标签。四个多语种音色在指令里要求时还能说多种汉语方言。
失败任务不扣费,预扣的积分全额退还。任务结果里会显示失败原因。