GPT Image 2.5 Flare 与 Sunburst 已上线 EvoLink立即体验

Qwen Audio 3.1 TTS Flash API

通过 EvoLink 统一 API 接入 Qwen Audio 3.1 TTS Flash:68 个系统音色、声音复刻与设计。查看模型 ID、输入输出 Token 计费和异步语音合成流程。

Alibaba语音合成可用
$1.765 起 / 百万输出 token
语音合成系统音色声音复刻声音设计情感控制多语种与方言
生产路由已上线
模型特点
语音自然,用一句指令就能控制情感、方言和语速
适用场景
语音助手、有声书、视频配音、客服播报
输入
最多 5,000 字的文本,可另加一句风格指令
输出
MP3、WAV 或 Opus 音频,可用系统音色、复刻音色或设计音色

接入 API 前,先试用 Qwen Audio 3.1 TTS Flash。

用系统音色把文字合成语音;或把模型切换为 Voice Enrollment,复刻或设计自己的音色,创建后马上就能用。

创建语音合成任务

固定为 qwen-audio-3.1-tts-flash
80/5,000

最多 5,000 字。可在文本里加 [excited]、[laughing] 这类标签来调整语气。

可以从右侧的列表里选系统音色,也可以在这里直接输入或粘贴音色名(包括自己创建的音色)。音色名区分大小写。请选择支持文本语言的音色。

0/100

可选。用来控制情感、语速或方言。最多 100 个计费字符(汉字每个按 2 个计,含日文里的汉字;假名、韩文及其他字符按 1 个计)。

可选,提示文本所用的语言。

1.0x
1.0x

调整音调会同时改变音频时长;语速不是 1.0 时音调不生效。

50
预估 ~$0.00090.0578 积分
提交时按 106 个输入 token + 468 个输出 token 预扣(按文本估算),完成后按实际用量结算,多退少补。
就绪
生成的音频

生成的音频会显示在这里。

历史记录
Qwen Audio 3.1 TTS Flash 任务会显示在这里。

充值前先算清 Qwen Audio 3.1 TTS Flash 的成本。

语音合成按实际使用的 token 计费,输入和输出分开计价。创建自己的音色按个收一笔很小的固定费用。失败任务全额退款。

首次测试成本

一句短句 · 输入 14 + 输出 33 个 token
实测样例
积分0.0043

一句短句

预估成本~$0.0001

充值 $10 约可合成 158,139 句这样的短句。

在 Playground 里保持默认音色、输入一句话即可。提交时按文本长度预扣,完成后按实际使用的 token 结算,多退少补。

Qwen Audio 3.1 TTS Flash 测试预算参考

按你预计的测试次数选择充值金额。
充值积分
$10
约可合成 475 篇 5,000 字的中文长文

适合首次验证。

$50
约可合成 2,375 篇 5,000 字的中文长文

适合给一批文章或课程配音。

$100
约可合成 4,751 篇 5,000 字的中文长文

适合正式接入前的测试。

Qwen Audio 3.1 TTS Flash 常见成本示例

一句短句输入 14 + 输出 33 个 token · 实测
~$0.0001
~0.0043 cr
一篇长文5,000 个汉字 · 输入 5,000 + 输出 11,300 个 token · 实测
~$0.022
~1.431 cr
创建一个音色1 个音色 · 声音复刻或声音设计
$0.0001
0.001 cr

token 数为实测样例。实际用量与语言、音色和朗读方式有关:数字、大写字母和符号会被逐个读出,输出 token 更多。

Qwen Audio 3.1 TTS Flash 模型定价

Qwen Audio 3.1 TTS Flashqwen-audio-3.1-tts-flash
输出 token$1.765/百万 token

生成的语音。音频越长,输出 token 越多。

输入 token$0.221/百万 token

你发送的文本。风格指令不计入。

Voice Enrollmentvoice-enrollment
创建音色$0.0001/个音色

声音复刻(audio_url)或声音设计(voice_prompt),价格相同。音色绑定 qwen-audio-3.1-tts-flash。

计费说明

  • 语音合成在创建任务时按文本长度估算并预扣积分;任务完成后按实际使用的输入、输出 token 结算,多退少补。
  • 两段 token 费用各自向上取整到最小积分单位(0.0001 积分)后再相加。
  • 创建音色只计费一次。用自己的音色合成语音,价格与系统音色相同。
  • 失败任务全额退款。未通过校验的请求返回 400,不扣费。

Qwen Audio 3.1 TTS Flash API:支持系统音色、复刻音色和设计音色的语音合成

Qwen Audio 3.1 TTS Flash 把文字合成自然的语音,内置 68 个系统音色,可用一句指令控制情感、语速和方言。同一个页面上的 Voice Enrollment 用来给它创建你自己的音色:用一小段授权录音复刻声音,或用文字描述设计一个新音色。EvoLink 把两者都做成同一个音频接口上的异步任务,用同一个 API Key 调用。

输入
文本 ≤5,000 字
输出
MP3 / WAV / Opus
音色
68 个系统音色 + 自己的音色
采样率
8–48 kHz
计费
按实际 token 用量

调用 Qwen Audio 3.1 TTS Flash API 时使用的模型 ID

Qwen Audio 3.1 TTS Flash

qwen-audio-3.1-tts-flash

语音合成。传 prompt 和可选的 voice,返回音频文件。按输入、输出 token 计费。

Voice Enrollment

voice-enrollment

给 Qwen Audio 3.1 TTS Flash 创建自己的音色。传 audio_url 用录音复刻声音,或传 voice_prompt 和 preview_text 用文字描述设计音色。按个收固定费用。

Qwen Audio 3.1 TTS Flash API 关键参数

先列语音合成的参数,再列 voice-enrollment 用到的字段。完整的请求与响应结构见 API 页签。

promptstring

默认值: 必填

要合成的文本,最多 5,000 字。可在文本里直接写 [excited] 这类情感标签。

voicestring

默认值: longanhuan_v3.1

系统音色(区分大小写),或当前账号用 voice-enrollment 创建的音色。

instructionstring

默认值: 无

用自然语言控制情感、语速或方言。最多 100 个计费字符。

response_formatenum

默认值: mp3

mp3、wav 或 opus。opus 只支持 8、12、16、24、48 kHz。

speech_rate / pitchnumber

默认值: 1.0

取值都是 0.5–2.0。调整 pitch 会同时改变音频时长;speech_rate 不是 1.0 时 pitch 不生效。

audio_urlstring · voice-enrollment

默认值: 复刻时必填

公开的 HTTP(S) 录音链接,WAV、MP3 或 M4A,含清晰人声,最长 60 秒、不超过 10 MB。传它即为声音复刻。

voice_prompt + preview_textstring · voice-enrollment

默认值: 设计时必填

最多 500 字的音色描述,加一句 15–200 字的试听文本。传它们即为声音设计。

preferred_namestring · voice-enrollment

默认值: 必填

1–10 位英文字母或数字,会成为返回的音色名的一部分。

两种方式接入 Qwen Audio 3.1 TTS Flash:EvoLink API 或 Agent

需要嵌入产品、运行批量任务时,直接使用 EvoLink API;需要快速创作、试验或让 Agent 完成接入时,可在 Codex、Claude 或 Gemini 中调用。两种方式共用 EvoLink API Key、余额、模型路由和任务记录。

方式一

通过 EvoLink API 接入

适合:产品后端、批量任务、自动化工作流

在你的服务端直接调用 EvoLink 统一音色 API,自己控制模型 ID、参数、任务队列、callback 和结果存储。

  1. 1在 Playground 用真实 brief 验证效果和成本
  2. 2在控制台创建 EvoLink API Key
  3. 3按上方路由卡选择与任务匹配的模型 ID
  4. 4提交任务,通过轮询或 HTTPS callback 获取结果
方式二

在 Agent 中调用

适合:Codex、Claude、Gemini 中的创作与开发任务

把输出目标、素材和验收标准交给 Agent,它可以选择路由、组装请求、跟踪任务并返回结果,不需要你手写每一步。

  1. 1在本地环境变量中设置 EVOLINK_API_KEY,不要写进代码或 Prompt
  2. 2描述输出目标、参考素材和关键参数
  3. 3让 Agent 调用 Qwen Audio 3.1 TTS Flash 路由并保存 task ID
  4. 4让 Agent 轮询到最终状态、下载结果并报告失败原因

用 Qwen Audio 3.1 TTS Flash 可以做什么

用 Qwen Audio 3.1 TTS Flash 做语音助手

给助手一个固定的声音,每次回复再用一句风格指令调整语气。

用 Qwen Audio 3.1 TTS Flash 做有声书和课程

每次请求可朗读最多 5,000 字的章节,用沉稳的旁白音色。

视频旁白与配音

生成普通话、方言、英文等语言的配音,并可在文本里加情感标签。

用 Voice Enrollment 做品牌音色

复刻一位授权的说话人,或设计一个新音色,创建后 6 小时内在合成里使用这个音色名。

Qwen Audio 3.1 TTS Flash API 代码示例与错误处理

示例展示最短可运行流程:创建任务、保存返回的 task ID,然后轮询或等待 HTTPS callback。完整参数与响应字段见 API 标签页。

查看完整 API 文档
cURL
curl -X POST https://api.evolink.ai/v1/audios/generations \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen-audio-3.1-tts-flash",
    "prompt": "Hello, and welcome to EvoLink. This is a quick demo of Qwen Audio 3.1 TTS Flash.",
    "voice": "Emily_v3.1",
    "instruction": "Speak warmly, at a relaxed pace",
    "response_format": "mp3"
  }'

# Save the returned task ID, then query; the audio link is in results[0]:
curl https://api.evolink.ai/v1/tasks/{task_id} \
  -H "Authorization: Bearer $EVOLINK_API_KEY"

参数校验失败

对照上方参数卡逐项检查:取值范围、可选枚举、素材数量和文件类型必须与所选路由一致。

鉴权或余额问题

检查 Authorization Bearer Token,并在控制台确认可用余额与任务计费。

内容或素材被拒

检查肖像权、品牌素材、可读文字、敏感内容以及输入素材的合规性。

任务失败或超时

Qwen Audio 3.1 TTS Flash 任务最终状态为失败时不扣费。保留 task ID,查看最终状态,先判断是校验、审核还是执行环节出错,再决定是否重试。

未收到 callback

callback_url 必须是公网 HTTPS 地址,不能是 localhost 或内网地址。始终保留 task ID 作为轮询兜底。

系统音色、声音复刻、声音设计怎么选

对比项系统音色声音复刻声音设计
模型 IDqwen-audio-3.1-tts-flashvoice-enrollmentvoice-enrollment
你需要提供从列表里选一个音色名一段声音样本(audio_url)音色描述 + 试听文本
你会得到音频音色名音色名 + 试听音频
创建费用无每个音色约 $0.0001每个音色约 $0.0001
适合快速上手复现某位已授权的说话人全新音色、角色音、品牌语气探索

Qwen Audio 3.1 TTS Flash 的路由、任务流程与计费

一个接口,两个模型 ID

合成语音用 qwen-audio-3.1-tts-flash,创建音色用 voice-enrollment。两者都发到 POST /v1/audios/generations,并返回任务 ID。

异步任务

轮询 /v1/tasks/{task_id} 或使用 callback_url 获取结果。完成时间随文本和音色操作变化,不保证固定延迟。音频链接在 24 小时后过期。

你的音色只有你能用

自己创建的音色只能用于 qwen-audio-3.1-tts-flash,并且只有创建它的账号能用。用别人的音色名调用会返回 404。音色在创建后 6 小时内有效。

为什么通过 EvoLink 使用 Qwen Audio 3.1 TTS Flash

提前校验

未知参数、无效的音色名或超长文本会立即返回 400,而不是先预扣积分、稍后才失败。

统一 API

一个 API Key 通用于 Qwen、Seed Audio、视频、图像和大语言模型。

统一余额

在同一个控制台跟踪积分、消费和模型用量。

任务状态追踪

随时查看任务处于已提交、处理中、已完成还是失败状态,并显示真实的失败原因。

用多少付多少

语音按实际 token 用量结算,失败任务预扣的积分全额退还。

Qwen Audio 3.1 TTS Flash 之外,EvoLink 上的其他音频模型

Doubao Seed Audio 1.0

Doubao Seed Audio 1.0

BytePlus 提示词驱动的音频生成,覆盖人声、对白、音效、音乐和环境音。

查看 API
Suno

Suno

Suno 音乐生成,支持人声、歌词和纯音乐。

查看 API

Qwen Audio 3.1 TTS Flash 常见问题

EvoLink 此模型支持流式输出或 WebSocket 吗?

此 EvoLink 路由采用异步 HTTP 任务,不支持 SSE 或 WebSocket 流式输出。向 POST /v1/audios/generations 提交请求,再通过 GET /v1/tasks/{task_id} 获取音频 URL。厂商的流式 API 使用不同协议。

Qwen Audio 3.1 TTS Flash 和 Qwen3-TTS 是同一个模型吗?

不是。本页对应托管模型 qwen-audio-3.1-tts-flash。Qwen3-TTS、Qwen Audio TTS-Next 和 Qwen Audio Realtime 是不同模型,其模型 ID、参数、权重和流式能力不能直接用于本页型号。

Qwen Audio 3.1 TTS Flash 的模型 ID 是什么?

语音合成用 qwen-audio-3.1-tts-flash,创建自己的音色用 voice-enrollment。两者都发到 POST /v1/audios/generations。

Qwen Audio 3.1 TTS Flash 怎么收费?

语音按实际使用的 token 计费,输入和输出分开计价,实时价格见价格板块。创建自己的音色按个收一笔很小的固定费用。失败任务全额退款。

为什么预扣的比最后实际扣的多?

token 数要合成完才知道,所以创建任务时先按文本长度预扣,通常比最后实际扣的多。任务完成后按实际使用的 token 结算,多的退回。数字、字母、符号这类会被逐个念出来的内容,实际用量可能超过预扣,这时会补扣差额。

怎么创建并使用自己的音色?

调用 voice-enrollment:传 audio_url 复刻声音,或传 voice_prompt 和 preview_text 设计音色;从完成的任务里读取 result_data.voice,把它作为 voice 参数传给 qwen-audio-3.1-tts-flash。自己创建的音色在创建后 6 小时内有效,过期后需要重新创建。

声音复刻和声音设计有什么区别?

声音复刻根据一小段录音复现真实说话人的声音,只返回音色名。声音设计根据文字描述创建全新音色,并额外返回一段试听音频。两者价格相同,都只能用于 qwen-audio-3.1-tts-flash。

什么样的声音样本适合声音复刻?

必须满足:WAV、MP3 或 M4A,最长 60 秒、不超过 10 MB,采样率 16 kHz 及以上,且包含清晰人声。效果最佳的是 10–20 秒的单人录音:单声道、停顿不超过 2 秒、无背景音乐或噪声。

别人能用我创建的音色吗?

不能。自己创建的音色只有创建它的账号能用,其他账号用同一个音色名调用会返回 404。

可以复刻谁的声音?

只能复刻你自己的声音,或你已获得明确授权的声音。未经同意复刻他人声音是不允许的。

怎么控制情感、语速或方言?

传一句简短的 instruction,例如“语气温柔、语速放慢”;也可以直接在文本里写 [excited] 这类标签。四个多语种音色在指令里要求时还能说多种汉语方言。

任务失败了怎么办?

失败任务不扣费,预扣的积分全额退还。任务结果里会显示失败原因。