EvoLink API で連携
用途:プロダクトのバックエンド、一括処理、自動化ワークフロー
サーバーから EvoLink の統合ボイス API を呼び出し、モデル ID、パラメータ、キュー、callback、結果保存を制御します。
- 1実際のブリーフを Playground で試し、品質とコストを確認
- 2コンソールで EvoLink API キーを作成
- 3上のルートカードからタスクに合うモデル ID を選択
- 4タスクを送信し、ポーリングまたは HTTPS callback で結果を取得
EvoLink 統一 API で Qwen Audio 3.1 TTS Flash を利用。68 種類の音声、ボイスクローンと音声デザインに対応。モデル ID、入出力トークン料金、非同期の音声合成フローを確認できます。
システムボイスでテキストを音声に変換するか、モデルを Voice Enrollment に切り替えて独自のボイスをクローンまたはデザインし、すぐに使えます。
音声タスクを作成
qwen-audio-3.1-tts-flash に固定最大 5,000 文字。テキスト中に [excited] や [laughing] などのタグを加えると、話し方を調整できます。
一覧からシステムボイスを選ぶか、ここにボイス名を直接入力または貼り付けてください(自分で作成したボイスも使えます)。ボイス名は大文字小文字を区別します。テキストの言語に対応したボイスを選んでください。
任意。感情、話す速さ、方言を制御します。最大 100 課金文字(漢字は 2 文字、かな・ハングル・その他の文字は 1 文字として数えます)。
テキストの言語を伝える任意のヒントです。
ピッチを変えると長さも変わります。速度が 1.0 以外の場合は効果がありません。
生成した音声はここに表示されます。
音声合成は、入力と出力で別々の料金がかかり、実際に使用したトークン数で課金されます。カスタムボイスの作成は 1 ボイスあたり少額の定額です。失敗したタスクは全額返金されます。
初回テスト費用
短い 1 文 · 入力 14 + 出力 33 トークン短い 1 文
10 ドル分のクレジットで、このような文を約 158,139 件合成できます。
Playground でデフォルトのボイスのまま、1 文を入力してください。タスク作成時にテキストの長さに応じてクレジットが確保され、完了後は実際に使用したトークン分で精算されます(余った分は返却、不足分は追加で課金)。
Qwen Audio 3.1 TTS Flash のテスト予算ガイド
想定するテスト回数に合わせて金額を選んでください。初回検証向け。
記事や講座をまとめてナレーションする場合に最適。
本番導入前のテスト向け。
トークン数は実測サンプルです。実際の使用量は、言語、ボイス、テキストの読まれ方によって変わります。数字、大文字、記号は 1 文字ずつ読み上げられ、出力トークンが多くなります。
qwen-audio-3.1-tts-flash| 課金項目 | 対象 | 料金 | 課金方式 |
|---|---|---|---|
| 出力トークン | 生成された音声。音声が長いほど出力トークンが増えます。 | $1.765/100万トークン120 クレジット | 実際の使用量に応じて |
| 入力トークン | 送信したテキスト。スタイル指示は含まれません。 | $0.221/100万トークン15 クレジット | 実際の使用量に応じて |
生成された音声。音声が長いほど出力トークンが増えます。
送信したテキスト。スタイル指示は含まれません。
voice-enrollment| 課金項目 | 対象 | 料金 | 課金方式 |
|---|---|---|---|
| ボイスを作成 | ボイスクローン(audio_url)またはボイスデザイン(voice_prompt)。料金は同じです。ボイスは qwen-audio-3.1-tts-flash に紐付けられます。 | $0.0001/ボイス0.001 クレジット | 作成したボイスごと |
ボイスクローン(audio_url)またはボイスデザイン(voice_prompt)。料金は同じです。ボイスは qwen-audio-3.1-tts-flash に紐付けられます。
課金に関する注意
Qwen Audio 3.1 TTS Flash は、68 種類のシステムボイスと、感情・話す速さ・方言を指示で制御できる機能により、テキストを自然な音声に変換します。同じページの Voice Enrollment では、このモデル用の独自ボイスを作成できます。同意を得た話者の短い録音からクローンするか、テキストの説明から新しいボイスをデザインします。EvoLink では、どちらも 1 つの音声エンドポイントと 1 つの API キーで、非同期タスクとして利用できます。
qwen-audio-3.1-tts-flashテキスト読み上げ。prompt と任意の voice を送ると、音声ファイルが返されます。入力・出力トークンで課金されます。
voice-enrollmentQwen Audio 3.1 TTS Flash 用のカスタムボイスを作成します。audio_url を送ると録音からボイスをクローンし、voice_prompt と preview_text を送ると説明からボイスをデザインします。1 ボイスあたり定額です。
音声合成のパラメータを先に、続いて voice-enrollment で使うフィールドを記載しています。完全なリクエスト/レスポンス構造は API タブをご覧ください。
promptstringデフォルト: 必須
合成するテキスト。最大 5,000 文字。[excited] などの感情タグをテキスト中に書けます。
voicestringデフォルト: longanhuan_v3.1
システムボイス(大文字小文字を区別)、または voice-enrollment でお使いのアカウントが作成したボイス。
instructionstringデフォルト: なし
感情、話す速さ、方言を自然言語で制御します。最大 100 課金文字。
response_formatenumデフォルト: mp3
mp3、wav、opus。Opus は 8、12、16、24、48 kHz のみ対応。
speech_rate / pitchnumberデフォルト: 1.0
どちらも 0.5〜2.0 の範囲です。ピッチを変えると長さも変わり、speech_rate が 1.0 以外の場合は無視されます。
audio_urlstring · voice-enrollmentデフォルト: クローン時は必須
クリアな音声を含む WAV、MP3、M4A サンプルへの公開 HTTP(S) リンク。最大 60 秒・10 MB。指定するとボイスクローンになります。
voice_prompt + preview_textstring · voice-enrollmentデフォルト: デザイン時は必須
最大 500 文字のボイスの説明と、試聴音声用の 15〜200 文字の文章。指定するとボイスデザインになります。
preferred_namestring · voice-enrollmentデフォルト: 必須
英字または数字を 1〜10 文字。返されるボイス名の一部になります。
プロダクトへの組み込みや一括処理には EvoLink API、素早い制作・開発には Codex、Claude、Gemini からの Agent 呼び出しを利用できます。どちらも同じ API キー、残高、モデルルート、タスク履歴を共有します。
用途:プロダクトのバックエンド、一括処理、自動化ワークフロー
サーバーから EvoLink の統合ボイス API を呼び出し、モデル ID、パラメータ、キュー、callback、結果保存を制御します。
用途:Codex、Claude、Gemini での制作・開発タスク
生成目的、素材、合格条件を Agent に渡すと、ルート選択、リクエスト作成、タスク追跡、結果取得まで任せられます。各手順を自分で実装する必要はありません。
最短の実行フローとして、タスクを作成し、返された task ID を保存して、ポーリングまたは HTTPS callback を待つ方法を示します。全パラメータとレスポンスは API タブで確認できます。
curl -X POST https://api.evolink.ai/v1/audios/generations \
-H "Authorization: Bearer $EVOLINK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen-audio-3.1-tts-flash",
"prompt": "Hello, and welcome to EvoLink. This is a quick demo of Qwen Audio 3.1 TTS Flash.",
"voice": "Emily_v3.1",
"instruction": "Speak warmly, at a relaxed pace",
"response_format": "mp3"
}'
# Save the returned task ID, then query; the audio link is in results[0]:
curl https://api.evolink.ai/v1/tasks/{task_id} \
-H "Authorization: Bearer $EVOLINK_API_KEY"上のパラメータカードと照らし合わせて、値の範囲、許可されるオプション、素材数、ファイル形式が選択したルートの要件を満たすか確認してください。
Authorization Bearer Token を確認し、コンソールで残高とタスク課金を確認してください。
肖像権、ブランド素材、判読可能な文字、センシティブな内容、入力素材の適法性を確認してください。
最終状態が失敗となった Qwen Audio 3.1 TTS Flash タスクは課金されません。task ID を保存し、検証・審査・実行のどこで失敗したか確認してから再試行してください。
callback_url には公開 HTTPS URL が必要です。localhost やプライベートネットワークは使えません。ポーリング用に task ID も保存してください。
| 特徴 | システムボイス | ボイスクローン | ボイスデザイン |
|---|---|---|---|
| モデル ID | qwen-audio-3.1-tts-flash | voice-enrollment | voice-enrollment |
| 用意するもの | リストから選ぶボイス名 | 音声サンプル(audio_url) | ボイスの説明 + プレビューテキスト |
| 得られるもの | 音声 | ボイス名 | ボイス名 + 試聴音声 |
| セットアップ費用 | なし | 1 ボイスあたり ~$0.0001 | 1 ボイスあたり ~$0.0001 |
| 最適な用途 | すぐに使い始めたい場合 | 同意を得た特定の話者の再現 | 新しいボイス、キャラクター、ブランドトーンの探索 |
音声を合成するには qwen-audio-3.1-tts-flash、ボイスを作成するには voice-enrollment を送信します。どちらも POST /v1/audios/generations に送られ、タスク ID が返されます。
/v1/tasks/{task_id} のポーリング、または callback_url で結果を取得します。処理時間はテキストや音声操作によって変わり、固定の遅延は保証しません。音声リンクは 24 時間後に失効します。
カスタムボイスは qwen-audio-3.1-tts-flash でのみ、作成したアカウントのみが使えます。他人のボイス名を指定すると 404 が返されます。ボイスは作成から 6 時間利用できます。
不明なパラメータ、無効なボイス名、長すぎるテキストは、クレジットを確保して後から失敗するのではなく、すぐに 400 で返されます。
1 つの API キーで Qwen、Seed Audio、動画、画像、LLM モデルを利用可能。
1 つのコンソールでクレジット、支出、モデル使用量を管理。
タスクが送信済み、処理中、完了、失敗のどれかを、実際の失敗理由とともに確認できます。
音声は実際のトークン使用量で精算され、失敗したタスクで確保されたクレジットは全額返金されます。


この EvoLink ルートは非同期 HTTP タスクを使用し、SSE や WebSocket ストリーミングには対応していません。POST /v1/audios/generations に送信し、GET /v1/tasks/{task_id} で音声 URL を取得します。提供元のストリーミング API は別のプロトコルです。
いいえ。このページはホスト型モデル qwen-audio-3.1-tts-flash を扱います。Qwen3-TTS、Qwen Audio TTS-Next、Qwen Audio Realtime は別のモデルであり、モデル ID、パラメータ、重み、ストリーミング機能も異なります。
音声合成には qwen-audio-3.1-tts-flash、カスタムボイスの作成には voice-enrollment を使います。どちらも POST /v1/audios/generations に送信します。
音声は実際に使用したトークン数で課金され、入力と出力の料金は別々で、料金セクションにリアルタイムで表示されます。カスタムボイスの作成は 1 ボイスあたり少額の定額です。失敗したタスクは全額返金されます。
トークン数は合成後にしか分からないため、タスク作成時にテキストの長さに応じた金額を確保します(通常は最終的な請求額より多めです)。完了すると実際に使用したトークン分が課金され、余った分は返却されます。数字・英字・記号のように 1 文字ずつ読み上げられる内容では、確保した金額を超えることがあり、その場合は不足分が追加で課金されます。
audio_url を指定して voice-enrollment を呼び出すとボイスをクローンでき、voice_prompt と preview_text を指定するとボイスをデザインできます。完了したタスクから result_data.voice を読み取り、qwen-audio-3.1-tts-flash に voice パラメータとして渡してください。カスタムボイスは作成から 6 時間利用できます。期限が切れたら新しく作成してください。
ボイスクローンは短い録音から実在の話者の声を再現し、ボイス名のみを返します。ボイスデザインはテキストの説明から新しいボイスを作成し、試聴音声も返します。料金はどちらも同じで、どちらも qwen-audio-3.1-tts-flash でのみ使えます。
必須条件:WAV、MP3、M4A で最大 60 秒・10 MB、サンプルレート 16 kHz 以上、クリアな音声を含むこと。最良の結果を得るには、1 人の話者による 10〜20 秒の録音で、無音は 2 秒以内、モノラル、BGM やノイズがないものを使ってください。
いいえ。カスタムボイスを使えるのは作成したアカウントのみで、他のアカウントが同じボイス名を指定すると 404 が返されます。
自分の声、または使用について明示的な許可を得た声のみです。同意なく他人の声をクローンすることは禁止されています。
「ゆっくり優しく話す」のような短い指示を渡すか、[excited] のようなタグをテキストに直接書きます。4 種類の多言語ボイスは、指示で求めれば複数の中国語方言も話せます。
失敗したタスクは課金されません。確保されたクレジットは全額返金されます。タスク結果に失敗理由が表示されます。