GPT Image 2.5 Flare & Sunburst が EvoLink で利用可能にGPT Image 2.5 を試す

Qwen Audio 3.1 TTS Flash API

EvoLink 統一 API で Qwen Audio 3.1 TTS Flash を利用。68 種類の音声、ボイスクローンと音声デザインに対応。モデル ID、入出力トークン料金、非同期の音声合成フローを確認できます。

Alibabaテキスト読み上げ利用可能
$1.765 から / 100万出力トークン
テキスト読み上げシステムボイスボイスクローンボイスデザイン感情コントロール多言語・方言対応
本番ルート公開中
モデルの特長
指示で感情・方言・話す速さを制御できる自然な音声
ユースケース
音声アシスタント、オーディオブック、動画ナレーション、カスタマーサービス
入力
最大 5,000 文字のテキストと、任意のスタイル指示
出力
システムボイス、クローンボイス、デザインボイスによる MP3、WAV、Opus 音声

API 統合の前に Qwen Audio 3.1 TTS Flash を試す。

システムボイスでテキストを音声に変換するか、モデルを Voice Enrollment に切り替えて独自のボイスをクローンまたはデザインし、すぐに使えます。

音声タスクを作成

qwen-audio-3.1-tts-flash に固定
80/5,000

最大 5,000 文字。テキスト中に [excited] や [laughing] などのタグを加えると、話し方を調整できます。

一覧からシステムボイスを選ぶか、ここにボイス名を直接入力または貼り付けてください(自分で作成したボイスも使えます)。ボイス名は大文字小文字を区別します。テキストの言語に対応したボイスを選んでください。

0/100

任意。感情、話す速さ、方言を制御します。最大 100 課金文字(漢字は 2 文字、かな・ハングル・その他の文字は 1 文字として数えます)。

テキストの言語を伝える任意のヒントです。

1.0x
1.0x

ピッチを変えると長さも変わります。速度が 1.0 以外の場合は効果がありません。

50
見積もり ~$0.00090.0578 クレジット
テキストから見積もった入力 106 + 出力 468 トークン分を事前に確保します。完了後は実際に使用したトークン分で精算され、余った分は返却、不足分は追加で課金されます。
準備完了
生成された音声

生成した音声はここに表示されます。

履歴
Qwen Audio 3.1 TTS Flash のタスクはここに表示されます。

クレジットを追加する前に Qwen Audio 3.1 TTS Flash の費用を把握。

音声合成は、入力と出力で別々の料金がかかり、実際に使用したトークン数で課金されます。カスタムボイスの作成は 1 ボイスあたり少額の定額です。失敗したタスクは全額返金されます。

初回テスト費用

短い 1 文 · 入力 14 + 出力 33 トークン
実測サンプル
クレジット0.0043

短い 1 文

概算費用~$0.0001

10 ドル分のクレジットで、このような文を約 158,139 件合成できます。

Playground でデフォルトのボイスのまま、1 文を入力してください。タスク作成時にテキストの長さに応じてクレジットが確保され、完了後は実際に使用したトークン分で精算されます(余った分は返却、不足分は追加で課金)。

Qwen Audio 3.1 TTS Flash のテスト予算ガイド

想定するテスト回数に合わせて金額を選んでください。
クレジットを追加
$10
中国語 5,000 文字の長い記事を約 475 本

初回検証向け。

$50
中国語 5,000 文字の長い記事を約 2,375 本

記事や講座をまとめてナレーションする場合に最適。

$100
中国語 5,000 文字の長い記事を約 4,751 本

本番導入前のテスト向け。

Qwen Audio 3.1 TTS Flash のコスト例

短い 1 文入力 14 + 出力 33 トークン · 実測
~$0.0001
~0.0043 cr
長い記事中国語 5,000 文字 · 入力 5,000 + 出力 11,300 トークン · 実測
~$0.022
~1.431 cr
カスタムボイスを作成ボイス 1 件 · ボイスクローンまたはボイスデザイン
$0.0001
0.001 cr

トークン数は実測サンプルです。実際の使用量は、言語、ボイス、テキストの読まれ方によって変わります。数字、大文字、記号は 1 文字ずつ読み上げられ、出力トークンが多くなります。

Qwen Audio 3.1 TTS Flash の料金

Qwen Audio 3.1 TTS Flashqwen-audio-3.1-tts-flash
出力トークン$1.765/100万トークン

生成された音声。音声が長いほど出力トークンが増えます。

入力トークン$0.221/100万トークン

送信したテキスト。スタイル指示は含まれません。

Voice Enrollmentvoice-enrollment
ボイスを作成$0.0001/ボイス

ボイスクローン(audio_url)またはボイスデザイン(voice_prompt)。料金は同じです。ボイスは qwen-audio-3.1-tts-flash に紐付けられます。

課金に関する注意

  • 音声合成では、タスク作成時にテキストの長さから見積もったクレジットを確保します。タスクが完了すると、実際に使用した入力・出力トークン分で精算され、余った分は返却、不足分は追加で課金されます。
  • 2 種類のトークン料金は、それぞれ最小クレジット単位(0.0001 クレジット)に切り上げてから合算されます。
  • ボイスの作成は 1 回だけ課金されます。カスタムボイスでの音声合成は、システムボイスと同じ料金です。
  • 失敗したタスクは全額返金されます。検証に失敗したリクエストは 400 を返し、課金されません。

Qwen Audio 3.1 TTS Flash API:システムボイス、クローン、デザインボイスによるテキスト読み上げ

Qwen Audio 3.1 TTS Flash は、68 種類のシステムボイスと、感情・話す速さ・方言を指示で制御できる機能により、テキストを自然な音声に変換します。同じページの Voice Enrollment では、このモデル用の独自ボイスを作成できます。同意を得た話者の短い録音からクローンするか、テキストの説明から新しいボイスをデザインします。EvoLink では、どちらも 1 つの音声エンドポイントと 1 つの API キーで、非同期タスクとして利用できます。

入力
テキスト ≤5,000 文字
出力
MP3 / WAV / Opus
ボイス
システム 68 種 + 独自ボイス
サンプルレート
8–48 kHz
課金
使用トークン数に応じて

API 呼び出しで使う Qwen Audio 3.1 TTS Flash のモデル ID

Qwen Audio 3.1 TTS Flash

qwen-audio-3.1-tts-flash

テキスト読み上げ。prompt と任意の voice を送ると、音声ファイルが返されます。入力・出力トークンで課金されます。

Voice Enrollment

voice-enrollment

Qwen Audio 3.1 TTS Flash 用のカスタムボイスを作成します。audio_url を送ると録音からボイスをクローンし、voice_prompt と preview_text を送ると説明からボイスをデザインします。1 ボイスあたり定額です。

Qwen Audio 3.1 TTS Flash API の主要パラメータ

音声合成のパラメータを先に、続いて voice-enrollment で使うフィールドを記載しています。完全なリクエスト/レスポンス構造は API タブをご覧ください。

promptstring

デフォルト: 必須

合成するテキスト。最大 5,000 文字。[excited] などの感情タグをテキスト中に書けます。

voicestring

デフォルト: longanhuan_v3.1

システムボイス(大文字小文字を区別)、または voice-enrollment でお使いのアカウントが作成したボイス。

instructionstring

デフォルト: なし

感情、話す速さ、方言を自然言語で制御します。最大 100 課金文字。

response_formatenum

デフォルト: mp3

mp3、wav、opus。Opus は 8、12、16、24、48 kHz のみ対応。

speech_rate / pitchnumber

デフォルト: 1.0

どちらも 0.5〜2.0 の範囲です。ピッチを変えると長さも変わり、speech_rate が 1.0 以外の場合は無視されます。

audio_urlstring · voice-enrollment

デフォルト: クローン時は必須

クリアな音声を含む WAV、MP3、M4A サンプルへの公開 HTTP(S) リンク。最大 60 秒・10 MB。指定するとボイスクローンになります。

voice_prompt + preview_textstring · voice-enrollment

デフォルト: デザイン時は必須

最大 500 文字のボイスの説明と、試聴音声用の 15〜200 文字の文章。指定するとボイスデザインになります。

preferred_namestring · voice-enrollment

デフォルト: 必須

英字または数字を 1〜10 文字。返されるボイス名の一部になります。

Qwen Audio 3.1 TTS Flash を使う 2 つの方法:EvoLink API または Agent

プロダクトへの組み込みや一括処理には EvoLink API、素早い制作・開発には Codex、Claude、Gemini からの Agent 呼び出しを利用できます。どちらも同じ API キー、残高、モデルルート、タスク履歴を共有します。

方法 1

EvoLink API で連携

用途:プロダクトのバックエンド、一括処理、自動化ワークフロー

サーバーから EvoLink の統合ボイス API を呼び出し、モデル ID、パラメータ、キュー、callback、結果保存を制御します。

  1. 1実際のブリーフを Playground で試し、品質とコストを確認
  2. 2コンソールで EvoLink API キーを作成
  3. 3上のルートカードからタスクに合うモデル ID を選択
  4. 4タスクを送信し、ポーリングまたは HTTPS callback で結果を取得
方法 2

Agent から呼び出す

用途:Codex、Claude、Gemini での制作・開発タスク

生成目的、素材、合格条件を Agent に渡すと、ルート選択、リクエスト作成、タスク追跡、結果取得まで任せられます。各手順を自分で実装する必要はありません。

  1. 1EVOLINK_API_KEY をローカル環境変数に設定し、コードや Prompt には書かない
  2. 2出力目的、参照素材、主要パラメータを説明
  3. 3Agent に Qwen Audio 3.1 TTS Flash のルートを呼ばせ、task ID を保存
  4. 4最終状態まで確認し、結果をダウンロードして失敗理由を報告させる

Qwen Audio 3.1 TTS Flash で作れるもの

Qwen Audio 3.1 TTS Flash で作る音声アシスタント

アシスタントに一貫したボイスを与え、短いスタイル指示で返答ごとにトーンを調整します。

Qwen Audio 3.1 TTS Flash でオーディオブックや講座

落ち着いたナレーターのボイスで、1 リクエストあたり最大 5,000 文字の章をナレーションします。

動画ナレーションとダビング

標準中国語、中国語の方言、英語などのナレーションを、インラインの感情タグ付きで生成します。

Voice Enrollment でブランドボイスを作る

同意を得た話者をクローンするか新しいボイスをデザインすれば、作成から 6 時間、合成呼び出しでそのボイス名を利用できます。

Qwen Audio 3.1 TTS Flash API のコード例とエラー処理

最短の実行フローとして、タスクを作成し、返された task ID を保存して、ポーリングまたは HTTPS callback を待つ方法を示します。全パラメータとレスポンスは API タブで確認できます。

API ドキュメントをすべて見る
cURL
curl -X POST https://api.evolink.ai/v1/audios/generations \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen-audio-3.1-tts-flash",
    "prompt": "Hello, and welcome to EvoLink. This is a quick demo of Qwen Audio 3.1 TTS Flash.",
    "voice": "Emily_v3.1",
    "instruction": "Speak warmly, at a relaxed pace",
    "response_format": "mp3"
  }'

# Save the returned task ID, then query; the audio link is in results[0]:
curl https://api.evolink.ai/v1/tasks/{task_id} \
  -H "Authorization: Bearer $EVOLINK_API_KEY"

パラメータ検証エラー

上のパラメータカードと照らし合わせて、値の範囲、許可されるオプション、素材数、ファイル形式が選択したルートの要件を満たすか確認してください。

認証または残高の問題

Authorization Bearer Token を確認し、コンソールで残高とタスク課金を確認してください。

コンテンツまたは素材が拒否された

肖像権、ブランド素材、判読可能な文字、センシティブな内容、入力素材の適法性を確認してください。

タスク失敗またはタイムアウト

最終状態が失敗となった Qwen Audio 3.1 TTS Flash タスクは課金されません。task ID を保存し、検証・審査・実行のどこで失敗したか確認してから再試行してください。

Callback を受信できない

callback_url には公開 HTTPS URL が必要です。localhost やプライベートネットワークは使えません。ポーリング用に task ID も保存してください。

システムボイス・ボイスクローン・ボイスデザインの比較

特徴システムボイスボイスクローンボイスデザイン
モデル IDqwen-audio-3.1-tts-flashvoice-enrollmentvoice-enrollment
用意するものリストから選ぶボイス名音声サンプル(audio_url)ボイスの説明 + プレビューテキスト
得られるもの音声ボイス名ボイス名 + 試聴音声
セットアップ費用なし1 ボイスあたり ~$0.00011 ボイスあたり ~$0.0001
最適な用途すぐに使い始めたい場合同意を得た特定の話者の再現新しいボイス、キャラクター、ブランドトーンの探索

Qwen Audio 3.1 TTS Flash のルーティング、タスクのライフサイクル、課金

1 つのエンドポイントに 2 つのモデル ID

音声を合成するには qwen-audio-3.1-tts-flash、ボイスを作成するには voice-enrollment を送信します。どちらも POST /v1/audios/generations に送られ、タスク ID が返されます。

非同期タスク

/v1/tasks/{task_id} のポーリング、または callback_url で結果を取得します。処理時間はテキストや音声操作によって変わり、固定の遅延は保証しません。音声リンクは 24 時間後に失効します。

作成したボイスはあなただけのもの

カスタムボイスは qwen-audio-3.1-tts-flash でのみ、作成したアカウントのみが使えます。他人のボイス名を指定すると 404 が返されます。ボイスは作成から 6 時間利用できます。

EvoLink で Qwen Audio 3.1 TTS Flash を利用する理由

早期バリデーション

不明なパラメータ、無効なボイス名、長すぎるテキストは、クレジットを確保して後から失敗するのではなく、すぐに 400 で返されます。

統一 API

1 つの API キーで Qwen、Seed Audio、動画、画像、LLM モデルを利用可能。

統一残高

1 つのコンソールでクレジット、支出、モデル使用量を管理。

タスク状態の追跡

タスクが送信済み、処理中、完了、失敗のどれかを、実際の失敗理由とともに確認できます。

使った分だけ支払い

音声は実際のトークン使用量で精算され、失敗したタスクで確保されたクレジットは全額返金されます。

Qwen Audio 3.1 TTS Flash 以外の EvoLink の音声モデル

Doubao Seed Audio 1.0

Doubao Seed Audio 1.0

BytePlus のプロンプトベース音声生成。ボイス、対話、効果音、音楽、環境音に対応。

APIを見る
Suno

Suno

Suno の音楽生成。ボーカル、歌詞、インストゥルメンタルに対応。

APIを見る

Qwen Audio 3.1 TTS Flash のよくある質問

EvoLink のこのモデルはストリーミングや WebSocket に対応していますか?

この EvoLink ルートは非同期 HTTP タスクを使用し、SSE や WebSocket ストリーミングには対応していません。POST /v1/audios/generations に送信し、GET /v1/tasks/{task_id} で音声 URL を取得します。提供元のストリーミング API は別のプロトコルです。

Qwen Audio 3.1 TTS Flash は Qwen3-TTS と同じモデルですか?

いいえ。このページはホスト型モデル qwen-audio-3.1-tts-flash を扱います。Qwen3-TTS、Qwen Audio TTS-Next、Qwen Audio Realtime は別のモデルであり、モデル ID、パラメータ、重み、ストリーミング機能も異なります。

Qwen Audio 3.1 TTS Flash のモデル ID は?

音声合成には qwen-audio-3.1-tts-flash、カスタムボイスの作成には voice-enrollment を使います。どちらも POST /v1/audios/generations に送信します。

Qwen Audio 3.1 TTS Flash の料金は?

音声は実際に使用したトークン数で課金され、入力と出力の料金は別々で、料金セクションにリアルタイムで表示されます。カスタムボイスの作成は 1 ボイスあたり少額の定額です。失敗したタスクは全額返金されます。

最終的な請求額より多く確保されるのはなぜですか?

トークン数は合成後にしか分からないため、タスク作成時にテキストの長さに応じた金額を確保します(通常は最終的な請求額より多めです)。完了すると実際に使用したトークン分が課金され、余った分は返却されます。数字・英字・記号のように 1 文字ずつ読み上げられる内容では、確保した金額を超えることがあり、その場合は不足分が追加で課金されます。

自分のボイスを作成して使うには?

audio_url を指定して voice-enrollment を呼び出すとボイスをクローンでき、voice_prompt と preview_text を指定するとボイスをデザインできます。完了したタスクから result_data.voice を読み取り、qwen-audio-3.1-tts-flash に voice パラメータとして渡してください。カスタムボイスは作成から 6 時間利用できます。期限が切れたら新しく作成してください。

ボイスクローンとボイスデザインの違いは?

ボイスクローンは短い録音から実在の話者の声を再現し、ボイス名のみを返します。ボイスデザインはテキストの説明から新しいボイスを作成し、試聴音声も返します。料金はどちらも同じで、どちらも qwen-audio-3.1-tts-flash でのみ使えます。

ボイスクローンに適したサンプルは?

必須条件:WAV、MP3、M4A で最大 60 秒・10 MB、サンプルレート 16 kHz 以上、クリアな音声を含むこと。最良の結果を得るには、1 人の話者による 10〜20 秒の録音で、無音は 2 秒以内、モノラル、BGM やノイズがないものを使ってください。

他の人が自分のカスタムボイスを使えますか?

いいえ。カスタムボイスを使えるのは作成したアカウントのみで、他のアカウントが同じボイス名を指定すると 404 が返されます。

誰の声をクローンできますか?

自分の声、または使用について明示的な許可を得た声のみです。同意なく他人の声をクローンすることは禁止されています。

感情、話す速さ、方言はどう制御しますか?

「ゆっくり優しく話す」のような短い指示を渡すか、[excited] のようなタグをテキストに直接書きます。4 種類の多言語ボイスは、指示で求めれば複数の中国語方言も話せます。

タスクが失敗したら?

失敗したタスクは課金されません。確保されたクレジットは全額返金されます。タスク結果に失敗理由が表示されます。