GPT Image 2.5 Flare & Sunburst가 EvoLink에 출시되었습니다GPT Image 2.5 체험하기

Qwen Audio 3.1 TTS Flash API

EvoLink 통합 API로 Qwen Audio 3.1 TTS Flash를 사용하세요. 68개 음성, 음성 복제와 설계를 지원합니다. 모델 ID, 입력·출력 토큰 요금과 비동기 합성 흐름을 확인하세요.

Alibaba텍스트 음성 변환사용 가능
$1.765부터 / 출력 토큰 100만 개
텍스트 음성 변환시스템 보이스보이스 클로닝보이스 디자인감정 제어다국어·방언
프로덕션 라우트라이브
모델 특징
지시문으로 감정·방언·속도를 제어하는 자연스러운 음성
활용 사례
음성 비서, 오디오북, 영상 내레이션, 고객 서비스
입력
최대 5,000자 텍스트와 선택 사항인 스타일 지시문
출력
시스템·클로닝·디자인 보이스로 만든 MP3, WAV 또는 Opus 오디오

API 연동 전에 Qwen Audio 3.1 TTS Flash를 사용해 보세요.

시스템 보이스로 텍스트를 음성으로 바꾸거나, 모델을 Voice Enrollment로 전환해 나만의 보이스를 클로닝하거나 디자인하고 바로 사용해 보세요.

음성 합성 작업 생성

qwen-audio-3.1-tts-flash(으)로 고정
80/5,000

최대 5,000자. 텍스트에 [excited]나 [laughing] 같은 태그를 넣어 말투를 조절할 수 있습니다.

목록에서 시스템 보이스를 고르거나, 여기에 보이스 이름을 직접 입력하거나 붙여넣으세요(직접 만든 보이스 포함). 보이스 이름은 대소문자를 구분합니다. 텍스트 언어를 지원하는 보이스를 선택하세요.

0/100

선택 사항. 감정, 속도, 방언을 제어합니다. 최대 100 과금 문자(한자는 2자, 한글·가나 및 그 밖의 문자는 1자로 계산됩니다).

텍스트 언어에 대한 선택적 힌트입니다.

1.0x
1.0x

음높이를 바꾸면 길이도 달라지며, 속도가 1.0이 아니면 적용되지 않습니다.

50
예상 ~$0.00090.0578 크레딧
텍스트를 기준으로 추정한 입력 106 + 출력 468 토큰만큼 먼저 선점됩니다. 완료되면 실제 사용한 토큰 기준으로 정산되어 남은 금액은 환불되고, 부족한 금액은 추가로 과금됩니다.
준비 완료
생성된 오디오

생성된 오디오가 여기에 표시됩니다.

기록
Qwen Audio 3.1 TTS Flash 작업이 여기에 표시됩니다.

크레딧을 추가하기 전에 Qwen Audio 3.1 TTS Flash 비용을 파악하세요.

음성 합성은 입력과 출력 요금이 따로 적용되며, 실제 사용한 토큰 기준으로 과금됩니다. 커스텀 보이스 생성은 보이스당 소액의 고정 요금입니다. 실패한 작업은 전액 환불됩니다.

첫 테스트 비용

짧은 문장 하나 · 입력 14 + 출력 33 토큰
실측 샘플
크레딧0.0043

짧은 문장 하나

예상 비용~$0.0001

10달러 크레딧으로 이런 문장을 약 158,139개 만들 수 있습니다.

Playground에서 기본 보이스를 그대로 두고 문장 하나를 입력하세요. 작업 생성 시 텍스트 길이를 기준으로 크레딧이 선점되며, 완료되면 실제 사용한 토큰 기준으로 정산됩니다(남은 금액은 환불, 부족한 금액은 추가 과금).

Qwen Audio 3.1 TTS Flash 테스트 예산 가이드

예상 테스트 횟수에 맞춰 금액을 선택하세요.
크레딧 추가
$10
중국어 5,000자 분량의 긴 글 약 475편

첫 검증에 적합합니다.

$50
중국어 5,000자 분량의 긴 글 약 2,375편

여러 편의 글이나 강의를 내레이션하기에 적합합니다.

$100
중국어 5,000자 분량의 긴 글 약 4,751편

프로덕션 연동 전 테스트에 적합합니다.

Qwen Audio 3.1 TTS Flash 비용 예시

짧은 문장 하나입력 14 + 출력 33 토큰 · 실측
~$0.0001
~0.0043 cr
긴 글 하나중국어 5,000자 · 입력 5,000 + 출력 11,300 토큰 · 실측
~$0.022
~1.431 cr
커스텀 보이스 생성보이스 1개 · 보이스 클로닝 또는 보이스 디자인
$0.0001
0.001 cr

토큰 수는 실측 샘플입니다. 실제 사용량은 언어, 보이스, 텍스트를 읽는 방식에 따라 달라집니다. 숫자, 대문자, 기호는 하나씩 읽히므로 출력 토큰이 더 많이 사용됩니다.

Qwen Audio 3.1 TTS Flash 요금

Qwen Audio 3.1 TTS Flashqwen-audio-3.1-tts-flash
출력 토큰$1.765/100만 토큰

생성된 음성입니다. 오디오가 길수록 출력 토큰이 더 많이 사용됩니다.

입력 토큰$0.221/100만 토큰

전송한 텍스트입니다. 스타일 지시문은 포함되지 않습니다.

Voice Enrollmentvoice-enrollment
보이스 생성$0.0001/보이스

보이스 클로닝(audio_url) 또는 보이스 디자인(voice_prompt), 요금은 동일합니다. 보이스는 qwen-audio-3.1-tts-flash에 연결됩니다.

과금 참고 사항

  • 음성 합성은 작업 생성 시 텍스트 길이를 기준으로 추정한 만큼 크레딧을 선점합니다. 작업이 완료되면 실제 사용한 입력·출력 토큰 기준으로 정산되어 남은 금액은 환불되고, 부족한 금액은 추가로 과금됩니다.
  • 두 토큰 요금은 각각 최소 크레딧 단위(0.0001 크레딧)로 올림한 뒤 합산됩니다.
  • 보이스 생성은 한 번만 과금됩니다. 커스텀 보이스로 음성을 합성하는 비용은 시스템 보이스와 같습니다.
  • 실패한 작업은 전액 환불됩니다. 검증에 실패한 요청은 400을 반환하며 과금되지 않습니다.

Qwen Audio 3.1 TTS Flash API: 시스템·클로닝·디자인 보이스를 지원하는 텍스트 음성 변환

Qwen Audio 3.1 TTS Flash는 68개의 시스템 보이스와 지시문 기반 감정·속도·방언 제어로 텍스트를 자연스러운 음성으로 바꿉니다. 같은 페이지의 Voice Enrollment로 이 모델에서 쓸 나만의 보이스도 만들 수 있습니다. 동의한 화자의 짧은 녹음을 클로닝하거나, 텍스트 설명으로 새 보이스를 디자인하세요. EvoLink는 두 기능을 하나의 오디오 엔드포인트에서 하나의 API 키로 쓰는 비동기 작업으로 제공합니다.

입력
텍스트 ≤5,000자
출력
MP3 / WAV / Opus
보이스
시스템 68개 + 직접 만든 보이스
샘플레이트
8–48 kHz
과금
사용한 토큰 기준

API 호출에 쓰는 Qwen Audio 3.1 TTS Flash 모델 ID

Qwen Audio 3.1 TTS Flash

qwen-audio-3.1-tts-flash

텍스트 음성 변환. prompt와 선택 사항인 voice를 보내면 오디오 파일이 반환됩니다. 입력·출력 토큰 기준으로 과금됩니다.

Voice Enrollment

voice-enrollment

Qwen Audio 3.1 TTS Flash에서 쓸 커스텀 보이스를 만듭니다. audio_url을 보내면 녹음으로 보이스를 클로닝하고, voice_prompt와 preview_text를 보내면 설명으로 보이스를 디자인합니다. 보이스당 고정 요금입니다.

Qwen Audio 3.1 TTS Flash API 주요 파라미터

음성 합성 파라미터를 먼저 소개하고, 이어서 voice-enrollment에서 쓰는 필드를 소개합니다. 전체 요청·응답 구조는 API 탭에서 확인하세요.

promptstring

기본값: 필수

합성할 텍스트, 최대 5,000자. [excited] 같은 감정 태그를 텍스트 안에 직접 쓸 수 있습니다.

voicestring

기본값: longanhuan_v3.1

시스템 보이스(대소문자 구분) 또는 내 계정에서 voice-enrollment로 만든 보이스.

instructionstring

기본값: 없음

감정, 속도, 방언을 자연어로 제어합니다. 최대 100 과금 문자.

response_formatenum

기본값: mp3

mp3, wav 또는 opus. Opus는 8, 12, 16, 24, 48 kHz만 지원합니다.

speech_rate / pitchnumber

기본값: 1.0

둘 다 0.5~2.0 범위입니다. pitch를 바꾸면 길이도 달라지며, speech_rate가 1.0이 아니면 무시됩니다.

audio_urlstring · voice-enrollment

기본값: 클로닝 시 필수

깨끗한 음성이 담긴 WAV, MP3 또는 M4A 샘플의 공개 HTTP(S) 링크, 최대 60초, 10 MB. 보이스 클로닝을 선택합니다.

voice_prompt + preview_textstring · voice-enrollment

기본값: 디자인 시 필수

최대 500자의 보이스 설명과 미리듣기 오디오가 읽을 15~200자 문장. 보이스 디자인을 선택합니다.

preferred_namestring · voice-enrollment

기본값: 필수

영문자 또는 숫자 1~10자. 반환되는 보이스 이름의 일부가 됩니다.

Qwen Audio 3.1 TTS Flash을(를) 사용하는 두 가지 방법: EvoLink API 또는 Agent

제품 연동과 배치 작업에는 EvoLink API를 사용하고, 빠른 제작·개발 작업에는 Codex, Claude 또는 Gemini에서 Agent로 호출할 수 있습니다. 두 방식은 동일한 EvoLink API 키, 잔액, 모델 라우트, 작업 기록을 공유합니다.

방법 1

EvoLink API로 연동

추천: 제품 백엔드, 배치 작업, 자동화 워크플로

서버에서 EvoLink 통합 보이스 API를 직접 호출하고 모델 ID, 파라미터, 작업 큐, callback, 결과 저장을 제어합니다.

  1. 1실제 브리프로 Playground에서 결과와 비용 검증
  2. 2콘솔에서 EvoLink API 키 생성
  3. 3위 라우트 카드에서 작업에 맞는 모델 ID 선택
  4. 4작업을 제출하고 폴링 또는 HTTPS callback으로 결과 수신
방법 2

Agent로 호출

추천: Codex, Claude, Gemini의 제작 및 개발 작업

생성 목표, 자료, 검수 조건을 Agent에 전달하면 라우트 선택, 요청 구성, 작업 추적, 결과 반환까지 맡길 수 있습니다. 각 단계를 직접 코딩할 필요가 없습니다.

  1. 1EVOLINK_API_KEY를 로컬 환경 변수로 설정하고 코드나 Prompt에 넣지 않기
  2. 2출력 목표, 참조 자료, 핵심 파라미터 설명
  3. 3Agent가 Qwen Audio 3.1 TTS Flash 라우트를 호출하고 task ID를 저장하도록 요청
  4. 4최종 상태 확인, 결과 다운로드, 실패 원인 보고를 Agent에 맡기기

Qwen Audio 3.1 TTS Flash로 만들 수 있는 것

Qwen Audio 3.1 TTS Flash로 만드는 음성 비서

비서에게 일관된 보이스를 입히고, 짧은 스타일 지시문으로 답변마다 톤을 조절하세요.

Qwen Audio 3.1 TTS Flash로 오디오북과 강좌 제작

차분한 내레이터 보이스로 요청당 최대 5,000자 분량의 챕터를 내레이션하세요.

영상 내레이션과 더빙

표준 중국어, 중국어 방언, 영어 등으로 보이스오버를 생성하고 인라인 감정 태그로 표현을 조절하세요.

Voice Enrollment로 만드는 브랜드 보이스

동의한 화자를 클로닝하거나 새 보이스를 디자인한 뒤, 생성 후 6시간 동안 합성 호출에 그 보이스 이름을 사용하세요.

Qwen Audio 3.1 TTS Flash API 코드 예제와 오류 처리

가장 짧은 실행 흐름을 보여 줍니다. 작업을 생성하고 반환된 task ID를 저장한 다음 폴링하거나 HTTPS callback을 기다립니다. 전체 파라미터와 응답 구조는 API 탭에서 확인하세요.

전체 API 문서 보기
cURL
curl -X POST https://api.evolink.ai/v1/audios/generations \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen-audio-3.1-tts-flash",
    "prompt": "Hello, and welcome to EvoLink. This is a quick demo of Qwen Audio 3.1 TTS Flash.",
    "voice": "Emily_v3.1",
    "instruction": "Speak warmly, at a relaxed pace",
    "response_format": "mp3"
  }'

# Save the returned task ID, then query; the audio link is in results[0]:
curl https://api.evolink.ai/v1/tasks/{task_id} \
  -H "Authorization: Bearer $EVOLINK_API_KEY"

파라미터 검증 실패

위 파라미터 카드와 대조해 값 범위, 허용 옵션, 자료 개수, 파일 형식이 선택한 라우트 요건에 맞는지 확인하세요.

인증 또는 잔액 문제

Authorization Bearer Token을 확인하고 콘솔에서 사용 가능 잔액과 작업 과금을 확인하세요.

콘텐츠 또는 자료 거부

초상권, 브랜드 자료, 읽을 수 있는 텍스트, 민감한 콘텐츠, 입력 자료의 적합성을 확인하세요.

작업 실패 또는 시간 초과

최종 상태가 실패인 Qwen Audio 3.1 TTS Flash 작업은 과금되지 않습니다. task ID를 보관하고 검증, 심사, 실행 중 어느 단계가 원인인지 확인한 후 재시도하세요.

Callback 미수신

callback_url은 공개 HTTPS URL이어야 하며 localhost 또는 사설 네트워크를 사용할 수 없습니다. 폴링 대안으로 task ID도 보관하세요.

시스템 보이스 vs 보이스 클로닝 vs 보이스 디자인

특징시스템 보이스보이스 클로닝보이스 디자인
모델 IDqwen-audio-3.1-tts-flashvoice-enrollmentvoice-enrollment
제공하는 것목록에서 고른 보이스 이름음성 샘플(audio_url)보이스 설명 + 미리듣기 텍스트
받는 결과오디오보이스 이름보이스 이름 + 미리듣기 오디오
준비 비용없음보이스당 ~$0.0001보이스당 ~$0.0001
적합한 용도빠르게 시작하기동의한 특정 화자의 목소리 재현새 보이스, 캐릭터, 브랜드 톤 탐색

Qwen Audio 3.1 TTS Flash 라우팅, 작업 수명 주기, 과금

하나의 엔드포인트, 두 가지 모델 ID

음성 합성은 qwen-audio-3.1-tts-flash를, 보이스 생성은 voice-enrollment를 보내세요. 둘 다 POST /v1/audios/generations로 전송되며 작업 ID를 반환합니다.

비동기 작업

/v1/tasks/{task_id}를 폴링하거나 callback_url로 결과를 받으세요. 처리 시간은 텍스트와 음성 작업에 따라 달라지며 고정 지연을 보장하지 않습니다. 오디오 링크는 24시간 후 만료됩니다.

내 보이스는 내 계정에서만

커스텀 보이스는 qwen-audio-3.1-tts-flash에서만, 그리고 만든 계정에서만 사용할 수 있습니다. 다른 사람의 보이스 이름을 사용하면 404가 반환됩니다. 보이스는 생성 후 6시간 동안 사용할 수 있습니다.

EvoLink로 Qwen Audio 3.1 TTS Flash를 사용하는 이유

사전 검증

알 수 없는 파라미터, 잘못된 보이스 이름, 길이를 초과한 텍스트는 크레딧을 선점한 뒤 나중에 실패하는 대신 즉시 400으로 반환됩니다.

통합 API

하나의 API 키로 Qwen, Seed Audio, 비디오, 이미지, LLM 모델을 사용합니다.

통합 잔액

하나의 콘솔에서 크레딧, 지출, 모델 사용량을 추적합니다.

작업 상태 추적

작업이 제출됨, 처리 중, 완료, 실패 중 어느 상태인지 실제 실패 원인과 함께 확인할 수 있습니다.

쓴 만큼만 결제

음성은 실제 토큰 사용량 기준으로 정산되며, 실패한 작업에 선점된 크레딧은 전액 환불됩니다.

Qwen Audio 3.1 TTS Flash 외 EvoLink의 다른 오디오 모델

Doubao Seed Audio 1.0

Doubao Seed Audio 1.0

음성, 대화, 효과음, 음악, 앰비언스를 위한 BytePlus 프롬프트 기반 오디오.

API 보기
Suno

Suno

보컬, 가사, 인스트루멘털 트랙을 지원하는 Suno 음악 생성.

API 보기

Qwen Audio 3.1 TTS Flash 자주 묻는 질문

EvoLink에서 이 모델의 스트리밍이나 WebSocket을 지원하나요?

이 EvoLink 경로는 비동기 HTTP 작업을 사용하며 SSE 또는 WebSocket 스트리밍을 지원하지 않습니다. POST /v1/audios/generations로 요청한 뒤 GET /v1/tasks/{task_id}로 오디오 URL을 받으세요. 제공업체의 스트리밍 API는 별도 프로토콜을 사용합니다.

Qwen Audio 3.1 TTS Flash는 Qwen3-TTS와 같은 모델인가요?

아닙니다. 이 페이지는 호스팅 모델 qwen-audio-3.1-tts-flash를 다룹니다. Qwen3-TTS, Qwen Audio TTS-Next, Qwen Audio Realtime은 ID, 매개변수, 가중치와 스트리밍 기능이 다른 별도 모델입니다.

Qwen Audio 3.1 TTS Flash 모델 ID는 무엇인가요?

음성 합성에는 qwen-audio-3.1-tts-flash를, 커스텀 보이스 생성에는 voice-enrollment를 사용하세요. 둘 다 POST /v1/audios/generations로 전송합니다.

Qwen Audio 3.1 TTS Flash의 가격은 얼마인가요?

음성은 실제 사용한 토큰 기준으로 과금되며, 입력과 출력 요금은 따로 적용되고 요금 섹션에 실시간으로 표시됩니다. 커스텀 보이스 생성은 보이스당 소액의 고정 요금입니다. 실패한 작업은 전액 환불됩니다.

최종 과금액보다 더 많은 금액이 선점되는 이유는 무엇인가요?

토큰 수는 합성이 끝난 뒤에야 알 수 있으므로, 작업 생성 시 텍스트 길이를 기준으로 금액이 선점됩니다(보통 최종 과금액보다 많습니다). 작업이 완료되면 실제 사용한 토큰만 과금되고 남은 금액은 환불됩니다. 숫자·영문자·기호처럼 한 글자씩 읽히는 내용은 선점된 금액을 넘을 수 있으며, 이 경우 부족한 금액이 추가로 과금됩니다.

나만의 보이스는 어떻게 만들고 사용하나요?

audio_url로 보이스를 클로닝하거나 voice_prompt와 preview_text로 보이스를 디자인하도록 voice-enrollment를 호출하세요. 완료된 작업에서 result_data.voice를 읽어 qwen-audio-3.1-tts-flash의 voice 파라미터로 전달하면 됩니다. 커스텀 보이스는 생성 후 6시간 동안 사용할 수 있으며, 만료되면 새로 만들어야 합니다.

보이스 클로닝과 보이스 디자인의 차이는 무엇인가요?

보이스 클로닝은 짧은 녹음으로 실제 화자를 재현하고 보이스 이름만 반환합니다. 보이스 디자인은 텍스트 설명으로 새 보이스를 만들고 미리듣기 오디오도 반환합니다. 둘 다 요금이 같고, 둘 다 qwen-audio-3.1-tts-flash에서만 사용할 수 있습니다.

좋은 보이스 클로닝 샘플의 조건은 무엇인가요?

필수 조건: WAV, MP3 또는 M4A, 최대 60초, 10 MB, 샘플레이트 16 kHz 이상이며 깨끗한 음성이 포함되어야 합니다. 최상의 결과를 원하면 한 명의 화자가 말하는 10~20초 녹음을 사용하세요. 모노 오디오에 침묵은 2초 이내여야 하며, 배경 음악이나 소음이 없어야 합니다.

다른 사람이 내 커스텀 보이스를 사용할 수 있나요?

아니요. 커스텀 보이스는 만든 계정에서만 사용할 수 있으며, 다른 계정에서 같은 보이스 이름을 사용하면 404가 반환됩니다.

누구의 목소리를 클로닝할 수 있나요?

본인의 목소리나 사용에 대한 명시적 허가를 받은 목소리만 가능합니다. 동의 없이 다른 사람의 목소리를 클로닝하는 것은 허용되지 않습니다.

감정, 속도, 방언은 어떻게 제어하나요?

'천천히 부드럽게 말해 주세요' 같은 짧은 지시문을 전달하거나, [excited] 같은 태그를 텍스트에 직접 쓰세요. 다국어 보이스 4개는 지시문으로 요청하면 여러 중국어 방언도 구사합니다.

작업이 실패하면 어떻게 되나요?

실패한 작업은 과금되지 않으며, 선점된 크레딧은 전액 환불됩니다. 작업 결과에 실패 원인이 표시됩니다.