EvoLink API로 연동
추천: 제품 백엔드, 배치 작업, 자동화 워크플로
서버에서 EvoLink 통합 보이스 API를 직접 호출하고 모델 ID, 파라미터, 작업 큐, callback, 결과 저장을 제어합니다.
- 1실제 브리프로 Playground에서 결과와 비용 검증
- 2콘솔에서 EvoLink API 키 생성
- 3위 라우트 카드에서 작업에 맞는 모델 ID 선택
- 4작업을 제출하고 폴링 또는 HTTPS callback으로 결과 수신
EvoLink 통합 API로 Qwen Audio 3.1 TTS Flash를 사용하세요. 68개 음성, 음성 복제와 설계를 지원합니다. 모델 ID, 입력·출력 토큰 요금과 비동기 합성 흐름을 확인하세요.
시스템 보이스로 텍스트를 음성으로 바꾸거나, 모델을 Voice Enrollment로 전환해 나만의 보이스를 클로닝하거나 디자인하고 바로 사용해 보세요.
음성 합성 작업 생성
qwen-audio-3.1-tts-flash(으)로 고정최대 5,000자. 텍스트에 [excited]나 [laughing] 같은 태그를 넣어 말투를 조절할 수 있습니다.
목록에서 시스템 보이스를 고르거나, 여기에 보이스 이름을 직접 입력하거나 붙여넣으세요(직접 만든 보이스 포함). 보이스 이름은 대소문자를 구분합니다. 텍스트 언어를 지원하는 보이스를 선택하세요.
선택 사항. 감정, 속도, 방언을 제어합니다. 최대 100 과금 문자(한자는 2자, 한글·가나 및 그 밖의 문자는 1자로 계산됩니다).
텍스트 언어에 대한 선택적 힌트입니다.
음높이를 바꾸면 길이도 달라지며, 속도가 1.0이 아니면 적용되지 않습니다.
생성된 오디오가 여기에 표시됩니다.
음성 합성은 입력과 출력 요금이 따로 적용되며, 실제 사용한 토큰 기준으로 과금됩니다. 커스텀 보이스 생성은 보이스당 소액의 고정 요금입니다. 실패한 작업은 전액 환불됩니다.
첫 테스트 비용
짧은 문장 하나 · 입력 14 + 출력 33 토큰짧은 문장 하나
10달러 크레딧으로 이런 문장을 약 158,139개 만들 수 있습니다.
Playground에서 기본 보이스를 그대로 두고 문장 하나를 입력하세요. 작업 생성 시 텍스트 길이를 기준으로 크레딧이 선점되며, 완료되면 실제 사용한 토큰 기준으로 정산됩니다(남은 금액은 환불, 부족한 금액은 추가 과금).
Qwen Audio 3.1 TTS Flash 테스트 예산 가이드
예상 테스트 횟수에 맞춰 금액을 선택하세요.첫 검증에 적합합니다.
여러 편의 글이나 강의를 내레이션하기에 적합합니다.
프로덕션 연동 전 테스트에 적합합니다.
토큰 수는 실측 샘플입니다. 실제 사용량은 언어, 보이스, 텍스트를 읽는 방식에 따라 달라집니다. 숫자, 대문자, 기호는 하나씩 읽히므로 출력 토큰이 더 많이 사용됩니다.
qwen-audio-3.1-tts-flash| 과금 항목 | 포함 내용 | 요금 | 과금 방식 |
|---|---|---|---|
| 출력 토큰 | 생성된 음성입니다. 오디오가 길수록 출력 토큰이 더 많이 사용됩니다. | $1.765/100만 토큰120 크레딧 | 실제 사용량 기준 |
| 입력 토큰 | 전송한 텍스트입니다. 스타일 지시문은 포함되지 않습니다. | $0.221/100만 토큰15 크레딧 | 실제 사용량 기준 |
생성된 음성입니다. 오디오가 길수록 출력 토큰이 더 많이 사용됩니다.
전송한 텍스트입니다. 스타일 지시문은 포함되지 않습니다.
voice-enrollment| 과금 항목 | 포함 내용 | 요금 | 과금 방식 |
|---|---|---|---|
| 보이스 생성 | 보이스 클로닝(audio_url) 또는 보이스 디자인(voice_prompt), 요금은 동일합니다. 보이스는 qwen-audio-3.1-tts-flash에 연결됩니다. | $0.0001/보이스0.001 크레딧 | 생성한 보이스당 |
보이스 클로닝(audio_url) 또는 보이스 디자인(voice_prompt), 요금은 동일합니다. 보이스는 qwen-audio-3.1-tts-flash에 연결됩니다.
과금 참고 사항
Qwen Audio 3.1 TTS Flash는 68개의 시스템 보이스와 지시문 기반 감정·속도·방언 제어로 텍스트를 자연스러운 음성으로 바꿉니다. 같은 페이지의 Voice Enrollment로 이 모델에서 쓸 나만의 보이스도 만들 수 있습니다. 동의한 화자의 짧은 녹음을 클로닝하거나, 텍스트 설명으로 새 보이스를 디자인하세요. EvoLink는 두 기능을 하나의 오디오 엔드포인트에서 하나의 API 키로 쓰는 비동기 작업으로 제공합니다.
qwen-audio-3.1-tts-flash텍스트 음성 변환. prompt와 선택 사항인 voice를 보내면 오디오 파일이 반환됩니다. 입력·출력 토큰 기준으로 과금됩니다.
voice-enrollmentQwen Audio 3.1 TTS Flash에서 쓸 커스텀 보이스를 만듭니다. audio_url을 보내면 녹음으로 보이스를 클로닝하고, voice_prompt와 preview_text를 보내면 설명으로 보이스를 디자인합니다. 보이스당 고정 요금입니다.
음성 합성 파라미터를 먼저 소개하고, 이어서 voice-enrollment에서 쓰는 필드를 소개합니다. 전체 요청·응답 구조는 API 탭에서 확인하세요.
promptstring기본값: 필수
합성할 텍스트, 최대 5,000자. [excited] 같은 감정 태그를 텍스트 안에 직접 쓸 수 있습니다.
voicestring기본값: longanhuan_v3.1
시스템 보이스(대소문자 구분) 또는 내 계정에서 voice-enrollment로 만든 보이스.
instructionstring기본값: 없음
감정, 속도, 방언을 자연어로 제어합니다. 최대 100 과금 문자.
response_formatenum기본값: mp3
mp3, wav 또는 opus. Opus는 8, 12, 16, 24, 48 kHz만 지원합니다.
speech_rate / pitchnumber기본값: 1.0
둘 다 0.5~2.0 범위입니다. pitch를 바꾸면 길이도 달라지며, speech_rate가 1.0이 아니면 무시됩니다.
audio_urlstring · voice-enrollment기본값: 클로닝 시 필수
깨끗한 음성이 담긴 WAV, MP3 또는 M4A 샘플의 공개 HTTP(S) 링크, 최대 60초, 10 MB. 보이스 클로닝을 선택합니다.
voice_prompt + preview_textstring · voice-enrollment기본값: 디자인 시 필수
최대 500자의 보이스 설명과 미리듣기 오디오가 읽을 15~200자 문장. 보이스 디자인을 선택합니다.
preferred_namestring · voice-enrollment기본값: 필수
영문자 또는 숫자 1~10자. 반환되는 보이스 이름의 일부가 됩니다.
제품 연동과 배치 작업에는 EvoLink API를 사용하고, 빠른 제작·개발 작업에는 Codex, Claude 또는 Gemini에서 Agent로 호출할 수 있습니다. 두 방식은 동일한 EvoLink API 키, 잔액, 모델 라우트, 작업 기록을 공유합니다.
추천: 제품 백엔드, 배치 작업, 자동화 워크플로
서버에서 EvoLink 통합 보이스 API를 직접 호출하고 모델 ID, 파라미터, 작업 큐, callback, 결과 저장을 제어합니다.
추천: Codex, Claude, Gemini의 제작 및 개발 작업
생성 목표, 자료, 검수 조건을 Agent에 전달하면 라우트 선택, 요청 구성, 작업 추적, 결과 반환까지 맡길 수 있습니다. 각 단계를 직접 코딩할 필요가 없습니다.
가장 짧은 실행 흐름을 보여 줍니다. 작업을 생성하고 반환된 task ID를 저장한 다음 폴링하거나 HTTPS callback을 기다립니다. 전체 파라미터와 응답 구조는 API 탭에서 확인하세요.
curl -X POST https://api.evolink.ai/v1/audios/generations \
-H "Authorization: Bearer $EVOLINK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen-audio-3.1-tts-flash",
"prompt": "Hello, and welcome to EvoLink. This is a quick demo of Qwen Audio 3.1 TTS Flash.",
"voice": "Emily_v3.1",
"instruction": "Speak warmly, at a relaxed pace",
"response_format": "mp3"
}'
# Save the returned task ID, then query; the audio link is in results[0]:
curl https://api.evolink.ai/v1/tasks/{task_id} \
-H "Authorization: Bearer $EVOLINK_API_KEY"위 파라미터 카드와 대조해 값 범위, 허용 옵션, 자료 개수, 파일 형식이 선택한 라우트 요건에 맞는지 확인하세요.
Authorization Bearer Token을 확인하고 콘솔에서 사용 가능 잔액과 작업 과금을 확인하세요.
초상권, 브랜드 자료, 읽을 수 있는 텍스트, 민감한 콘텐츠, 입력 자료의 적합성을 확인하세요.
최종 상태가 실패인 Qwen Audio 3.1 TTS Flash 작업은 과금되지 않습니다. task ID를 보관하고 검증, 심사, 실행 중 어느 단계가 원인인지 확인한 후 재시도하세요.
callback_url은 공개 HTTPS URL이어야 하며 localhost 또는 사설 네트워크를 사용할 수 없습니다. 폴링 대안으로 task ID도 보관하세요.
| 특징 | 시스템 보이스 | 보이스 클로닝 | 보이스 디자인 |
|---|---|---|---|
| 모델 ID | qwen-audio-3.1-tts-flash | voice-enrollment | voice-enrollment |
| 제공하는 것 | 목록에서 고른 보이스 이름 | 음성 샘플(audio_url) | 보이스 설명 + 미리듣기 텍스트 |
| 받는 결과 | 오디오 | 보이스 이름 | 보이스 이름 + 미리듣기 오디오 |
| 준비 비용 | 없음 | 보이스당 ~$0.0001 | 보이스당 ~$0.0001 |
| 적합한 용도 | 빠르게 시작하기 | 동의한 특정 화자의 목소리 재현 | 새 보이스, 캐릭터, 브랜드 톤 탐색 |
음성 합성은 qwen-audio-3.1-tts-flash를, 보이스 생성은 voice-enrollment를 보내세요. 둘 다 POST /v1/audios/generations로 전송되며 작업 ID를 반환합니다.
/v1/tasks/{task_id}를 폴링하거나 callback_url로 결과를 받으세요. 처리 시간은 텍스트와 음성 작업에 따라 달라지며 고정 지연을 보장하지 않습니다. 오디오 링크는 24시간 후 만료됩니다.
커스텀 보이스는 qwen-audio-3.1-tts-flash에서만, 그리고 만든 계정에서만 사용할 수 있습니다. 다른 사람의 보이스 이름을 사용하면 404가 반환됩니다. 보이스는 생성 후 6시간 동안 사용할 수 있습니다.
알 수 없는 파라미터, 잘못된 보이스 이름, 길이를 초과한 텍스트는 크레딧을 선점한 뒤 나중에 실패하는 대신 즉시 400으로 반환됩니다.
하나의 API 키로 Qwen, Seed Audio, 비디오, 이미지, LLM 모델을 사용합니다.
하나의 콘솔에서 크레딧, 지출, 모델 사용량을 추적합니다.
작업이 제출됨, 처리 중, 완료, 실패 중 어느 상태인지 실제 실패 원인과 함께 확인할 수 있습니다.
음성은 실제 토큰 사용량 기준으로 정산되며, 실패한 작업에 선점된 크레딧은 전액 환불됩니다.


이 EvoLink 경로는 비동기 HTTP 작업을 사용하며 SSE 또는 WebSocket 스트리밍을 지원하지 않습니다. POST /v1/audios/generations로 요청한 뒤 GET /v1/tasks/{task_id}로 오디오 URL을 받으세요. 제공업체의 스트리밍 API는 별도 프로토콜을 사용합니다.
아닙니다. 이 페이지는 호스팅 모델 qwen-audio-3.1-tts-flash를 다룹니다. Qwen3-TTS, Qwen Audio TTS-Next, Qwen Audio Realtime은 ID, 매개변수, 가중치와 스트리밍 기능이 다른 별도 모델입니다.
음성 합성에는 qwen-audio-3.1-tts-flash를, 커스텀 보이스 생성에는 voice-enrollment를 사용하세요. 둘 다 POST /v1/audios/generations로 전송합니다.
음성은 실제 사용한 토큰 기준으로 과금되며, 입력과 출력 요금은 따로 적용되고 요금 섹션에 실시간으로 표시됩니다. 커스텀 보이스 생성은 보이스당 소액의 고정 요금입니다. 실패한 작업은 전액 환불됩니다.
토큰 수는 합성이 끝난 뒤에야 알 수 있으므로, 작업 생성 시 텍스트 길이를 기준으로 금액이 선점됩니다(보통 최종 과금액보다 많습니다). 작업이 완료되면 실제 사용한 토큰만 과금되고 남은 금액은 환불됩니다. 숫자·영문자·기호처럼 한 글자씩 읽히는 내용은 선점된 금액을 넘을 수 있으며, 이 경우 부족한 금액이 추가로 과금됩니다.
audio_url로 보이스를 클로닝하거나 voice_prompt와 preview_text로 보이스를 디자인하도록 voice-enrollment를 호출하세요. 완료된 작업에서 result_data.voice를 읽어 qwen-audio-3.1-tts-flash의 voice 파라미터로 전달하면 됩니다. 커스텀 보이스는 생성 후 6시간 동안 사용할 수 있으며, 만료되면 새로 만들어야 합니다.
보이스 클로닝은 짧은 녹음으로 실제 화자를 재현하고 보이스 이름만 반환합니다. 보이스 디자인은 텍스트 설명으로 새 보이스를 만들고 미리듣기 오디오도 반환합니다. 둘 다 요금이 같고, 둘 다 qwen-audio-3.1-tts-flash에서만 사용할 수 있습니다.
필수 조건: WAV, MP3 또는 M4A, 최대 60초, 10 MB, 샘플레이트 16 kHz 이상이며 깨끗한 음성이 포함되어야 합니다. 최상의 결과를 원하면 한 명의 화자가 말하는 10~20초 녹음을 사용하세요. 모노 오디오에 침묵은 2초 이내여야 하며, 배경 음악이나 소음이 없어야 합니다.
아니요. 커스텀 보이스는 만든 계정에서만 사용할 수 있으며, 다른 계정에서 같은 보이스 이름을 사용하면 404가 반환됩니다.
본인의 목소리나 사용에 대한 명시적 허가를 받은 목소리만 가능합니다. 동의 없이 다른 사람의 목소리를 클로닝하는 것은 허용되지 않습니다.
'천천히 부드럽게 말해 주세요' 같은 짧은 지시문을 전달하거나, [excited] 같은 태그를 텍스트에 직접 쓰세요. 다국어 보이스 4개는 지시문으로 요청하면 여러 중국어 방언도 구사합니다.
실패한 작업은 과금되지 않으며, 선점된 크레딧은 전액 환불됩니다. 작업 결과에 실패 원인이 표시됩니다.