Skip to main content
POST

인증

Authorization
string
header
필수

모든 엔드포인트에 Bearer 토큰 인증이 필요합니다

API 키 받기:

API 키 관리에서 API 키를 받으세요

요청 헤더 추가:

본문

application/json

실제 사람의 녹음으로 음성을 만듭니다. audio_url로 복제 모드를 선택하며 설계용 voice_prompt, preview_text, sample_rate, response_format은 생략하세요. 비어 있지 않은 설계 텍스트, 0이 아닌 샘플링 레이트 또는 비어 있지 않은 형식은 400입니다. sample_rate: 0/null과 response_format: ""/null은 생략한 것으로 처리합니다.

model
enum<string>
기본값:voice-enrollment
필수

모델 이름

사용 가능한 옵션:
voice-enrollment
예시:

"voice-enrollment"

audio_url
string<uri>
필수

복제할 녹음 파일 URL. 이 필드는 음성 복제를 선택하며 voice_prompt와 동시에 입력할 수 없습니다

URL 요구 사항:

  • 인증 없이 공개 접근 가능한 HTTP 또는 HTTPS
  • 로컬 및 내부 주소는 400(invalid_media_url)
  • 최대 2048자
  • FTP 등 HTTP(S)가 아닌 프로토콜은 400(invalid_media_url)
  • 링크만 지원하며 Base64 data URI는 400(invalid_parameter)

오디오 요구 사항(충족하지 않으면 작업이 실패할 수 있음):

  • WAV, MP3 또는 M4A
  • 최대 60초. 실제 발화가 너무 짧아도 실패합니다(테스트에서 2초 녹음 실패)
  • 파일 크기 최대 10 MB
  • 샘플링 레이트 16 kHz 이상
  • 명확한 사람의 발화가 있어야 합니다. 무음, 음악 등 발화가 아닌 오디오는 거부됩니다

녹음 권장 사항:

  • 10~20초, 그중 5초 이상 연속적이고 명확한 낭독, 정지는 최대 2초
  • 모노. 스테레오는 첫 번째 채널만 사용
  • 배경 음악, 잡음, 다른 사람의 음성 없이 평소처럼 말하고 노래하지 않기

오디오를 다운로드할 수 없거나 요구 사항을 충족하지 못하면 작업이 실패하고 크레딧이 전액 환불됩니다

본인의 음성 또는 명시적인 허가를 받은 음성만 복제하세요

Maximum string length: 2048
Pattern: [^\u0009-\u000D\u0020\u0085\u00A0\u1680\u2000-\u200A\u2028\u2029\u202F\u205F\u3000]
예시:

"https://your-cdn.com/samples/my-voice.wav"

preferred_name
string
필수

음성 이름 접두사

제약 조건:

  • 영문자 또는 숫자 1~10자. 밑줄 및 다른 기호는 지원하지 않음
  • 대문자는 소문자로 변환
  • 고유할 필요 없음

전체 이름: 복제는 qwen-audio-3.1-tts-flash-{preferred_name}-{32-character-id}, 설계는 qwen-audio-3.1-tts-flash-vd-{preferred_name}-{32-character-id}

myvoice 복제 예: qwen-audio-3.1-tts-flash-myvoice-5996beec833d41f4982158347ba97fae

Maximum string length: 10
Pattern: ^[a-zA-Z0-9]+$
예시:

"myvoice"

language
enum<string>

복제에서는 녹음에 사용된 언어로 음성 특징을 더 정확히 추출합니다. 설계에서는 음성의 언어 성향이며 preview_text와 같은 언어를 권장합니다

생략하면 zh

사용 가능한 옵션:
zh,
en,
ja,
ko,
de,
fr,
it,
ru,
pt,
es
예시:

"zh"

target_model
enum<string>
기본값:qwen-audio-3.1-tts-flash

음성을 사용할 TTS 모델. 현재 값은 하나이며 생략하면 해당 값을 사용합니다. 다른 값은 400

사용 가능한 옵션:
qwen-audio-3.1-tts-flash
예시:

"qwen-audio-3.1-tts-flash"

callback_url
string<uri>

작업 결과를 받을 HTTPS 콜백 URL

전송 시점:

  • 작업 완료(completed) 또는 실패(failed) 시
  • 과금 확정 후 전송

보안 요구 사항:

  • HTTPS만 지원
  • 내부 IP 금지(127.0.0.1, 10.x.x.x, 172.16~31.x.x, 192.168.x.x 등)
  • URL 최대 2048자

전달 방식:

  • 제한 시간: 10초
  • 실패 후 최대 3회 재시도, 각각 1 / 2 / 4초 대기
  • 콜백 본문은 작업 조회 API 응답과 같은 형식
  • 2xx는 성공, 다른 상태 코드는 재시도
예시:

"https://your-domain.com/webhooks/voice-completed"

응답

음성 생성 작업 접수 완료

created
integer

작업 생성 타임스탬프

예시:

1775123456

id
string

작업 ID

예시:

"task-unified-1775123456-abcd1234"

model
string

실제로 사용된 모델 이름

예시:

"voice-enrollment"

object
enum<string>

작업 객체의 구체적인 유형

사용 가능한 옵션:
audio.generation.task
progress
integer

작업 진행률(0~100)

필수 범위: 0 <= x <= 100
예시:

0

status
enum<string>

작업 상태

사용 가능한 옵션:
pending,
processing,
completed,
failed
예시:

"pending"

task_info
object

오디오 작업 상세 정보

type
enum<string>

작업 출력 유형

사용 가능한 옵션:
audio
예시:

"audio"

usage
object

사용량 및 과금 정보