OmniHuman-1.5 디지털 휴먼 비디오 생성
- OmniHuman-1.5 (omnihuman-1.5) 모델은 오디오 기반으로 디지털 휴먼 비디오를 생성합니다
- 비동기 처리 모드이며, 반환된 작업 ID를 사용하여 조회
- 생성된 비디오 링크는 24시간 동안 유효하며, 즉시 저장하시기 바랍니다
참고:
- 오디오 길이 제한: 최대 35초
- 지원 오디오 형식: MP3, WAV
- 요금은 오디오 길이를 기준으로 합니다(초 단위 올림)
인증
본문
디지털 휴먼 비디오 생성 모델 이름
omnihuman-1.5 "omnihuman-1.5"
립싱크 및 신체 동작을 구동하기 위한 오디오 URL
참고:
- 최대 오디오 길이:
35초 - 지원 형식:
.mp3,.wav - 오디오 URL은 서버에서 직접 접근 가능해야 합니다
- 요금은 오디오 길이를 기준으로 합니다(초 단위 올림)
"https://example.com/audio.mp3"
애니메이션할 인물이 포함된 참조 이미지 URL 목록
참고:
- 요청당 이미지 수:
1 - 이미지에 명확한 인물이 포함되어야 합니다
- 이미지 크기:
10MB이하 - 지원 파일 형식:
.jpg,.jpeg,.png,.webp - 이미지 URL은 서버에서 직접 조회 가능해야 합니다
1생성 스타일을 안내하는 선택적 텍스트 프롬프트, 중국어, 영어, 일본어, 한국어, 멕시코 스페인어 및 인도네시아어만 지원합니다
"A person speaking naturally with subtle expressions"
빠른 처리 모드 활성화
참고:
true: 품질이 다소 낮아질 수 있지만 더 빠른 생성false: 표준 품질 처리 (기본값)
false
애니메이션 영역을 지정하기 위한 마스크 URL 배열
참고:
- 고급 제어를 위한 선택적 매개변수
- 마스크 이미지는 참조 이미지 해상도와 일치해야 합니다
초기 확산 상태를 결정하기 위한 기준이 되는 랜덤 시드, 기본값은 랜덤입니다. 시드가 동일한 양의 정수이고 다른 모든 매개변수가 일치하면 생성된 콘텐츠가 일관된 결과를 가질 수 있습니다
이미지에서 인물 존재를 확인하기 위한 피사체 감지 활성화
참고:
true: 피사체 감지 활성화, 요청 시작 시간이 증가합니다false: 피사체 감지 건너뛰기 (기본값)
false
자동 마스크 생성 활성화
참고:
true: 자동으로 인물을 감지하고 마스킹합니다. 요청 시작 시간이 증가합니다.mask_url에 값이 있으면 이 매개변수는 무시됩니다false: 제공된 mask_url을 사용하거나 마스크 없음 (기본값)
false
작업 완료 후 HTTPS 콜백 주소
콜백 타이밍:
- 작업이 완료, 실패 또는 취소될 때 트리거됨
- 과금 확인 완료 후 전송
보안 제한:
- HTTPS 프로토콜만 지원
- 내부 IP 주소로의 콜백 금지 (127.0.0.1, 10.x.x.x, 172.16-31.x.x, 192.168.x.x 등)
- URL 길이는
2048자를 초과할 수 없음
콜백 메커니즘:
- 타임아웃:
10초 - 실패 시 최대
3회 재시도 (1초/2초/4초 후 재시도) - 콜백 응답 본문 형식은 작업 조회 API 응답 형식과 동일
- 콜백 주소가 2xx 상태 코드를 반환하면 성공으로 간주, 다른 상태 코드는 재시도를 트리거
"https://your-domain.com/webhooks/video-task-completed"
응답
디지털 휴먼 비디오 생성 작업이 성공적으로 생성되었습니다
작업 생성 타임스탬프
1757169743
작업 ID
"task-unified-1757169743-7cvnl5zw"
실제 사용된 모델 이름
"omnihuman-1.5"
특정 작업 유형
video.generation.task 작업 진행률 (0-100)
0 <= x <= 1000
작업 상태
pending, processing, completed, failed "pending"
비디오 작업 상세 정보
작업 출력 유형
text, image, audio, video "video"
사용량 및 과금 정보