Grok Imagine Video 1.5 API
소스 이미지 한 장을 지정한 움직임과 동기화된 네이티브 오디오가 포함된 1~15초 동영상으로 제작하세요. EvoLink의 통합 비동기 API로 비용을 예측하고 작업을 제출한 뒤 결과를 프로덕션 워크플로에 연결할 수 있습니다.
API 연동 전에 Grok Imagine Video 1.5를 직접 사용해 보세요.
비동기 API를 연동하기 전에 참조 이미지 1장을 업로드하고, 크레딧 사용량을 미리 계산하며, 이미지 기반 동영상 출력을 확인해 볼 수 있습니다.
샘플 만들기
이미지 1장을 업로드하고 프롬프트를 입력한 뒤 파라미터를 설정하세요.필수. 참조 이미지를 정확히 1장 업로드하세요(이미지 기반 동영상 전용).
1generated-image.png
—
✓ 이미지 1개를 추가했습니다
이미지 기반 동영상을 위한 Grok Imagine Video 1.5 요금.
이미지 기반 동영상 생성에 필요한 크레딧을 계획하세요. 출력은 길이와 해상도에 따라 과금되며, 입력 이미지마다 소액의 고정 요금이 추가됩니다.
첫 테스트 비용
이미지 기반 동영상 - 6s - 480p - 이미지 1장입력 이미지 1장을 포함한 6s 480p 샘플 1개
$10 크레딧으로 약 25회 테스트.
크레딧을 아끼려면 480p로 반복 테스트한 뒤, 모션과 구도가 확정되면 검토용으로 720p로 전환하세요.
테스트 예산 가이드
예상 테스트 횟수에 맞춰 금액을 선택하세요.처음 검증해 보기에 좋습니다.
모션과 구도를 다듬기에 좋습니다.
프로덕션 연동 전 단계에 좋습니다.
자주 발생하는 비용 예시
이미지 기반 동영상 1회 생성 기준 예상 총비용입니다(입력 이미지 1장 포함). 실제 비용은 길이와 해상도에 따라 달라질 수 있습니다.
Grok Imagine Video 1.5 요금
-20%| 항목 | 480p | 720p | 과금 |
|---|---|---|---|
| 이미지 기반 동영상출력 동영상, 초당 | $0.064/s-20% 4.352 cr/s$0.080 공식 가격 | $0.112/s-20% 7.616 cr/s$0.140 공식 가격 | 출력 동영상 초 |
출력은 초당 과금됩니다(720p = 480p x 1.75). 입력 이미지는 이미지 기반 동영상 생성에 필수이며 이미지당 소액의 고정 요금이 부과됩니다.
Grok Imagine Video 1.5로 제어 가능한 이미지 기반 동영상 워크플로를 구축하세요.
Grok Imagine Video 1.5는 xAI가 GA로 제공하는 이미지 기반 동영상 생성 모델입니다. EvoLink에서는 요청마다 소스 이미지 한 장과 필수 모션 프롬프트를 사용해 1~15초 길이의 480p 또는 720p 동영상을 생성합니다. 이 라우트는 네이티브 오디오, 비동기 작업 처리, 실시간 비용 예측을 지원하는 숏폼 생성용으로 설계되었으며 다른 모델과 하나의 API Key를 공유합니다.
이미지 기반 동영상 워크플로에 추가되는 기능
한 프레임에서 지정한 움직임 생성
준비된 제품 사진, 인물 사진, 일러스트 또는 스토리보드 프레임을 시각적 기준으로 사용한 뒤 프롬프트에 피사체와 카메라의 움직임을 설명하세요.
동영상과 네이티브 오디오 동시 생성
모델은 한 번의 생성 과정에서 움직임과 함께 동기화된 주변음, 음향 효과, 음성을 생성할 수 있습니다. 자체 승인 기준에 따라 오디오 품질을 검증하세요.
프로덕션에 적합한 비동기 라우트
작업을 한 번 제출하고 폴링 또는 콜백으로 상태를 추적한 뒤 임시 결과 URL이 만료되기 전에 완성된 에셋을 영구 저장하세요.
Grok Imagine Video 1.5 활용 사례
시네마틱 스토리 및 콘셉트 테스트
더 큰 규모의 프로덕션을 진행하기 전에 스토리보드 프레임을 바탕으로 카메라 움직임, 인물 연기, 물리 효과, 타이밍과 장면의 리듬을 테스트하세요.
Playground에서 사용해 보기EvoLink에서 Grok Imagine Video 1.5의 프로덕션 사양
| 기능 | Grok Imagine Video 1.5 | 프로덕션 영향 | 다른 라우트를 선택해야 하는 경우 |
|---|---|---|---|
| 생성 모드 | 단일 이미지 기반 동영상 생성만 지원 | 소스 이미지가 시작 구도를 고정합니다. | 프롬프트만 사용하는 텍스트 기반 동영상 생성이 필요한 경우. |
| 입력 사양 | 이미지 1장 + 비어 있지 않은 프롬프트 | 작업을 제출하기 전에 두 입력을 모두 검증하세요. | 여러 참조 이미지 또는 시작·종료 프레임이 필요한 경우. |
| 길이 및 출력 | 480p 또는 720p에서 1~15초 | 비용은 길이와 해상도에 따라 달라집니다. | EvoLink에서 더 긴 클립이나 1080p가 필요한 경우. |
| 출력 구도 | 소스 이미지를 따름 | 원하는 최종 구도로 소스 이미지를 준비하세요. | 첫 프레임과 마지막 프레임 사이의 전환이 필요한 경우. |
| 결과 제공 | 폴링 또는 콜백을 지원하는 비동기 작업 | 작업을 대기열에 넣고 최종 상태를 멱등적으로 처리하세요. | 워크플로에 즉시 반환되는 동기식 결과가 필요한 경우. |
| 과금 | 출력 초당 + 입력 이미지당 | 각 작업의 비용을 예측하고 재시도 지출에 상한을 설정하세요. | 길이와 무관한 고정 비용이 필요한 경우. |
주요 세부 정보
업스트림 GA, EvoLink에서는 preview 별칭
xAI는 grok-imagine-video-1.5를 안정 모델로 명시합니다. EvoLink는 현재 grok-imagine-video-1.5-preview를 허용하므로 EvoLink 예시에 표시된 ID를 사용하세요.
엄격한 단일 이미지 입력 사양
최대 10 MB의 JPEG, PNG 또는 WebP 이미지 정확히 1장과 비어 있지 않은 프롬프트를 전송하세요. 이 라우트는 텍스트 기반 동영상 생성과 다중 참조 기반 동영상 생성을 지원하지 않습니다.
임시 결과를 제공하는 비동기 처리
작업을 제출하고 폴링하거나 콜백을 수신한 뒤 완성된 동영상을 영구 저장하세요. EvoLink 결과 URL은 24시간 동안 제공됩니다.
EvoLink를 통해 Grok Imagine Video 1.5를 사용해야 하는 이유
투명한 가격
실시간 라우트 가격을 사용해 생성 전에 길이, 해상도, 입력 이미지 비용을 예측하세요.
통합 API
하나의 인증 및 통합 계층을 통해 Grok Imagine과 다른 동영상 모델을 호출하세요.
통합 잔액
동일한 EvoLink 계정에서 크레딧, 지출, 모델 사용량을 관리하세요.
작업 상태 추적
일관된 비동기 워크플로를 통해 대기 중, 처리 중, 완료, 실패 상태의 작업을 추적하세요.
모델 선택
Grok 1.5는 단일 프레임 애니메이션에 사용하고 다른 모달리티는 더 적합한 모델로 라우팅하세요.
Grok Imagine 모델 제품군
모든 모델 보기
Grok Imagine Video (1.0)
텍스트 기반 동영상, 이미지 기반 동영상, 참조, 편집, 확장 워크플로를 지원하는 더 포괄적인 Grok Imagine 동영상 라우트입니다.
보기 →EvoLink의 다른 동영상 모델




자주 묻는 질문
Grok Imagine Video 1.5란 무엇인가요?
Grok Imagine Video 1.5는 xAI가 GA로 제공하는 이미지 기반 동영상 생성 모델입니다. 소스 이미지 한 장과 모션 프롬프트를 네이티브 오디오 기능이 포함된 짧은 동영상으로 변환합니다.
EvoLink에서는 어떤 모델 ID를 사용해야 하나요?
EvoLink 요청에서는 grok-imagine-video-1.5-preview를 사용하세요. xAI 업스트림의 안정 버전 ID는 grok-imagine-video-1.5이지만 모델 ID는 채널별로 다릅니다.
EvoLink 모델 ID에 아직 preview가 포함된 이유는 무엇인가요?
preview라는 이름은 업스트림 별칭으로 유지되고 있으며 EvoLink 라우트의 현재 공개 ID입니다. 이는 xAI가 1.5 릴리스를 계속 Preview로 분류한다는 의미가 아닙니다.
Grok Imagine Video 1.5는 텍스트 기반 동영상 생성을 지원하나요?
아니요. Grok Imagine Video 1.5는 이미지 기반 동영상 생성만 지원합니다. 프롬프트만으로 생성해야 한다면 더 포괄적인 Grok Imagine Video 라우트나 다른 동영상 모델을 사용하세요.
여러 참조 이미지나 시작 및 종료 프레임을 사용할 수 있나요?
아니요. EvoLink 라우트에는 소스 이미지가 정확히 한 장 필요합니다. Grok Imagine Video 1.5는 여러 참조 기반 동영상 생성이나 시작·종료 프레임 워크플로를 지원하지 않습니다.
이미지와 프롬프트 입력 조건은 무엇인가요?
최대 10 MB의 JPEG, PNG 또는 WebP 이미지 한 장과 최대 2,000 토큰의 비어 있지 않은 프롬프트를 전송하세요(한국어 등은 문자당 토큰 소모가 더 큽니다). 비동기 작업을 제출하기 전에 두 입력을 모두 검증하세요.
Grok Imagine Video 1.5의 비용은 얼마인가요?
EvoLink는 출력 길이와 해상도에 따라 과금하고 입력 이미지 비용을 추가합니다. 복사된 정적 가격 대신 실시간 가격 섹션과 Playground 예측을 통해 현재 라우트 가격을 확인하세요.
어떤 해상도와 길이를 지원하나요?
현재 EvoLink 라우트는 480p 및 720p 출력과 1~15초 길이를 지원합니다. xAI 업스트림 문서에는 1080p도 명시되어 있지만, 이 EvoLink 라우트에서는 아직 제공되지 않습니다.
출력 구도는 어떻게 결정되나요?
이 라우트는 화면 비율 파라미터를 제공하지 않습니다. 생성 동영상이 따르길 원하는 구도로 소스 이미지를 준비하세요.
Grok Imagine Video 1.5는 오디오를 생성하나요?
이 모델은 동영상과 함께 동기화된 주변음, 음향 효과, 음성을 생성하도록 설계되었습니다. 오디오 품질은 장면마다 달라질 수 있으므로 자체 승인 기준에 따라 테스트하세요.
완성된 동영상은 어떻게 받나요?
생성은 비동기 방식입니다. 작업을 제출하고 상태를 폴링하거나 HTTPS 콜백을 제공한 뒤 작업이 완료되면 반환된 동영상을 영구 저장하세요.
결과 URL은 얼마나 오래 사용할 수 있나요?
EvoLink 결과 URL은 24시간 동안 제공됩니다. 프로덕션에서 임시 URL을 사용하지 말고 완성된 에셋을 자체 오브젝트 스토리지에 복사하세요.
실패하거나 검토 대상이 된 요청은 항상 무료인가요?
실패하거나 검토 대상이 된 모든 요청이 무료라고 가정하지 마세요. 재시도하기 전에 작업에서 반환된 사용량 및 과금 필드를 확인하고 현재 계정 기록을 검토하세요.
API Reference
Select endpoint
Authentication
All APIs require Bearer Token authentication.
Authorization:
Bearer YOUR_API_KEY/v1/videos/generationsCreate Image-to-Video
xAI Grok Imagine Video 1.5 Preview animates a single reference image into a short video. This model is image-to-video only — a request without an image is rejected.
Asynchronous processing — use the returned task ID to . Result links are valid for 24 hours.
Request Parameters
modelstringRequiredDefault: grok-imagine-video-1.5-previewFixed value: grok-imagine-video-1.5-preview
grok-imagine-video-1.5-previewpromptstringRequiredText prompt to guide the motion and style of the generated video.
Notes
- Required (≤ 2000 tokens; CJK text uses more tokens per character)
Use the input image as the exact opening frame and preserve the original character, outfit, cybernetic arm, hairstyle, jacket graphic, balcony structure, city layout, and overall composition.
A single continuous 6-second cinematic cyberpunk shot at night. The camera begins directly behind the lone cybernetic woman and slowly dollies forward while making a subtle clockwise arc toward her right shoulder, creating strong layered parallax between the wet metal railing, the character, nearby flying traffic, and the distant skyscrapers.
The woman remains facing the city and does not turn around. She subtly shifts her weight and takes a slow breath; her shoulders move naturally, her short black hair and leather jacket flutter gently in the high-altitude wind. Small orange lights beneath the cybernetic implants on her neck and robotic arm pulse softly. Rainwater beads, streams, and reflects neon light across her jacket, metal arm, railing, and platform.
Heavy rain falls through the entire city with realistic depth. Volumetric mist drifts between the skyscrapers. Holographic billboards flicker, scan, and cast shifting cyan, magenta, and amber light across the buildings. Neon reflections ripple naturally across wet metal and glass. Numerous flying cars move through different depth layers at different speeds, producing realistic atmospheric perspective and complex city traffic.
At the middle of the shot, a large armored hovercraft passes rapidly through the midground from right to left, briefly illuminating the woman’s silhouette with sweeping red and blue light. Its engines push rain and fog outward, creating a visible wave of mist and subtle vibration in her jacket and hair.
During the final second, a distant lightning flash illuminates the clouds and reveals the enormous vertical scale of the megacity. The camera gently settles just behind her right shoulder without revealing her face, ending on a powerful view of the living neon city.
Photorealistic, ultra-detailed cyberpunk environment, cinematic sci-fi film quality, realistic rain physics, physically accurate lighting, deep atmospheric perspective, volumetric fog, complex environmental motion, strong parallax, subtle camera micro-movement, controlled motion blur, anamorphic lens, high contrast, dark blue and cyan night atmosphere, magenta neon accents, fluid motion, stable character anatomy, one uninterrupted shot, no cuts.image_urlsarrayRequiredReference image URL. Image-to-video only — exactly one image.
Notes
- Required. Exactly 1 image
- Formats: .jpg, .jpeg, .png, .webp
- Max 10MB per image
- URL must be directly accessible
["https://cdn.evolink.ai/Model-Example/GrokImagine1.5/generated-image.png"]durationintegerOptionalDefault: 6Output duration in seconds.
| Value | Description |
|---|---|
| 1-15 | Any integer between 1 and 15 (step 1) |
Notes
- Duration directly affects billing
6qualitystringOptionalDefault: 480pOutput resolution.
| Value | Description |
|---|---|
| 480p | Standard (default) |
| 720p | HD, billed at ×1.75 |
480pcallback_urlstringOptionalHTTPS callback URL for task completion notification. Triggered when the task completes, fails, or is cancelled (HTTPS only).
https://your-domain.com/webhooks/video-done