Minimax H3 Reference-to-Video 多模态参考生视频
- 支持最多 9 张参考图片、3 个参考视频和 3 段参考音频
- 至少传入一张参考图片或一个参考视频,不支持仅音频输入
- 输出时长支持
5–15秒,当前仅支持2k - 异步处理模式,使用返回的任务 ID 进行查询
- 生成的视频链接有效期为 24 小时,请尽快保存
授权
请求体
视频生成模型名称
minimax-h3-reference-to-video "minimax-h3-reference-to-video"
描述如何使用参考素材以及期望生成的视频内容。
提示词要求:
- 必填且不能为空
- 支持中文和英文
- 建议中文不超过
500字、英文不超过1000词;提示词过长时,模型可能忽略部分细节
素材引用规则:
- 使用
Image 1、Image 2、Video 1、Audio 1等名称引用素材,不要使用 Seedance 风格的@image1、@video1 - 编号从
1开始,并与各 URL 数组中的顺序一致 image_urls第一项是Image 1,video_urls第一项是Video 1,audio_urls第一项是Audio 1
输入限制:
- 本模型不支持
image_start或image_end - 至少传入
1张参考图片或1个参考视频;参考音频不能单独使用
1"将 Video 1 中的人物替换为 Image 1 中的角色,保持 Image 1 的面部、发型和服装;完整保留 Video 1 的动作、构图和运镜,并使用 Audio 1 的声音演绎对白,确保口型同步。"
参考图片的 HTTP(S) URL 数组,默认为 [],最多 9 张。
角色与编号:
- 所有图片均作为
reference_image使用 - 数组第 1 项对应提示词中的
Image 1,第 2 项对应Image 2,依此类推
图片要求:
- 支持格式:JPG、JPEG、PNG、WEBP、HEIC、HEIF
- 单张大小:不超过
30MB - 图片宽度和高度:均为
256–5760px - 宽高比(宽/高):
0.4–2.5 - URL 必须使用 HTTP(S),且可由服务端直接访问
- 整个 JSON 请求体大小不超过
64MB;不接受 Base64 或mm_file://输入
组合规则:
- 至少传入
1张参考图片或1个参考视频 - 仅传
audio_urls会返回参数错误
9参考视频的 HTTP(S) URL 数组,默认为 [],最多 3 个。
角色与编号:
- 所有视频均作为
reference_video使用 - 数组第 1 项对应提示词中的
Video 1,第 2 项对应Video 2,依此类推
视频要求:
- 支持容器格式:MP4(
.mp4)、MOV(.mov) - 视频编码:H.264/AVC、H.265/HEVC
- 视频内音频编码:AAC、MP3
- 单个大小:不超过
50MB - 单个时长:
2–15秒;所有参考视频总时长不超过15秒 - 视频宽度和高度:均为
256–5760px - 宽高比(宽/高):
0.4–2.5 - 帧率:
23.976–60FPS - URL 必须使用 HTTP(S),且可由服务端直接访问
- 整个 JSON 请求体大小不超过
64MB;不接受 Base64 或mm_file://输入
计费说明:
- 参考视频的输入时长会计入费用
组合规则:
- 至少传入
1张参考图片或1个参考视频 - 仅传
audio_urls会返回参数错误
3参考音频的 HTTP(S) URL 数组,默认为 [],最多 3 段。
角色与编号:
- 所有音频均作为
reference_audio使用 - 数组第 1 项对应提示词中的
Audio 1,第 2 项对应Audio 2,依此类推
音频要求:
- 支持格式:WAV、MP3
- 单段大小:不超过
15MB - 单段时长:
2–15秒;所有参考音频总时长不超过15秒 - URL 必须使用 HTTP(S),且可由服务端直接访问
- 整个 JSON 请求体大小不超过
64MB;不接受 Base64 或mm_file://输入
组合规则:
- 参考音频不能单独使用
- 使用
audio_urls时,必须同时传入至少1张参考图片或1个参考视频
3输出视频时长(秒),默认为 5 秒。
取值限制:
- 仅支持
5–15之间的整数,包括5和15 - 不支持小数、数字字符串、
auto或-1 - 输出时长与计费直接相关
5 <= x <= 155
输出视频分辨率,默认为 2k。
可选值:
2k:当前唯一支持的分辨率
注意:
768p暂未开放,传入后会返回参数错误- 输出码率、帧率、视频编码和音频编码由平台决定,当前不提供对应请求参数
2k "2k"
输出视频宽高比,默认为 adaptive。
可选值:
adaptive:模型根据参考素材和提示词自动选择合适的宽高比21:9:超宽屏16:9:横屏4:3:横向标准画幅1:1:方形3:4:纵向标准画幅9:16:竖屏
adaptive, 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 "adaptive"
任务完成后的 HTTPS 回调地址
回调时机:
- 任务完成(completed)或失败(failed)时触发
- 在计费确认完成后发送
安全限制:
- 仅支持 HTTPS 协议
- 禁止回调到内网 IP 地址(127.0.0.1、10.x.x.x、172.16-31.x.x、192.168.x.x 等)
- URL 长度不超过
2048字符
回调机制:
- 超时时间:
10秒 - 失败后最多重试
3次(分别在失败后1/2/4秒重试) - 回调响应体格式与任务查询接口返回格式一致
- 返回 2xx 状态码视为成功,其他状态码触发重试
^https://"https://your-domain.com/webhooks/video-task-completed"
响应
视频生成任务创建成功
任务创建时间戳
1761313744
任务ID
"task-unified-1774857405-abc123"
实际使用的模型名称
"minimax-h3-reference-to-video"
任务的具体类型
video.generation.task 任务进度百分比 (0-100)
0 <= x <= 1000
任务状态
pending, processing, completed, failed "pending"
视频任务详细信息
任务的输出类型
text, image, audio, video "video"
使用量和计费信息