Wan3.0 Reference-to-Video 参考生视频
- 通过参考图 / 参考视频 / 参考音频 / 文件 / 网页作为素材,模型自动理解意图后生成视频
- 提示词中用「图1」「视频1」「音频1」指代对应素材,三类素材分别独立计数
prompt与参考素材至少提供其一- 不接受首尾帧(
image_start/image_end):参考素材与首尾帧互斥,如需严格控制起止画面请改用 Wan3.0 图生视频 - 🔴 参考视频计入计费,参考图 / 参考音频 / 文件 / 网页不计费
- 异步处理模式,使用返回的任务ID 进行查询
- 生成的视频链接,有效期为24小时,请尽快保存
计费说明
- 计费公式:计费时长 = 输入视频时长 + 输出视频时长,按秒计费
- 分辨率倍率:
480p= 1x(基准)、720p= 2x、1080p= 4x - 参考图片、参考音频、参考文件、网页链接均不计费
duration传-1(智能时长)时按30秒顶格预扣,任务成功后按实际产出时长结算,差额自动退回- 开启或关闭
audio音轨价格相同 - 任务失败不计费,已冻结额度全额退回
授权
请求体
模型名称,固定为 wan3.0-reference-video
wan3.0-reference-video "wan3.0-reference-video"
视频生成的文本提示词。支持中英文,每个汉字/字母各占 1 个字符,最大长度 20000 字符,超过部分会自动截断(不报错)
素材指代规则:
- 用「图1、图2」指代
image_urls中对应顺序的图片(1-based) - 用「视频1、视频2」指代
video_urls中对应顺序的视频 - 用「音频1、音频2」指代
audio_urls中对应顺序的音频 - 图片、视频、音频分别独立计数,即可以同时存在「图1」与「视频1」
- 英文提示词用 "Image 1"、"Video 1"、"Audio 1"(首字母大写,词与数字之间留空格)
"视频1中的角色抱着图3,坐在图4的椅子上弹奏一支舒缓的乡村民谣,并说道:“今天的阳光真好。”"
参考图片 URL 数组,最多 10 张。可提供主体角色(人物/动物/物体)或场景背景;当包含主体时,建议每张图仅含单一角色
数组顺序对应提示词中的「图1、图2……」。
图像限制:
- 格式:JPEG、JPG、PNG(不支持透明通道)、BMP、WEBP
- 分辨率:宽和高的范围为
[240, 8000]像素 - 宽高比:1:8 ~ 8:1
- 文件大小:不超过
20MB
10参考视频 URL 数组,最多 5 段。数组顺序对应提示词中的「视频1、视频2……」
时长限制:
- 单段
1 ~ 15秒 - 合计不超过 15 秒
- 参考视频总时长 + 输出视频时长 不得超过 30 秒
🔴 参考视频计入计费:计费时长 = 输入视频时长 + 输出视频时长。参考图片、参考音频、文件、网页均不计费
视频限制:
- 格式:mp4、mov
- 分辨率:宽和高的范围为
[240, 4096]像素 - 宽高比:1:8 ~ 8:1
- 单文件大小:不超过
100MB
5参考音频 URL 数组,最多 5 段。数组顺序对应提示词中的「音频1、音频2……」
⚠️ 与 Wan2.7 语义不同: Wan2.7 的 audio_urls 是绑定到某个参考图/参考视频上的音色;Wan3.0 的参考音频是独立素材,由提示词用「音频1」直接指代,不支持 model_params.voice_bindings 音色绑定协议。从 Wan2.7 迁移时请注意改写。
时长限制:
- 单段
1 ~ 15秒,合计不超过 15 秒 - 参考音频不计费
音频限制:
- 格式:wav、mp3
- 文件大小:不超过
15MB
5模型扩展参数。file_url 与 link_url 互斥,只能二选一
生成视频的时长(秒),默认为 5
取值说明:
2~30之间的任意整数-1:智能时长,由模型根据提示词与输入素材自动决定输出长度
智能时长的计费方式: 提交时无法预知模型会生成多长,因此按上限 30 秒顶格预扣,任务成功后以实际产出时长结算,多冻结的部分自动退回。若余额不足以覆盖顶格预扣,请改用明确的秒数。
传入参考视频时的额外约束:
- 参考视频总时长 + 输出视频时长 不得超过 30 秒
- 例:参考视频合计 10 秒时,
duration最大只能取 20
5
视频分辨率,默认为 720p
可选值:
480p:清晰度较低,价格最低(计费基准档)720p:标准清晰度,此为默认值,价格为480p的 2 倍1080p:高清晰度,价格为480p的 4 倍
480p, 720p, 1080p "720p"
视频宽高比,默认为 adaptive
可选值:
adaptive:自适应,模型根据输入素材比例与提示词意图自动推荐合适的宽高比,此为默认值16:9(横屏)、9:16(竖屏)、1:1(方形)、4:3、3:4
adaptive, 16:9, 9:16, 1:1, 4:3, 3:4 "16:9"
输出视频是否包含音轨,默认为 true
可选值:
true:输出视频包含声音(人声、音效、背景音乐),此为默认值false:输出无声视频
开关声音价格相同,不额外收费。
true
随机种子,用于复现生成结果,默认随机
说明:
- 取值范围:
0~2147483647 - 固定 seed 可在调试提示词时降低参数变化的干扰,提升结果可复现性
0 <= x <= 214748364742
任务完成后的 HTTPS 回调地址
回调时机:
- 任务完成(completed)、失败(failed)或取消(cancelled)时触发
- 在计费确认完成后发送
安全限制:
- 仅支持 HTTPS 协议
- 禁止回调到内网 IP 地址(127.0.0.1、10.x.x.x、172.16-31.x.x、192.168.x.x 等)
- URL 长度不超过
2048字符
回调机制:
- 超时时间:
10秒 - 失败后最多重试
3次(分别在失败后1/2/4秒重试) - 回调响应体格式与任务查询接口返回格式一致
- 返回 2xx 状态码视为成功,其他状态码触发重试
"https://your-domain.com/webhooks/video-task-completed"
响应
视频生成任务创建成功
任务创建时间戳
1761313744
任务ID
"task-unified-1774857405-abc123"
实际使用的模型名称
"wan3.0-reference-video"
任务的具体类型
video.generation.task 任务进度百分比 (0-100)
0 <= x <= 1000
任务状态
pending, processing, completed, failed "pending"
视频任务详细信息
任务的输出类型
text, image, audio, video "video"
使用量和计费信息