
MiniMax H3 vs 可灵 3.0:画面、声音和成本怎么选?
两个模型在 EvoLink 上都能做到 15 秒,所以时长也不是有效的区分点。真正拉开差距的是一条镜头是怎么搭出来的:MiniMax H3(中文语境里也常被叫作海螺 3)给你关键帧和一整套有顺序的参考素材,用来磨出一条可控的成片;可灵则能在一次请求里排好几个镜头,画质从 720p 一直到 4K。
最值得花时间实测的恰恰是声音,因为两边都会生成,也都不作保证。在把任何一个定为默认路由之前,先用你自己的片子给对白节奏、口型同步、说话人归属和环境音各打一次分。
准备开测? 打开 MiniMax H3 和 可灵 3.0,用同一份需求各跑一遍,并且把画面和声音放在一起评审——不要先看画面再补听声音。H3 的请求模式和模型 ID,可以参考 MiniMax H3 API 教程。
最大的区别:一条打磨到位的镜头,还是一整段排好的镜头序列
H3 是更聚焦的视觉生产路由。它当前在 EvoLink 上的契约包括:
- 文生视频;
- 图生视频,可使用首帧、尾帧,或首尾帧同时使用;
- 参考生视频,使用有序的图像、视频和音频输入;
- 固定 2K 输出;
- 4–15 秒之间的任意整数时长。
H3 返回的成片带生成音频。音频也可以作为参考输入去引导参考生视频工作流,但那和 H3 输出端产生的声音是两回事。因为没有开关,团队没法向 H3 要一个纯画面文件:如果交付物必须承载自己的配音或已授权的音乐,就要提前规划把生成音轨去掉或替换,而不是指望绕开它。
可灵 3.0 的取舍不同。当前 EvoLink 上的标准路由覆盖文生视频和图生视频,并提供:
- 3–15 秒输出;
- 720p、1080p 和 4K 可选;
- 图生视频的首帧与尾帧控制;
- 通过
sound设置生成音效; - 单镜头或多镜头生成;
- 受支持的图像工作流中的元素控制。
落到实际使用上,分界线是这样的:
| 生产诉求 | 从 MiniMax H3 起步 | 从可灵 3.0 起步 |
|---|---|---|
| 高性价比的 2K 画面输出 | 是 | 只有当其他画质档位真的有价值时再比 |
| 纯提示词的画面场景 | 是 | 是 |
| 首尾帧之间的转场 | 是 | 可以,但要确认与多镜头的兼容性 |
| 丰富的图像、视频、音频参考 | H3 有专门的参考路由 | 不要把标准可灵 3.0 和 Kling O3/Omni 混淆 |
| 输出中的生成声音 | 会生成,但不可配置 | 由 sound 设置控制 |
| 需要一条刻意无声的成片 | 后期去掉或替换生成音轨 | 关闭声音再生成 |
| 多角色对白 | 会生成;需自行验证说话人绑定与口型同步 | 可灵官方能力,值得测 |
| 一次请求里的多镜头序列 | 分别生成 H3 镜头再剪辑 | 当前可灵路由已支持 |
| 固定交付档位 | 2K | 720p、1080p 或 4K |
MiniMax H3 与可灵 3.0 核心对比
下表把「EvoLink 当前路由事实」与「厂商更宽泛的官方定位」分开列出。
| 对比维度 | EvoLink 上的 MiniMax H3 | EvoLink 上的可灵 3.0 | 对生产的意义 |
|---|---|---|---|
| 主要路由结构 | 文生、图生和参考生视频 | 文生视频与图生视频 | H3 有专门的多模态参考路由;标准可灵比 Omni 更简单 |
| 时长 | 4–15 秒 | 3–15 秒 | 可灵覆盖更短的开场钩子;两者上限都是 15 秒 |
| 画质 | 固定 2K | 720p、1080p 或 4K | H3 统一交付规格;可灵支持成本与画质的取舍 |
| 首帧 / 尾帧 | 首帧、尾帧或两者同时使用 | 首帧加可选尾帧 | 两者都支持端点受控的转场 |
| 多模态参考 | 最多 9 张图像、3 个视频和 3 个音频文件 | 标准路由使用图像与元素控制;更复杂的参考与编辑任务属于 Kling O3 | 家族名不能掩盖具体路由的差异 |
| 生成音频 | 与视频一同生成,没有关闭开关 | sound 控制是否生成声音 | H3 替你把这个决定取消了;可灵把它留给你 |
| 对白定位 | 与画面一起生成;语言与说话人表现需要实测 | 官方 Video 3.0 资料描述多语种和多角色对白 | 两边都要验证语言、说话人和口型同步 |
| 多镜头 | 分别生成镜头再拼接 | 内置智能或自定义多镜头控制 | 可灵能在一个任务里规划多个叙事节拍 |
| 可灵当前起价 | 不适用 | 当前 EvoLink 产品页显示起价为每秒 $0.075 | 画质和声音设置会改变可灵的实际计费 |
| 最适合的默认角色 | 可控 2K 画面与参考驱动的镜头 | 音画一体的叙事和多镜头序列 | 按最终交付物路由,而不是按功能数量 |
别把可灵 3.0 和可灵 3.0 Omni 混为一谈
「可灵 3.0」这个说法可能指一代模型、一个创作产品,也可能指快手发布的整个模型家族。这种模糊性制造了大量不准确的对比页面。
EvoLink 上的标准可灵 3.0 页面当前开放的是文生视频和图生视频。Kling O3——也就是和 Video 3.0 Omni 关联的那条线——是另一个模型入口,面向更宽的参考生视频和视频编辑工作流。
在和 H3 对比时,这个区分很关键:
- H3 的标准家族里包含一条专门的多模态参考路由。
- 标准可灵 3.0 包含文生 / 图生、声音、多镜头和受支持的元素控制。
- Kling O3 才承载更宽的 Omni 参考与编辑行为。
原生音频不等于「有声音」
说话人绑定
在多角色场景里,明确指定每句台词由哪个角色说出。检查在镜头切换、角色遮挡,或同一场景出现三个人时,对白是否仍然贴在正确的那张脸上。
语音同步
评审嘴部动作、台词时机、停顿、呼吸、面部表情,以及可见动作是否给这句台词留出了足够时间。语义正确但口型慢半拍的语音,不算完成品。
H3 在这件事上给了一条有文档依据的控制路径。它的参考生视频路由可以把音频文件当作音色来源,官方请求示例就是同时传一段参考视频和一段参考音频,并在提示词里写上台词和「使用 Audio 1 的声音并同步口型」这样的指令。也就是说,台词写在提示词里,音色来自你自己的录音——当品牌音色或某个固定配音演员需要跨镜头保持一致时,这一点很有用。要注意这条路由自身的限制:至少要有一张参考图或一段参考视频,只传音频会被拒绝。
语言、口音与发音
可灵官方指南记录了多语种输出和口音支持。请用目标市场的实际语言去测人名、产品词、数字和中英混说。不要把一条成功的中文或英文样片推广成通用的语言质量结论。
环境音与音效
脚步、开关门、引擎、氛围声、撞击和房间混响,都应该与可见空间和时间点匹配。单独听上去合理的音效,放在这个机位距离或这种材质上仍然可能是错的。
音乐与叙事节奏
如果需求里包含音乐,要评估它是否支撑了预期节奏,而不是盖过对白。同时要确认转场和运镜是跟着音频结构走,还是在和它打架。
sound 参数,文档记录的是音效控制;它更宽的原生对白表现来自可灵官方的模型定位。H3 的路由则完全没有记录任何音频参数,所以它生成的音轨里到底有什么——对白、音效、环境音,还是三者混合——只能靠你自己的输出去确认,参数表给不出答案。任何一方的官方定位,都不能替代你亲耳去听自己生成的片子。
H3 的价值在哪里
H3 的吸引力在于:它把一个高且固定的 2K 输出档位,放在三条职责清晰的视觉工作流后面,并且每个结果都自带声音。团队不需要为每次请求在多个分辨率之间选择,也完全不用配置音频。
它的价值主张在以下情况下最强:
- 交付物本来就需要一个音画一体的结果;
- 每次请求少做几个决定,比细粒度控制更重要;
- 首尾帧控制定义了创作任务本身;
- 一小组职责明确的身份、动作、风格和音频参考就能指导这个镜头;
- 每条通过验收的成片都需要 2K;
- 产品希望向用户呈现三个能听懂的任务,而不是一堆模型变体。
当生成的声音不符合需求时,H3 的这个优势就会反转。因为音频随视频一起到来且无法关闭,一条被否掉的音轨不是「下次不勾这个选项」就能省下的开销——它要么在后期被替换,要么整条重新生成。这也正是应该把「完成的交付物」而不是「原始生成次数」当作成本单位的原因。
声音的成本
可灵 3.0 按秒计费,并叠加画质与声音倍率。当前 EvoLink 产品页显示的路由起价是每秒 $0.075,但一条 1080p 带声音的片子,和最低成本的无声配置并不等价。做预算前请以实时产品页的当前计费为准。H3 没有对应的杠杆:无论交付物用不用得上,声音都已经包含在路由价格里。
因此两个模型需要同一套成本模型,差别在于「一次否决」的代价:
finished_video_cost =
audio_video_generations
+ audio_video_retries
+ dialogue_or_sound_repairs
+ track_replacement_when_generated_audio_is_unusable
+ review_time当某个任务确实不需要声音时,可灵会赢,因为它可以直接生成更便宜的无声配置,而不是为一段注定要丢掉的音频付费。当一次通过的生成能同时解决配音、音效、同步和多镜头拼接时,它也会赢。
当每条交付物本来就想要声音时,H3 会赢,因为打包的音轨省掉了一道独立的音频工序和一个额外供应商。风险同样存在:画面通过、对白不可用的片子,仍然要修或者重跑。要测量每次修正之后还剩下多少可用成果,并且把音频和画面放在同一轮评分里,而不是评完画面再说。
多镜头叙事改变了请求结构
可灵 3.0 支持智能多镜头和自定义多镜头生成。在自定义模式下,一次请求可以定义多个镜头的提示词和时长,其总和等于任务总时长。
这可以让一条 15 秒广告在一次生成里包含:
- 一个交代环境的大远景;
- 一段中景的产品交互;
- 一个收尾的特写;
- 一条贯穿所有转场的连续声音。
好处是协调性。景别、叙事顺序和声音可以在一次生成里统一规划。风险是失败范围更大:只要其中一个镜头改变了产品,或者把对白分配给了错误的角色,整条输出就可能需要重来。
H3 的对应做法是逐个镜头单独生成。这需要更多编排和剪辑工作,但也让团队可以独立验收、替换和路由每一个镜头。
按修改行为来选择结构:
| 修改模式 | 更合适的起始结构 | 原因 |
|---|---|---|
| 每个镜头都可能收到独立的品牌反馈 | 分开生成的 H3 镜头 | 某个节拍失败或被改,不会作废整条序列 |
| 节奏和声音必须贯穿多次镜头切换 | 可灵多镜头 | 一个任务就能协调整段音画序列 |
| 最终剪辑会从大量素材里挑最好的一条 | 分开生成的 H3 镜头 | 剪辑可以混用多个通过的候选 |
| 创意本身就是一段紧凑的剧本化场景 | 可灵多镜头 | 叙事节拍可以一次性写清楚 |
首尾帧控制
当前 EvoLink 上的两条图生视频路由都能使用起始状态和结束状态,但周边的控制项不同。
H3 的图生视频路由就是围绕首帧、尾帧或两者同时使用设计的。这让它天然适合产品形态变化、Logo 演绎、材质变化、组装过程,或者一段有指定落点的运镜。
可灵图生视频同样支持起始图和可选的结束图。但它当前文档说明,结束帧不能与多镜头模式同时使用。这就意味着,产品必须在「受控落点」和「多镜头结构」之间为该次请求做出选择。
这是一个实现层面的差异,但它确实重要:
- 当最终构图是硬性验收条件时,选择结束帧;
- 当镜头推进比落在某张指定图上更重要时,选择多镜头;
- 在没有验证这个不支持的组合之前,不要在产品界面上同时暴露两个控制项。
三类更适合从 H3 起步的任务
1. 有确定结尾的产品转场
把闭合或原始状态的产品作为首帧,把已审核通过的结果作为尾帧,提示词只描述运动、材质表现、运镜和节奏。H3 固定的 2K 输出和聚焦的关键帧契约很适合这类任务。
2. 需要分开评分的广告素材
很多广告团队会先锁画面,再套上受控的配音、已授权的音乐和品牌音效库。H3 依然会返回一条生成音轨,所以正确的做法是先单独评审画面,再在后期替换音频。要把这一步替换成本算进预算,不要假设自己能向 H3 要一条干净的分轨。
3. 参考驱动的角色或动作任务
当身份图像、动作视频和可选的音频节奏需要在同一个视觉请求里各司其职时,使用 H3 参考生视频。保持参考素材组合内部一致,并记录哪份素材负责身份、动作、风格和时间节奏。
三类更适合从可灵 3.0 起步的任务
1. 多角色对白场景
可灵官方的说话人绑定定位,直接针对生成式对白里最常见的失败点。请测试指定说话人、台词重叠、反应镜头和镜头切换,而不是只看一条单人演示。
2. 需要成品声音的短广告
当对白、环境音、音效和音乐在第一轮评审里就要一起看时,音画一体的生成能让真实交付效果更早暴露。结果通过时这能省下大量工作;但画面或声音任一环失败时,重跑成本也会更高。
3. 剧本化的多镜头序列
当多个已经规划好的节拍必须塞进一个 3–15 秒任务里时,使用自定义多镜头。要验证各镜头时长加总正确,并且场景身份、产品几何结构和声音连续性在每次转场后都还成立。
怎么做一次公平的配对测试
一条提示词无法支撑这个决策。建议使用三条测试轨道:
| 测试轨道 | 共同需求说明 | H3 设置 | 可灵设置 | 主要评分指标 |
|---|---|---|---|---|
| 纯画面对等 | 相同主体、动作、运镜和 10 秒目标时长 | H3 2K,评画面时把生成音轨静音 | 选择最接近的画质目标,关闭声音 | 画面遵循度、稳定性、每条通过画面的成本 |
| 单人广告 | 相同角色、台词、动作和环境 | 画面与声音一起生成 | 画面与声音一起生成 | 得到一条通过验收音画成片的总时间与成本 |
| 多角色多镜头场景 | 相同脚本、说话人、分镜表和时长 | 分开生成各镜头再剪辑;逐镜检查说话人绑定 | 使用可灵自定义多镜头并开启声音 | 说话人绑定、镜头连续性、剪辑时间、通过素材成本 |
每次尝试都要评分:
- 主体与产品一致性;
- 提示词与运镜遵循度;
- 手部、面部、接触关系和物理运动;
- 使用尾帧时的落点准确度;
- 镜头顺序与转场质量;
- 说话人绑定;
- 发音和口型同步;
- 环境音与音效的时间点;
- 生成延迟;
- 失败、重试、内容审核和评审时间;
- 得到一条通过交付物的总成本。
评画面时对评审隐藏路由名称。先单独评审音频,再评审合成后的结果。否则一段出彩的声音可能掩盖薄弱的画质,一张好看的画面也可能让人忽略错误的对白。
常见失败模式与补救
| 失败情况 | H3 的补救方式 | 可灵 3.0 的补救方式 |
|---|---|---|
| 画面可用但声音不对 | 在后期替换生成音轨,而不是重新生成画面 | 判断声音是否可修;不可修则重跑整个音画任务 |
| 对白挂到了错误的角色身上 | 简化场景或减少重叠说话人后重跑 | 明确命名说话人并减少台词重叠 |
| 多镜头中某个节拍失败 | 只替换那一个独立的 H3 镜头 | 重跑或重新设计整个多镜头请求 |
| 最终画面没有落到指定尾帧 | 简化运动,让首尾帧更兼容 | 使用尾帧控制而非多镜头;简化转场 |
| 参考素材相互冲突 | 移除较弱的身份、动作或音频来源 | 减少元素歧义,或把任务转到正确的 Omni 路由 |
| 4K 暴露出细节瑕疵 | H3 的 2K 原片同样需要原尺寸审核 | 审核 4K 原始输出,不要只看预览 |
| 成本意外上升 | 检查时长、参考视频输入和重试次数 | 检查时长、画质、声音倍率和重跑次数 |
两条路由给出的运维结论是一样的:音画一体的输出,也把验收风险合并在了一起。区别在于可灵允许你通过不生成声音来退出这份风险,H3 不允许——所以用 H3 时,音频出问题的补救方案必须在开工之前就存在。
推荐的 EvoLink 路由策略
| 产品任务 | 默认路由 | 挑战者或回退 |
|---|---|---|
| 成本敏感的 2K 画面镜头 | MiniMax H3 | 画质需要灵活时,用关闭声音的可灵 |
| 首尾帧转场 | MiniMax H3 图生视频 | 不启用多镜头的可灵图生视频 |
| 多模态参考驱动的画面 | MiniMax H3 参考生视频 | 需要更宽 Omni 契约时用 Kling O3 |
| 必须无声的交付物 | 关闭声音的可灵 3.0 | H3 加一道音轨替换工序 |
| 多语种或多角色对白 | 两边都测;可灵有说话人绑定的官方记录 | 以通过你自己语言与口型审核的那一方为准 |
| 紧凑的多镜头广告 | 可灵 3.0 | 分开生成 H3 镜头,在剪辑软件里拼接 |
| 先锁画面的品牌战役 | MiniMax H3 | 生成音轨完全用不上时,用关闭声音的可灵 |
把产品任务与裸模型 ID 解耦:
visual_final_shotkeyframe_transitionreference_performancesound_effect_scenedialogue_scenemulti_shot_ad
通过配置把这些任务映射到具体路由。提交任务前验证互斥的控制组合,尤其是可灵的尾帧与多镜头。为每个生产关键任务保留一条经过测试的回退路由。
EvoLink 的统一 API 网关,让团队可以在一次接入里完成模型选择、任务追踪、回调、用量和计费,同时把不同交付物分别路由到 H3 或可灵。
最终结论
最好的生产策略可能两个都用,但分工不再沿着过去那条「一个管画面、一个管声音」的旧线。按任务需要多少控制权来路由:交付物就是一条不用配置的 2K 音画片子时用 H3;任务需要无声文件、其他分辨率,或者要在一个任务里协调多个节拍时用可灵。
从最终交付物出发,并且把它的音频和画面放在同一轮评审里看。因为 H3 的音轨关不掉,它的成本和验收风险就写进了这次生成——你想要这段声音时这是优势,你不想要时这是额外开销。
常见问题
MiniMax H3 比可灵 3.0 更好吗?
不是所有任务都如此。海螺 3 和可灵 3.0 都会随视频生成音频,所以选型跟「谁有声音」无关。H3 是一条聚焦的 2K 路由,提供文生、关键帧和多模态参考三种模式,且没有任何音频配置项。当你需要关闭声音、挑选分辨率档位,或者把多个镜头塞进一次请求时,可灵 3.0 更合适。
哪个更划算?
当交付物本来就要有声音时,H3 的性价比很强,因为打包的音轨省掉了一道独立的音频工序。而对于完全不需要声音的任务,可灵可能更便宜,因为它能生成成本更低的无声配置。公平的对比必须算上当前路由价格、重试次数、可能的音轨替换和评审人力,而不是只比一次提交的调用价。
MiniMax H3 支持原生音频吗?
generate_audio 这类参数:这条声音无法通过一次请求开启或关闭。另外,参考路由还可以把音频作为输入,用来引导节奏或音色语境;那是另一套机制,和 H3 产出的音轨不是一回事。至于在你自己的提示词、语言和说话人下,生成音频里究竟包含什么,仍然需要用你自己的输出去核实。可灵 3.0 支持原生音频吗?
sound 参数。请针对你的应用实际需要的对白和语言行为做测试。H3 和可灵 3.0 的视频最长多少秒?
当前 EvoLink 路由上两者都能到 15 秒。H3 支持 4–15 秒,可灵 3.0 支持 3–15 秒。
哪个模型支持更高分辨率?
H3 当前输出固定 2K 文件。可灵 3.0 在当前 EvoLink 路由上提供 720p、1080p 和 4K 选择。分辨率更高不自动等于通过率更高,请以原始文件检查细节瑕疵。
两个模型都支持首尾帧视频吗?
都支持。当前两条图生视频路由都支持端点控制。在可灵 3.0 上,当前 API 契约不允许在同一次请求中同时使用尾帧和多镜头模式。
可灵 3.0 和 Kling O3 有什么区别?
标准可灵 3.0 聚焦文生视频和图生视频,并带有声音、多镜头和受支持的元素控制。Kling O3 是更宽的 Omni 入口,面向参考生视频和视频编辑工作流。请以 EvoLink 上具体的模型契约为准,不要把可灵 3.0 家族的所有能力当成同一条路由。
做多角色对白广告,哪个模型更好?
两个都要测,因为两个都会生成对白。可灵在文档里明确写了说话人绑定和多语种输出,所以对一份指名道姓的多说话人脚本来说,它是文档更完整的起点。H3 会生成对白但没有这些控制项,因此要用你自己的片子确认:角色重叠或镜头切换时,台词是否仍然贴在正确的那张脸上。
可以在一次 EvoLink 接入里同时使用 MiniMax H3 和可灵 3.0 吗?
可以。EvoLink 让产品用一把 API Key 和同一套异步任务流程,把不同任务分发到不同模型 ID。但每个模型的输入字段、画质、时长、音频以及互斥控制规则,仍然需要明确校验。


