MiniMax H3(海螺 3.0)已上线 EvoLink领 10 积分免费试

MiniMax H3 提示词与视频案例

浏览 12 个附带真实 MiniMax H3 生成结果、输入要求和可替换变量的已核验提示词。可直接复制模板,或将它发送到 EvoLink Playground。

MiniMax H3 也常被称为海螺 3、Hailuo 3.0 或 Hailuo 03。

生成模式

使用场景

显示 12 / 12 条提示词

MiniMax H3 生成的科幻预告片:孤独人影站在巨大环形宇宙传送门前,标题从黑暗中逐渐显现多模态参考
15s16:92 个参考素材

电影感与视觉特效

科幻悬疑预告片

用两张参考图构建电影感预告片:一张定氛围,一张锁定主角,再用提示词控制一次连续推镜、屏幕标题和同步音效。

查看详情

完整提示词(已验证英文原文)

Realistic cinematic look, high-contrast lighting, and a tight pace. Use Figure 1 as the overall atmosphere and style reference, and Figure 2 as the protagonist reference. Shot 1 — Ultra-wide establishing shot. A huge circular cosmic gateway nearly fills the frame. The person is only a tiny figure seen from behind before the gateway, positioned toward the lower right. The ground is wet and reflective, and the center of the gateway is pitch black. The camera slowly pushes forward. A large title fades in from the edge of the darkness, blurred at first and then sharp: "THE STARS WERE LISTENING". Use an extremely condensed, heavy, all-caps typeface in dark red mixed with rust red, with subtle grain and misted edges. Audio: a deep low-frequency pulse, faint metallic vibrations in the distance, and a soft hit as the text becomes sharp. → Hard cut.

需要提供的素材

  • 图片 1:氛围与风格参考,包含希望镜头继承的环境、色板和调色。
  • 图片 2:主角参考,人脸和轮廓需足够清晰,以便人物在远景中仍可识别。
  • 最终要显示在画面中的标题文字;H3 会尝试渲染你写下的文字,因此要简短并确保拼写准确。

为什么有效

  • 每个参考素材只负责一件事:图片 1 控制氛围,图片 2 控制人物,避免模型猜测风格应继承自哪一张图。
  • 整个镜头只有一次连续推进和一个主事件(标题逐渐清晰),符合 15 秒视频可承载的信息量。
  • 音频被拆成低频脉冲、远处金属振动和文字变清晰时的轻击三层,比“电影感配乐”更可执行。

可替换变量

  • 标题文字和字体处理
  • 建立镜头中的传送门或地标
  • 标题颜色
  • 背景音
  • 结尾剪辑方式

限制与注意事项

  • 按数组顺序称呼素材,例如“图片 1”、“图片 2”,并与 image_urls 顺序一致。`@image1` 不属于当前 API 契约。
  • 这是一个故意停在硬切处的起步模板,方便你继续扩展第二个镜头。

生成设置

多模态参考 · 15s · 16:9 · 2 个参考素材

MiniMax H3 文生视频案例:黄昏厨房的手持镜头中,一只手绘发光生物在道具间移动文生视频
15s16:9无参考素材

电影感与视觉特效

厨房里的发光生物

纯文生视频模板,把黄昏厨房实拍与手绘发光动画结合,重点描述手持镜头的不完美感和必须排除的恐怖元素。

查看详情

完整提示词(已验证英文原文)

15-second, 16:9 landscape video. Blend live-action footage of a small kitchen at dusk with hand-drawn glowing animation. The last light of sunset lingers by the window. The lived-in kitchen contains an old wooden table, a half-washed mug, a slightly fogged glass bottle, and a hanging dishcloth. Give the footage subtle one-handed smartphone shake, hesitant close-range focusing, exposure fluctuations caused by backlight, and slightly coarse noise in the shadows. It should not look carefully arranged like an advertisement; instead, it should feel like someone hurriedly captured an unbelievable event at home. Do not show huge eyes, gaping mouths, fangs, threatening or lunging movements, sudden black frames, or jump scares. Use only kitchen room tone, cloth rubbing, the soft clink of a mug, water dripping from the faucet, the camera operator's footsteps and quiet breathing, plus gentle electronic sounds and tiny calls from the hand-drawn creature.

需要提供的素材

  • 无需上传素材,该路由只需提示词。
  • 时长和画面比例应在请求参数中设置,不要只写在提示词中。

为什么有效

  • 明确写出单手抖动、犹豫对焦、逆光曝光波动和暗部噪点,才能呈现“在家中仓促拍到”的质感,而不是广告片。
  • 简短的禁止列表排除巨大眼睛、尖牙、扑击和突然惊吓,防止可爱生物滑向恐怖风。
  • 音频指令分别指定房间底噪、布料摩擦、杯子碰撞、水滴、脚步、呼吸和生物发声。

可替换变量

  • 房间和时间
  • 生物设计与行为
  • 桌面道具
  • 镜头不完美特征
  • 音频层次

限制与注意事项

  • 提示词虽然写了时长和构图,API 请求仍需提供 duration 和 aspect_ratio。
  • 负面指令适合使用简短明确的列表;过多禁止项会挤占动作描述的空间。

生成设置

文生视频 · 15s · 16:9 · 无参考素材

MiniMax H3 生成的竖屏短剧预告:烛光城堡中的吸血鬼男主与人类女主多模态参考
15s9:162 个参考素材

短剧与叙事

吸血鬼爱情短剧

竖屏短剧开场模板:一张图锁定男女主外观,另一张图锁定场景,提示词把篇幅留给关系节拍和镜头景别,而不是塞入完整剧情。

查看详情

完整提示词(已验证英文原文)

Generate a 15-second, 9:16 vertical trailer segment for an international live-action vampire romance short drama. Use Figure 1 as the appearance reference for the male and female leads, and Figure 2 as the scene reference. Keep both leads' identities consistent, with a realistic live-action look and premium short-drama production quality. Story: an innocent human heroine accidentally enters a forbidden area of an old castle and awakens a sleeping aristocratic vampire. He discovers that she carries an aura connected to an ancient war, which sparks a powerful urge to control her and a dangerous fascination with her. She fears him but does not completely submit, resisting his pressure. Overall style: an international ReelShort / DramaBox vampire-romance trailer. Dark romance, dangerous attraction, fate, intense control, brooding oppression, and a striking reversal. Keep the visuals premium, restrained, and tightly paced, like the opening 15-second hook of a hit short drama. No gore, cheap horror, Halloween aesthetic, or modern street feel. Format: 9:16 vertical composition for TikTok / ReelShort / DramaBox. Use primarily medium close-ups, close-ups, and extreme close-ups, emphasizing faces, eye contact, pressure, and relationship tension within the vertical frame.

需要提供的素材

  • 图片 1:男女主同框参考,让模型把他们视为一组稳定选角。
  • 图片 2:场景参考,例如城堡内部、光线和材质。
  • 一句话故事前提和一个明确情绪反转;15 秒钩子只适合承载一次反转,不是整集故事。

为什么有效

  • 直接指定 ReelShort / DramaBox 预告片风格,可以用少量文字传递节奏、调色和构图惯例。
  • 限定中近景、近景和特写的镜头语汇,让竖屏画面更精致,而不是显得拥挤。
  • 排除血腥、廉价恐怖、万圣节风和现代街头感,避免这一类型最常见的四种偏移。

可替换变量

  • 主角外观参考
  • 场景
  • 前提与反转
  • 目标平台风格
  • 景别组合

限制与注意事项

  • 竖屏输出需通过参考路由的 aspect_ratio 请求,不能只在提示词中写“9:16”。
  • 男女主同时出现在一张图中,通常比两张独立裁切肖像更容易保持身份一致。

生成设置

多模态参考 · 15s · 9:16 · 2 个参考素材

MiniMax H3 生成的竖屏眼镜广告:两位模特在无缝白色影棚中佩戴未来感包覆式眼镜多模态参考
15s9:163 个参考素材

品牌与产品广告

未来感眼镜广告

三张图驱动的时尚广告:主视觉、模特面孔和产品设计分别由不同参考图负责。

查看详情

完整提示词(已验证英文原文)

Generate a vertical screen 9:16 high-end fashion glasses commercial, taking overall reference to the storyboard rhythm, editing speed, white studio texture and cool fashion atmosphere of the given video. The picture is a minimalist white booth, a seamless white background, a strong sense of high-end advertising, and a clean, simple, handsome, avant-garde, international first-line fashion blockbuster texture. Key visual character reference picture 1, two full-body female models, one black female model and one European and American model, maintain their high-end clothing, body posture, white studio light and shadow, fashion show temperament and overall cool attitude. Both of them wear futuristic high-end glasses. The design of the glasses refers to Figure 3, emphasizing the covered curved surface, sharp geometric cat-eye/goggle hybrid outline, mirror reflection, streamlined temples, and the texture of high-end fashion accessories. Please refer to Figure 2 for the appearance details of the two characters.

需要提供的素材

  • 图片 1:主视觉,包含模特全身、服装、影棚光线和态度。
  • 图片 2:两位人物的外观细节,用于保持剪辑中的面孔一致性。
  • 图片 3:产品参考,需足够清晰,以便快速镜头中仍能保留轮廓和材质。
  • 一个愿意贯穿整条视频的无缝影棚背景。

为什么有效

  • 三个参考素材各有一个明确职责,正是多模态参考路由的最佳用法;歧义才是多图提示词失败的主因。
  • 产品通过包覆式曲率、猫眼与护目镜混合轮廓、镜面材质和流线镜腿等几何特征来描述,而不只是写产品名称。
  • 单一材质的白色影棚降低背景变化,让模型把资源留给产品和演员。

可替换变量

  • 产品类别
  • 模特选角
  • 影棚颜色
  • 剪辑速度
  • 服装

限制与注意事项

  • 原提示词还要求参考给定视频的节奏,但当前公开素材只包含三张图。可将该句视为风格指令,或自行添加视频 1。
  • 每次参考请求最多支持 9 张图片、3 段视频和 3 段音频,且文件总数不超过 12 个;音频不能作为唯一参考类型。

生成设置

多模态参考 · 15s · 9:16 · 3 个参考素材

MiniMax H3 生成的黏土动画:黏土狐狸飞跃熔岩峡谷,摄影机从它下方掠过首尾帧
10s16:91 个参考素材

角色与动作

黏土狐狸飞跃峡谷

把一张起始图像变成一个明确动作,并像描述角色动作一样精确地描述摄影机路径。

查看详情

完整提示词(已验证英文原文)

Claymation style. A sprinting fox reaches the edge of a cliff and launches without hesitation, making a dramatically tense, heroic slow-motion leap across a vast lava canyon. While the fox is airborne, the camera rushes at high speed beneath its belly in a sweeping dynamic move, fully revealing the terrifying depth of the chasm and the fox's clay body at maximum extension in midair.

需要提供的素材

  • 一张已经包含风格的起始图,例如黏土狐狸和它的材质。
  • 只选一个要发生的主动作,不要同时写三个。

为什么有效

  • 提示词描述的是“变化”而不是图片外观;起始帧已经承载静态信息,因此每个字都用来购买动作。
  • 摄影机有独立指令:从狐狸腹部下方高速掠过,让一次跳跃真正变成一个镜头。
  • “在空中完全舒展”为模型提供了一个目标姿势,时序可围绕该峰值时刻展开。

可替换变量

  • 角色与材质风格
  • 环境和危险元素
  • 摄影机路径
  • 慢动作重点

限制与注意事项

  • 图生视频路由会根据输入图片确定输出比例,不接受 aspect_ratio。
  • 不要重复描述起始帧已经呈现的内容;这是浪费图生视频提示词的最常见方式。

生成设置

首尾帧 · 10s · 16:9 · 1 个参考素材

MiniMax H3 视频编辑案例:源视频中的报纸、椅子、墨镜和燃烧车辆被替换或移除多模态参考
10s16:91 个参考素材

编辑与转换

多元素场景编辑

对一段源视频执行六个独立修改,全部写成平铺的“目标 → 结果”指令,完全不重述场景。

查看详情

完整提示词(已验证英文原文)

Replace the newspaper in the reference video with a green-covered book; change the chair the character is sitting on to a red sofa; remove the sunglasses worn by the character to retain a clear face; remove the car burning effect to keep the vehicle in a normal state; change the photo the character takes out of his arms to a small black book; and add a tree on the left side of the screen

需要提供的素材

  • 视频 1:待编辑片段,2–15 秒,MP4 或 MOV,H.264 或 H.265,最大 50 MB。
  • 一份编辑列表,每条都指明要改什么、改成什么。

为什么有效

  • 每条指令都包含“目标 + 结果”,例如报纸变成绿色封面的书,不留猜测空间。
  • 删除操作同时写明期望终态,例如“去掉墨镜以保留清晰面孔”,防止原位留下空洞或畸变。
  • 不描述场景,让模型把源视频当作事实,只应用明确差异。

可替换变量

  • 编辑项数量
  • 替换的物体
  • 移除的效果
  • 新增元素

限制与注意事项

  • EvoLink 对外提供三条 H3 路由;编辑类任务通过参考生视频路由执行,源视频作为视频 1。
  • 参考视频时长会计费,上传前应先剪掉不需要的片段。
  • 修改项附近如果有必须保留的内容,要明确写出;未声明区域都可能被模型改动。

生成设置

多模态参考 · 10s · 16:9 · 1 个参考素材

MiniMax H3 生成的视觉小说界面转场,画面在锁定的开始帧和结束帧之间过渡首尾帧
15s16:92 个参考素材

短剧与叙事

乙女视觉小说转场

标准的首尾帧提示词:两张图锁定镜头的起点和终点,文字只需描述两个状态之间如何过渡。

查看详情

完整提示词(已验证英文原文)

Use the first image as the opening frame and the second image as the exact final frame to generate an otome visual-novel interface transition. Overall feel: a premium Chinese otome romance-interaction interface capturing an intimate moment before and after a performance. Transition naturally from "choose to watch his performance" to "Han Xu is drawn in by the heroine's words and reacts with intrigued interest." UI text, choices, and dialogue boxes should appear with refined otome-game presentation. Keep the transition silky smooth and the emotion suggestive yet restrained.

需要提供的素材

  • 图片 1:包含完整 UI 状态的开场帧。
  • 图片 2:希望准确落入的最终帧。
  • 一句话描述两个状态之间的情绪变化。

为什么有效

  • 起点和终点都被锁定,模型要解决的是插值而不是重新构图,这是获得可预测镜头的稳定方法。
  • 提示词描述情绪转变(“选择观看他的表演” → “被女主的话吸引并产生兴趣”),而不是逐帧罗列画面。
  • 明确要求界面元素按乙女游戏的表达方式动画,可减少 UI 被重绘。

可替换变量

  • 开始帧与结束帧
  • 两帧之间的情绪弧线
  • UI 表现风格
  • 转场速度

限制与注意事项

  • 在图生视频路由中分别以 image_start 和 image_end 传入两帧;参考路由不接受这两个字段。
  • 两帧的构图和光照越接近,过渡越平滑;完全无关的构图更像硬切,而不是转场。

生成设置

首尾帧 · 15s · 16:9 · 2 个参考素材

MiniMax H3 动作迁移案例:两个参考角色复制参考视频中的街舞动作多模态参考
10s16:93 个参考素材

角色与动作

街舞动作迁移

只用二十多个英文单词,就能把参考视频中的舞蹈动作迁移给两个图片角色,直观展示了“按顺序指定参考素材”的价值。

查看详情

完整提示词(已验证英文原文)

Have the characters perform street dance following the movements in Video 1. Use Figure 1 and Figure 2 as the character references.

需要提供的素材

  • 图片 1 和图片 2:两个角色各一张干净的全身参考图。
  • 视频 1:要复制的动作,2–15 秒,表演者需完整出现在画面中。

为什么有效

  • 提示词很短,因为信息由参考素材承载:视频提供动作,图片提供身份。
  • 每个素材都按数组位置被明确称呼,不会混淆哪个参考负责哪项信息。
  • 不再追加光照、运镜或风格指令,避免额外要求与动作复制竞争。

可替换变量

  • 角色
  • 源舞蹈动作
  • 环境
  • 表演者数量

限制与注意事项

  • 参考视频总时长需保持在 15 秒以内,每段视频必须为 2–15 秒、23.976–60 FPS。
  • 参考视频必须为 MP4 或 MOV,使用 H.264 或 H.265,单个最大 50 MB,整个 JSON 请求体小于 64 MB。

生成设置

多模态参考 · 10s · 16:9 · 3 个参考素材

MiniMax H3 对白替换案例:角色的台词被替换为参考音频中的新台词多模态参考
10s16:92 个参考素材

原生音频与对白

对白与表演替换

替换现有视频中的一句台词:准确引用旧台词和新台词,并允许表演只在匹配新对白所需的范围内调整。

查看详情

完整提示词(已验证英文原文)

Replace the girl's line in Video 1, "We can't be together. It's not that we don't love each other; we truly can't make it to the end," with the line from Audio 1: "Don't go, okay? This time, let's not let go of each other." Slightly adjust the corresponding performance.

需要提供的素材

  • 视频 1:包含待替换台词的原片。
  • 音频 1:新台词,WAV 或 MP3,最大 15 MB、最长 15 秒。
  • 在提示词中逐字写出新旧两句台词。

为什么有效

  • 引用待替换台词,可准确指定视频中要处理的片段,比“中间那句对白”更可靠。
  • 引用新台词后,口型同步有了明确目标,而不需只从音频猜测。
  • “轻微调整对应表演”给出了有边界的修改授权,让其他镜头内容尽可能保留。

可替换变量

  • 源视频
  • 待替换台词
  • 新台词与音色
  • 允许表演变化的程度

限制与注意事项

  • 音频不能是唯一参考类型,必须与图片或视频一起提交。
  • 每次请求的参考音频和视频总时长均不超过 15 秒。
  • 明确写出要保持不变的内容;如果只谈台词,构图、服装和背景都可能偏移。

生成设置

多模态参考 · 10s · 16:9 · 2 个参考素材

MiniMax H3 音色参考案例:角色使用参考音频中的音色说出指定台词多模态参考
10s16:92 个参考素材

原生音频与对白

“随风而行”音色参考

最小可用的音频参考提示词:写明要说的台词,再用一段音频规定由谁的音色说出它。

查看详情

完整提示词(已验证英文原文)

Character dialogue: "Follow the wind, live free. Leave worries behind, enjoy the moment." Use Audio 1 as the voice-timbre reference.

需要提供的素材

  • 视频 1:要说出台词的角色。
  • 音频 1:2–15 秒的干净目标音色样本,尽量不带背景音乐。
  • 逐字写出要说的台词。

为什么有效

  • 台词使用引号准确写出,时序和口型同步就有具体目标。
  • 音频 1 只被赋予“音色”这一项职责,而不是被模糊当作整体配乐。
  • 没有额外指定构图和表演,因此这些信息继续由参考视频控制。

可替换变量

  • 台词
  • 音色参考
  • 角色视频
  • 语速

限制与注意事项

  • 音色参考只传递音色,不自动传递口音、情绪和节奏;如果这些很重要,需另写在提示词中。
  • 音乐或多人重叠说话会降低效果,应提供隔离的单人语音。

生成设置

多模态参考 · 10s · 16:9 · 2 个参考素材

MiniMax H3 舞台案例:两位魔术师在烟雾中交换西装颜色,幕布从红色转为蓝色首尾帧
7s16:91 个参考素材

编辑与转换

魔术师服装互换

用一场舞台魔术测试指令遵循:两套服装互换,一处细节必须不变,背景则按时完成颜色过渡。

查看详情

完整提示词(已验证英文原文)

Two magicians stand onstage facing the audience and perform a "swap" trick. They wave their wands at the same time, and a cloud of smoke rises. When it clears, their suit colors have switched: the person on the left wears a white suit, and the person on the right now wears a black suit, while both magicians' glove colors remain unchanged. They bow to thank the audience. The red curtain behind them closes, transitioning from deep red to deep blue.

需要提供的素材

  • 一张包含两位表演者、服装和舞台的起始图。
  • 需要互换的内容要有清晰的前后状态。

为什么有效

  • 使用烟雾事件遮挡交换,让模型有一个合理时机完成变化,而不是在画面中直接融化。
  • 在写明需要改变的服装时,紧邻写出手套颜色必须保持不变,防止编辑范围扩散。
  • 镜头有明确的最终状态:鞠躬、幕布闭合、颜色落在深蓝色。

可替换变量

  • 表演者与服装
  • 必须保持不变的细节
  • 用于遮挡交换的事件
  • 结尾颜色转换

限制与注意事项

  • 图生视频路由根据输入图片确定画面比例,不接受 aspect_ratio 字段。
  • 模型可能改动任何未声明属性;如果某个细节必须在变化中保留,就要写明。

生成设置

首尾帧 · 7s · 16:9 · 1 个参考素材

MiniMax H3 生成的产品片:高端头戴式耳机在黑色影棚的反光展台上旋转文生视频
15s16:9无参考素材

品牌与产品广告

高端耳机产品展示

把 15 秒产品片拆成四个时间段,每段都有独立运镜和任务;这是本页最适合无参考素材用户直接复用的模板。

查看详情

完整提示词(已验证英文原文)

Create a 15-second luxury cinematic product showcase for premium wireless over-ear headphones. 0–4s: Begin with an extreme macro tracking shot moving across the soft memory-foam ear cushion, fine fabric texture, brushed-metal hinge and precision-machined controls. A narrow light band travels across the surface, revealing realistic materials against a deep black studio background. 4–8s: Pull back into a three-quarter hero view. The headphones rotate slowly above a glossy reflective pedestal. The ear cups pivot naturally while the adjustable headband extends slightly, demonstrating flexible construction and comfort. Maintain exact symmetry, stable geometry and consistent proportions. 8–12s: Transition into an elegant exploded-view reveal. The ear cushion, acoustic driver, internal sound chamber, control ring and outer shell separate smoothly in perfect alignment. Subtle luminous sound waves pulse outward from the driver while the camera performs a restrained side orbit. 12–15s: Every component reconnects seamlessly. The headphones settle into a centered front-facing hero composition as soft rim lighting defines the silhouette. Complete a gentle dolly-in toward the ear cups. Premium technology-commercial finish, controlled reflections, realistic shadows, shallow depth of field, crisp surface detail, stable product shape, no hands, no distortion, no onscreen text.

需要提供的素材

  • 无需上传素材,文生视频只需提示词。
  • 选择一个能用材质和机械结构描述的产品,不要只写名称。

为什么有效

  • 时间被拆成 0–4 秒、4–8 秒、8–12 秒和 12–15 秒,让模型获得镜头清单,而不是一串愿望。
  • 每个时间段采用不同运镜:微距跟移、拉远、侧向环绕和向前推进,让片子像经过剪辑,而不是漫无目的地漂移。
  • 结尾的禁止列表覆盖产品渲染最常见的三种问题:手部、变形和屏幕文字。

可替换变量

  • 产品
  • 材质与表面处理
  • 每个时间段的分配
  • 背景与光线
  • 是否使用爆炸分解视图

限制与注意事项

  • 时长是 4–15 的整数,并在请求中设置;提示词里各时间段的总和必须与之一致。
  • 分时指令是引导,不是硬时间轴;15 秒视频建议不超过四个时间段。
  • 该案例由作者以 720p 发布;EvoLink 当前 H3 路由输出 2K。

生成设置

文生视频 · 15s · 16:9 · 无参考素材

MiniMax H3 提示词框架

H3 可以理解按顺序指定的参考素材,并原生生成音频。应围绕实际工作流来写,而不是只用通用公式。

H3 提示词骨架

目标 → 按顺序指定参考素材 → 主体与身份锚点 → 按时间排列的动作节拍 → 摄影机路径 → 音频或对白指令 → 必须保持不变的内容 → 最终状态。按这个顺序检查,就不会漏掉最常被忽略的音频和结尾。

文生视频

所有画面信息都由你定义,因此应把篇幅用在视频能够完成的时间线上。命名主体、排列动作节拍、只给摄影机一条连续路径,再把声音拆成对白、环境音和音乐,不要只写抽象氛围。

首尾帧

首帧和尾帧已经承载外观,文字只需描述两者之间的变化:新增动作、运镜、必须保留的内容以及最终状态。重复描述图片是浪费这条路由的最常见方式。

多模态参考

每个素材只负责一件事,并按数组顺序称呼:图片 1 控制角色,图片 2 控制地点,视频 1 控制运镜,音频 1 控制音色。单次最多 9 张图片、3 段视频和 3 段音频,且文件总数不超过 12 个;音频不能单独使用。

编辑现有视频

不要写成一大段,而是拆成两份列表:“修改”逐行写目标 → 结果,“保留”写出附近必须原样保留的内容。将源视频裁剪到必要片段,作为视频 1 传入参考路由。

音频与对白

逐字引用希望角色说出的台词。只给声音参考一项职责——音色,口音、情绪和节奏需另外写入提示词。对白、环境音和音乐不要抢占同一时段。

常见失败问题

H3 提示词最常见的 7 种失败方式,以及应该如何修改。

视频忽略了一半提示词
可能原因信息过载:太多主体、风格和事件在同一时长中竞争。
修改方法只保留一个主体、一个地点和当前时长可承载的节拍,其余放到第二次生成。
镜头漂移或自相矛盾
可能原因同一镜头同时要求两种冲突运镜,例如环绕加推进,或手持感加固定机位。
修改方法每个镜头只给一条连续摄影机路径;如果需要第二种运镜,将它写成剪辑点后的新镜头。
参考素材控制错了内容
可能原因上传素材后没有声明各自职责,模型只能猜测哪张图负责风格。
修改方法按数组位置称呼每个素材,并只分配一项职责:图片 1 给身份,视频 1 给动作,音频 1 给音色。
故事太赶,无法读懂
可能原因在短时长里塞入了一个完整故事。
修改方法按每 3–4 秒一个节拍计算;10 秒视频适合 2–3 个节拍,不是 7 个。
画面几乎没有动起来
可能原因提示词在描述外观,而不是变化;上传起始图时尤其常见。
修改方法写动词:什么在动、按什么顺序动、镜头最后停在什么状态。
编辑影响了不该改的区域
可能原因没有定义保留区域,未声明属性都可能被模型改动。
修改方法在每项修改旁列出必须保持一致的内容:脸、服装细节、背景和构图。
声音混成一团
可能原因同时要求对白、环境音和音乐,却没有层级。
修改方法指定哪一层声音为主,其余压低,并在台词落点处留出安静空间。

MiniMax H3 提示词常见问题

MiniMax H3 和海螺 3 是同一个模型吗?

是。MiniMax H3 也常被称为 Hailuo 3、Hailuo 3.0 或 Hailuo 03。EvoLink 对外统一使用 MiniMax H3 作为产品名称,并提供文生视频、图生视频和参考生视频三条路由。

不写代码也能使用这些提示词吗?

可以。点击“使用此提示词”后,页面会将英文提示词写入 MiniMax H3 Playground,并选中匹配的工作流。你只需在模型页补充参考素材并在浏览器中生成。

MiniMax H3 可以生成多长的视频?

当前三条路由的 duration 为 4–15 的整数,输出为 2K。本页每张卡片显示的时长来自已发布样片的实际测量。

一条提示词最多可以使用多少参考素材?

参考生视频路由单次最多接收 9 张图片、3 段视频和 3 段音频。至少需要一张图片或一段视频,音频不能是唯一参考类型。每段参考视频和音频需为 2–15 秒。

为什么提示词中会写“图片 1”或“视频 1”?

参考路由按 image_urls、video_urls 和 audio_urls 中的位置识别素材。在提示词中称呼“图片 1”或“视频 1”,是为了给具体素材分配职责。`@image1` 语法不属于当前 API 契约。

这些提示词和视频来自哪里?

每张卡片都标明来源。MiniMax 官方案例在获得授权后发布,卡片中的英文提示词是官方中文原稿的已验证英文版。社区案例会链接到创作者在 X 上的原始帖子。

可以通过 API 使用这些提示词吗?

可以。无论粘贴到 Playground,还是作为 API 的 prompt 字段发送,提示词文本都完全一致。MiniMax H3 API 指南详细介绍了请求结构、异步任务、回调和错误处理。

选择一条提示词,立即生成

本页每条提示词都对应 EvoLink 上可用的 MiniMax H3 路由,可发送到 Playground,也可通过统一 API 构建请求。