MiniMax H3 (Hailuo 3) ya está en EvoLinkPruébalo con 10 créditos gratis

Prompts de MiniMax H3 y ejemplos de vídeo

Explora 12 prompts verificados con resultados reales de MiniMax H3, requisitos de entrada y variables reutilizables. Copia una plantilla o envíala al Playground de EvoLink.

MiniMax H3 también se conoce como Hailuo 3, Hailuo 3.0 o Hailuo 03.

Modo de generación

Caso de uso

12 de 12 prompts

Tráiler de ciencia ficción generado con MiniMax H3: una figura solitaria ante un enorme portal cósmico circular mientras un título emerge de la oscuridadREFERENCIA MULTIMODAL
15s16:92 recursos de referencia

Cine y VFX

Tráiler de misterio y ciencia ficción

Tráiler con dos referencias: una imagen fija la atmósfera, otra al protagonista, y el prompt controla avance de cámara, título y sonido.

Ver detalles

Prompt completo (original inglés verificado)

Realistic cinematic look, high-contrast lighting, and a tight pace. Use Figure 1 as the overall atmosphere and style reference, and Figure 2 as the protagonist reference. Shot 1 — Ultra-wide establishing shot. A huge circular cosmic gateway nearly fills the frame. The person is only a tiny figure seen from behind before the gateway, positioned toward the lower right. The ground is wet and reflective, and the center of the gateway is pitch black. The camera slowly pushes forward. A large title fades in from the edge of the darkness, blurred at first and then sharp: "THE STARS WERE LISTENING". Use an extremely condensed, heavy, all-caps typeface in dark red mixed with rust red, with subtle grain and misted edges. Audio: a deep low-frequency pulse, faint metallic vibrations in the distance, and a soft hit as the text becomes sharp. → Hard cut.

Qué debes aportar

  • Imagen 1: la lámina de atmósfera y estilo — entorno, paleta y etalonaje que debe heredar el plano.
  • Imagen 2: el protagonista, con un encuadre lo bastante amplio para que rostro y silueta sigan siendo legibles cuando la figura ocupe poco espacio.
  • Un texto de título que de verdad quieras incrustar: H3 renderiza exactamente lo que escribas, así que sé breve y comprueba la ortografía.

Por qué funciona

  • Cada referencia tiene una sola función — la Imagen 1 la atmósfera, la Imagen 2 el personaje — y así el modelo nunca tiene que adivinar cuál define el look.
  • El plano se describe como un único avance continuo con un solo acontecimiento (el título que se vuelve nítido): justo lo que caben en 15 segundos.
  • El sonido se escribe en tres capas concretas (pulso grave, vibraciones metálicas lejanas y un golpe sobre el título) en lugar de una vaga «música de cine».

Variables sustituibles

  • texto del título y tratamiento tipográfico
  • portal o punto de referencia del plano general
  • color del título
  • colchón sonoro
  • comportamiento del corte final

Restricciones

  • Refiérete a los recursos por su posición en el array — «Figure 1», «Figure 2» — siguiendo el orden de image_urls. La sintaxis @image1 no forma parte de este contrato de API.
  • El prompt publicado es deliberadamente un punto de partida: termina en un corte seco para que puedas encadenar tu propio segundo plano.

Ajustes

Referencia multimodal · 15s · 16:9 · 2 recursos de referencia

Clip de texto a vídeo generado con MiniMax H3: una cocina al anochecer filmada a mano mientras una criatura luminosa dibujada a mano se mueve entre los objetosTEXTO A VÍDEO
15s16:9Sin recursos de referencia

Cine y VFX

Criatura luminosa en la cocina

Plantilla de texto a vídeo que mezcla imagen real y animación dibujada, con defectos de cámara y exclusiones precisas.

Ver detalles

Prompt completo (original inglés verificado)

15-second, 16:9 landscape video. Blend live-action footage of a small kitchen at dusk with hand-drawn glowing animation. The last light of sunset lingers by the window. The lived-in kitchen contains an old wooden table, a half-washed mug, a slightly fogged glass bottle, and a hanging dishcloth. Give the footage subtle one-handed smartphone shake, hesitant close-range focusing, exposure fluctuations caused by backlight, and slightly coarse noise in the shadows. It should not look carefully arranged like an advertisement; instead, it should feel like someone hurriedly captured an unbelievable event at home. Do not show huge eyes, gaping mouths, fangs, threatening or lunging movements, sudden black frames, or jump scares. Use only kitchen room tone, cloth rubbing, the soft clink of a mug, water dripping from the faucet, the camera operator's footsteps and quiet breathing, plus gentle electronic sounds and tiny calls from the hand-drawn creature.

Qué debes aportar

  • Nada que subir: esta ruta funciona solo con el prompt.
  • La duración y la relación de aspecto se fijan en los parámetros de la petición, no solo en el texto del prompt.

Por qué funciona

  • Los defectos de la cámara están nombrados — temblor a una mano, enfoque dubitativo, oscilaciones de exposición a contraluz, ruido grueso en las sombras. Eso es lo que vende «alguien lo grabó deprisa en casa» y no «esto es un anuncio».
  • Una lista de prohibiciones corta y explícita (nada de ojos enormes, colmillos, embestidas ni sustos) evita que una criatura simpática derive hacia el terror.
  • La dirección de sonido nombra cada fuente por separado: tono de sala, tela, taza, grifo, pasos, respiración y los sonidos de la criatura.

Variables sustituibles

  • estancia y momento del día
  • diseño y comportamiento de la criatura
  • objetos sobre la mesa
  • qué imperfecciones muestra la cámara
  • capas de sonido

Restricciones

  • El prompt declara su duración y encuadre en el texto; la API sigue necesitando duration y aspect_ratio como campos de la petición.
  • Las instrucciones negativas funcionan mejor como lista corta y explícita. Acumular decenas de prohibiciones consume el presupuesto que necesitas para la acción.

Ajustes

Texto a vídeo · 15s · 16:9 · Sin recursos de referencia

Tráiler vertical de minidrama generado con MiniMax H3: un vampiro y una heroína humana en el interior de un castillo iluminado con velasREFERENCIA MULTIMODAL
15s9:162 recursos de referencia

Minidrama y narrativa

Minidrama romántico de vampiros

Gancho vertical: una imagen fija a los protagonistas, otra el lugar, y el prompt se centra en relación, ritmo y tamaños de plano.

Ver detalles

Prompt completo (original inglés verificado)

Generate a 15-second, 9:16 vertical trailer segment for an international live-action vampire romance short drama. Use Figure 1 as the appearance reference for the male and female leads, and Figure 2 as the scene reference. Keep both leads' identities consistent, with a realistic live-action look and premium short-drama production quality. Story: an innocent human heroine accidentally enters a forbidden area of an old castle and awakens a sleeping aristocratic vampire. He discovers that she carries an aura connected to an ancient war, which sparks a powerful urge to control her and a dangerous fascination with her. She fears him but does not completely submit, resisting his pressure. Overall style: an international ReelShort / DramaBox vampire-romance trailer. Dark romance, dangerous attraction, fate, intense control, brooding oppression, and a striking reversal. Keep the visuals premium, restrained, and tightly paced, like the opening 15-second hook of a hit short drama. No gore, cheap horror, Halloween aesthetic, or modern street feel. Format: 9:16 vertical composition for TikTok / ReelShort / DramaBox. Use primarily medium close-ups, close-ups, and extreme close-ups, emphasizing faces, eye contact, pressure, and relationship tension within the vertical frame.

Qué debes aportar

  • Imagen 1: los dos protagonistas juntos, para que el modelo los lea como un único reparto coherente.
  • Imagen 2: la localización — el interior del castillo, su luz y sus materiales.
  • Una premisa en una frase y un giro emocional explícito; un gancho de 15 segundos aguanta un giro, no un episodio entero.

Por qué funciona

  • Nombrar la referencia de género (tráiler tipo ReelShort / DramaBox) transmite ritmo, etalonaje y convenciones de encuadre en pocas palabras.
  • El vocabulario de planos está fijado — plano medio, primer plano, primerísimo primer plano — y eso es lo que hace que un formato vertical se lea premium en vez de agobiado.
  • La lista de exclusiones (sin gore, sin terror barato, sin estética de Halloween, sin aire de calle contemporánea) elimina las cuatro degradaciones habituales del género.

Variables sustituibles

  • referencias de aspecto de los protagonistas
  • localización
  • premisa y giro
  • estética de la plataforma objetivo
  • mezcla de tamaños de plano

Restricciones

  • El formato vertical se pide con aspect_ratio en la ruta de referencia, no escribiendo «9:16» en el prompt.
  • La identidad se mantiene mucho mejor cuando ambos protagonistas llegan en una sola imagen que en dos retratos recortados por separado.

Ajustes

Referencia multimodal · 15s · 9:16 · 2 recursos de referencia

Anuncio vertical de gafas generado con MiniMax H3: dos modelos en un estudio blanco sin costuras con gafas envolventes futuristasREFERENCIA MULTIMODAL
15s9:163 recursos de referencia

Marca y anuncios de producto

Campaña de gafas futuristas

Anuncio de moda con tres imágenes que controlan por separado el visual principal, los rostros y el producto.

Ver detalles

Prompt completo (original inglés verificado)

Generate a vertical screen 9:16 high-end fashion glasses commercial, taking overall reference to the storyboard rhythm, editing speed, white studio texture and cool fashion atmosphere of the given video. The picture is a minimalist white booth, a seamless white background, a strong sense of high-end advertising, and a clean, simple, handsome, avant-garde, international first-line fashion blockbuster texture. Key visual character reference picture 1, two full-body female models, one black female model and one European and American model, maintain their high-end clothing, body posture, white studio light and shadow, fashion show temperament and overall cool attitude. Both of them wear futuristic high-end glasses. The design of the glasses refers to Figure 3, emphasizing the covered curved surface, sharp geometric cat-eye/goggle hybrid outline, mirror reflection, streamlined temples, and the texture of high-end fashion accessories. Please refer to Figure 2 for the appearance details of the two characters.

Qué debes aportar

  • Imagen 1: el visual clave — modelos de cuerpo entero, vestuario, luz de estudio y actitud.
  • Imagen 2: el detalle de los rostros, para que los dos personajes se mantengan iguales entre cortes.
  • Imagen 3: el producto, fotografiado con nitidez suficiente para que su silueta y sus materiales sobrevivan a un montaje rápido.
  • Un fondo de estudio sin costuras que estés dispuesto a mantener durante todo el clip.

Por qué funciona

  • Tres referencias con tres funciones explícitas es justo el patrón para el que está hecha la ruta de referencia; la ambigüedad es lo que hunde los prompts multiimagen.
  • El producto se describe por su geometría — curvatura envolvente, contorno híbrido cat-eye/gafa de protección, superficie espejada, patillas aerodinámicas — y no solo por su nombre.
  • Un estudio blanco de un solo material elimina varianza del fondo, para que el presupuesto se vaya al producto y a las modelos.

Variables sustituibles

  • categoría de producto
  • casting de modelos
  • color del estudio
  • velocidad de montaje
  • vestuario

Restricciones

  • El prompt publicado pide además el ritmo de un vídeo dado. El material publicado para este caso son tres imágenes: trata esa línea como indicación de estilo o adjunta tu propio clip como Video 1.
  • Hasta 9 imágenes, 3 vídeos y 3 clips de audio por petición de referencia, con un máximo de 12 archivos en total; el audio nunca puede ser el único tipo de referencia.

Ajustes

Referencia multimodal · 15s · 9:16 · 3 recursos de referencia

Animación con plastilina generada con MiniMax H3: un zorro de arcilla salta un cañón de lava mientras la cámara pasa por debajoPRIMER / ÚLTIMO FOTOGRAMA
10s16:91 recurso de referencia

Personaje y movimiento

Zorro de plastilina salta un cañón

Una imagen inicial se anima en una sola acción, con la trayectoria de cámara descrita con la misma precisión que el salto.

Ver detalles

Prompt completo (original inglés verificado)

Claymation style. A sprinting fox reaches the edge of a cliff and launches without hesitation, making a dramatically tense, heroic slow-motion leap across a vast lava canyon. While the fox is airborne, the camera rushes at high speed beneath its belly in a sweeping dynamic move, fully revealing the terrifying depth of the chasm and the fox's clay body at maximum extension in midair.

Qué debes aportar

  • Una imagen inicial que ya lleve el estilo — aquí, el zorro de plastilina y su material.
  • Una acción que quieras que ocurra. No tres.

Por qué funciona

  • El prompt describe el cambio, no la imagen. El fotograma inicial ya contiene la apariencia, así que cada palabra compra movimiento.
  • La cámara recibe su propia instrucción — un barrido a gran velocidad por debajo del vientre del zorro — y eso convierte un salto en un plano.
  • Nombrar el instante culminante («máxima extensión en el aire») le da al modelo una pose objetivo sobre la que construir el tempo.

Variables sustituibles

  • personaje y estilo de material
  • entorno y peligro
  • trayectoria de cámara
  • énfasis de la cámara lenta

Restricciones

  • La ruta imagen a vídeo deduce la relación de aspecto de la imagen de entrada y rechaza aspect_ratio.
  • No vuelvas a describir lo que la imagen inicial ya muestra; repetir la apariencia estática es la forma más común de desperdiciar un prompt de imagen a vídeo.

Ajustes

Primer / último fotograma · 10s · 16:9 · 1 recurso de referencia

Edición de vídeo generada con MiniMax H3: en un clip fuente se han sustituido o eliminado el periódico, la silla, las gafas de sol y el coche en llamasREFERENCIA MULTIMODAL
10s16:91 recurso de referencia

Edición y transformación

Edición de escena con varios elementos

Seis cambios independientes sobre un vídeo fuente, escritos como lista objetivo → resultado sin volver a describir la escena.

Ver detalles

Prompt completo (original inglés verificado)

Replace the newspaper in the reference video with a green-covered book; change the chair the character is sitting on to a red sofa; remove the sunglasses worn by the character to retain a clear face; remove the car burning effect to keep the vehicle in a normal state; change the photo the character takes out of his arms to a small black book; and add a tree on the left side of the screen

Qué debes aportar

  • Video 1: el clip a editar, de 2 a 15 segundos, MP4 o MOV, H.264 o H.265, hasta 50 MB.
  • Una lista de ediciones, cada una indicando qué cambiar y en qué se convierte.

Por qué funciona

  • Cada instrucción es un par — objetivo más resultado — y no deja nada a la interpretación («el periódico» pasa a ser «un libro de tapa verde»).
  • Las eliminaciones declaran el estado final buscado («quitar las gafas de sol para dejar la cara despejada»), lo que evita que quede un hueco donde estaba el objeto.
  • No hay ninguna descripción de escena, así que el modelo trata el clip fuente como verdad y solo aplica las diferencias.

Variables sustituibles

  • número de ediciones
  • objetos sustituidos
  • efectos eliminados
  • elementos añadidos

Restricciones

  • EvoLink expone tres rutas H3; el trabajo de edición pasa por reference-to-video con el clip fuente como Video 1.
  • La duración del vídeo de referencia se factura, así que recorta la fuente al fragmento que realmente necesitas antes de subirla.
  • Indica qué debe permanecer intacto cuando una edición esté junto a algo que te importa: las zonas no mencionadas quedan a merced del modelo.

Ajustes

Referencia multimodal · 10s · 16:9 · 1 recurso de referencia

Transición de interfaz de novela visual generada con MiniMax H3 entre un fotograma de apertura y uno de cierre fijadosPRIMER / ÚLTIMO FOTOGRAMA
15s16:92 recursos de referencia

Minidrama y narrativa

Transición de novela visual otome

El primer y el último fotograma fijan ambos extremos; el texto solo describe el recorrido y el cambio emocional.

Ver detalles

Prompt completo (original inglés verificado)

Use the first image as the opening frame and the second image as the exact final frame to generate an otome visual-novel interface transition. Overall feel: a premium Chinese otome romance-interaction interface capturing an intimate moment before and after a performance. Transition naturally from "choose to watch his performance" to "Han Xu is drawn in by the heroine's words and reacts with intrigued interest." UI text, choices, and dialogue boxes should appear with refined otome-game presentation. Keep the transition silky smooth and the emotion suggestive yet restrained.

Qué debes aportar

  • Imagen 1: el fotograma de apertura, con el estado de su interfaz.
  • Imagen 2: exactamente el fotograma de cierre en el que quieres aterrizar.
  • Una frase que describa el cambio emocional entre ambos estados.

Por qué funciona

  • Ambos extremos están fijados, así que el modelo resuelve una interpolación en lugar de una composición: la vía más fiable hacia un plano predecible.
  • El prompt nombra la transición emocional («elegir ver su actuación» → «atraída e intrigada») en vez de enumerar fotogramas, de modo que la interpretación sostiene el corte.
  • Pedir que los elementos de interfaz se animen en el lenguaje propio del género evita que la UI se redibuje.

Variables sustituibles

  • fotogramas de apertura y cierre
  • arco emocional entre ambos
  • estilo de presentación de la interfaz
  • velocidad de la transición

Restricciones

  • Envía ambos fotogramas como image_start e image_end en la ruta imagen a vídeo; la ruta de referencia no acepta estos campos.
  • Cuanto más se parezcan los dos fotogramas en encuadre e iluminación, más suave será la interpolación. Dos composiciones sin relación producen un corte, no una transición.

Ajustes

Primer / último fotograma · 15s · 16:9 · 2 recursos de referencia

Transferencia de movimiento generada con MiniMax H3: dos personajes referenciados ejecutan una coreografía de street dance copiada de un vídeo de referenciaREFERENCIA MULTIMODAL
10s16:93 recursos de referencia

Personaje y movimiento

Transferencia de movimiento de street dance

Una instrucción breve transfiere la coreografía de un vídeo a dos personajes definidos con imágenes.

Ver detalles

Prompt completo (original inglés verificado)

Have the characters perform street dance following the movements in Video 1. Use Figure 1 and Figure 2 as the character references.

Qué debes aportar

  • Imagen 1 e Imagen 2: los dos personajes, con una referencia de cuerpo entero limpia para cada uno.
  • Video 1: el movimiento a copiar, de 2 a 15 segundos, con el intérprete completamente en cuadro.

Por qué funciona

  • El prompt es corto porque la información la llevan las referencias: el vídeo posee el movimiento y las imágenes poseen las identidades.
  • Cada recurso se nombra por su posición en el array, así que no hay ambigüedad sobre qué referencia aporta qué.
  • No se pide nada más. Ni luz, ni cámara, ni estilo: cualquier instrucción extra competiría con el movimiento que se intenta copiar.

Variables sustituibles

  • personajes
  • coreografía de origen
  • entorno
  • número de intérpretes

Restricciones

  • La duración total de los vídeos de referencia debe mantenerse por debajo de 15 segundos, y cada clip entre 2 y 15 segundos a 23,976–60 FPS.
  • Los vídeos de referencia deben ser MP4 o MOV con H.264 o H.265, hasta 50 MB cada uno, y el cuerpo JSON completo por debajo de 64 MB.

Ajustes

Referencia multimodal · 10s · 16:9 · 3 recursos de referencia

Sustitución de diálogo generada con MiniMax H3: la frase de un personaje se ha reemplazado por otra procedente de un clip de audio de referenciaREFERENCIA MULTIMODAL
10s16:92 recursos de referencia

Audio nativo y diálogo

Sustitución de diálogo e interpretación

Sustituye una frase citando literalmente la original y la nueva, y limita cuánto puede cambiar la actuación.

Ver detalles

Prompt completo (original inglés verificado)

Replace the girl's line in Video 1, "We can't be together. It's not that we don't love each other; we truly can't make it to the end," with the line from Audio 1: "Don't go, okay? This time, let's not let go of each other." Slightly adjust the corresponding performance.

Qué debes aportar

  • Video 1: el clip que contiene la frase a sustituir.
  • Audio 1: la frase nueva, WAV o MP3, hasta 15 MB y 15 segundos.
  • Ambas frases escritas literalmente en el prompt.

Por qué funciona

  • Citar la frase saliente le dice al modelo exactamente qué tramo del clip debe intervenir, en lugar de «el diálogo que hay hacia la mitad».
  • Citar la frase entrante le da un objetivo a la sincronía labial en vez de deducirla solo del audio.
  • «Ajustar ligeramente la interpretación» concede un permiso acotado para cambiar la actuación: acotado, para que el resto de la toma sobreviva.

Variables sustituibles

  • clip de origen
  • frase sustituida
  • frase nueva y voz
  • cuánto puede cambiar la interpretación

Restricciones

  • El audio nunca puede ser el único tipo de referencia; debe llegar acompañado de una imagen o un vídeo.
  • El audio y el vídeo de referencia tienen un tope de 15 segundos de duración total por petición.
  • Di qué se mantiene fijo. El encuadre, el vestuario y el fondo se desvían si el prompt solo habla de la frase.

Ajustes

Referencia multimodal · 10s · 16:9 · 2 recursos de referencia

Clip de referencia de voz generado con MiniMax H3: un personaje pronuncia una frase escrita con el timbre tomado de un clip de audio de referenciaREFERENCIA MULTIMODAL
10s16:92 recursos de referencia

Audio nativo y diálogo

Referencia de voz «Sigue el viento»

El prompt mínimo con referencia de audio: la frase exacta y un clip que define el timbre.

Ver detalles

Prompt completo (original inglés verificado)

Character dialogue: "Follow the wind, live free. Leave worries behind, enjoy the moment." Use Audio 1 as the voice-timbre reference.

Qué debes aportar

  • Video 1: el personaje que pronunciará la frase.
  • Audio 1: una muestra limpia de la voz objetivo, de 2 a 15 segundos, idealmente sin música de fondo.
  • La frase exacta, escrita por completo.

Por qué funciona

  • El diálogo se cita en lugar de parafrasearse, así el tempo y la sincronía labial tienen algo concreto a lo que agarrarse.
  • A Audio 1 se le asigna una única función acotada — el timbre — en vez de entregarlo como «banda sonora» genérica.
  • No se especifica nada más, así que el clip de referencia conserva el control total del encuadre y la interpretación.

Variables sustituibles

  • frase de diálogo
  • referencia de voz
  • clip del personaje
  • velocidad de habla

Restricciones

  • Una referencia de voz transfiere timbre, no acento, emoción ni ritmo; escríbelos en el prompt si importan.
  • La música o varios hablantes solapados en el audio de referencia degradan el resultado: aporta una voz aislada.

Ajustes

Referencia multimodal · 10s · 16:9 · 2 recursos de referencia

Plano de escenario generado con MiniMax H3: dos magos intercambian el color de sus trajes entre una nube de humo mientras el telón pasa de rojo a azulPRIMER / ÚLTIMO FOTOGRAMA
7s16:91 recurso de referencia

Edición y transformación

Intercambio de vestuario entre magos

Prueba de seguimiento: dos trajes cambian, un detalle permanece intacto y el fondo completa una transición de color.

Ver detalles

Prompt completo (original inglés verificado)

Two magicians stand onstage facing the audience and perform a "swap" trick. They wave their wands at the same time, and a cloud of smoke rises. When it clears, their suit colors have switched: the person on the left wears a white suit, and the person on the right now wears a black suit, while both magicians' glove colors remain unchanged. They bow to thank the audience. The red curtain behind them closes, transitioning from deep red to deep blue.

Qué debes aportar

  • Una imagen inicial con ambos artistas, su vestuario y el escenario.
  • Un estado antes/después claro para todo lo que se intercambie.

Por qué funciona

  • El intercambio queda tapado por un suceso — la nube de humo — lo que da al modelo un momento legítimo para hacer el cambio en vez de transformarlo a la vista.
  • Lo que no debe cambiar (el color de los guantes) está escrito justo al lado de lo que sí cambia: así es como se evita que una edición se extienda.
  • El plano termina en un estado definido: la reverencia, el telón que se cierra, el color que aterriza en azul profundo.

Variables sustituibles

  • artistas y vestuario
  • el detalle que permanece fijo
  • suceso que tapa el intercambio
  • transición de color final

Restricciones

  • La ruta imagen a vídeo deduce la relación de aspecto de la imagen de entrada y rechaza el campo aspect_ratio.
  • Cualquier atributo no mencionado queda a merced del modelo. Si un detalle debe sobrevivir al cambio, escríbelo.

Ajustes

Primer / último fotograma · 7s · 16:9 · 1 recurso de referencia

Vídeo de producto generado con MiniMax H3: unos auriculares de diadema premium giran sobre un pedestal reflectante en un estudio negroTEXTO A VÍDEO
15s16:9Sin recursos de referencia

Marca y anuncios de producto

Presentación de auriculares de lujo

Vídeo de producto de 15 segundos dividido en cuatro bloques, cada uno con movimiento de cámara y función propios.

Ver detalles

Prompt completo (original inglés verificado)

Create a 15-second luxury cinematic product showcase for premium wireless over-ear headphones. 0–4s: Begin with an extreme macro tracking shot moving across the soft memory-foam ear cushion, fine fabric texture, brushed-metal hinge and precision-machined controls. A narrow light band travels across the surface, revealing realistic materials against a deep black studio background. 4–8s: Pull back into a three-quarter hero view. The headphones rotate slowly above a glossy reflective pedestal. The ear cups pivot naturally while the adjustable headband extends slightly, demonstrating flexible construction and comfort. Maintain exact symmetry, stable geometry and consistent proportions. 8–12s: Transition into an elegant exploded-view reveal. The ear cushion, acoustic driver, internal sound chamber, control ring and outer shell separate smoothly in perfect alignment. Subtle luminous sound waves pulse outward from the driver while the camera performs a restrained side orbit. 12–15s: Every component reconnects seamlessly. The headphones settle into a centered front-facing hero composition as soft rim lighting defines the silhouette. Complete a gentle dolly-in toward the ear cups. Premium technology-commercial finish, controlled reflections, realistic shadows, shallow depth of field, crisp surface detail, stable product shape, no hands, no distortion, no onscreen text.

Qué debes aportar

  • Nada que subir: el texto a vídeo funciona solo con el prompt.
  • Un producto que sepas describir por sus materiales y su mecánica, no solo por su nombre.

Por qué funciona

  • El tiempo se reparte en 0–4 s, 4–8 s, 8–12 s y 12–15 s, así el modelo recibe un plan de planos en lugar de una lista de deseos.
  • Cada bloque mueve la cámara de forma distinta — travelling macro, retroceso, órbita lateral, avance — y eso es lo que hace que el clip se lea montado y no a la deriva.
  • La línea final es una lista de prohibiciones (sin manos, sin deformaciones, sin texto en pantalla) que cubre los tres fallos habituales de los renders de producto.

Variables sustituibles

  • producto
  • materiales y acabado
  • duración de cada bloque
  • fondo e iluminación
  • si aparece la vista despiezada

Restricciones

  • La duración es un entero de 4 a 15 segundos y se fija en la petición; los bloques del prompt deben sumar esa cifra.
  • Los bloques cronometrados son dirección, no una línea de tiempo estricta. No más de cuatro para un clip de 15 segundos.
  • Su autor publicó este clip en 720p; las rutas H3 de EvoLink entregan 2K.

Ajustes

Texto a vídeo · 15s · 16:9 · Sin recursos de referencia

El marco de prompts de MiniMax H3

H3 entiende referencias ordenadas y genera su propio audio. Escribe para el flujo concreto en lugar de depender solo de una fórmula genérica.

La estructura de un prompt de H3

Objetivo → referencias ordenadas → identidad del sujeto → acciones cronológicas → recorrido de cámara → audio o diálogo → elementos que no cambian → estado final. Así no se olvidan el sonido ni el cierre.

Texto a vídeo

Describe una secuencia que el clip pueda completar: sujeto, pocas acciones, un recorrido continuo de cámara y capas separadas de diálogo, ambiente y música.

Primer / último fotograma

Las imágenes ya definen el aspecto. Describe solo el cambio entre ellas, el movimiento de cámara, lo que debe conservarse y el estado final.

Referencias multimodales

Asigna una sola función a cada recurso y cita su posición: Image 1 para el personaje, Image 2 para el lugar, Video 1 para el movimiento y Audio 1 para la voz.

Editar un clip existente

Escribe dos listas: «Cambiar» con objetivo → resultado y «Conservar» para todo lo que debe quedar igual. Envía solo el fragmento necesario como Video 1.

Audio y diálogo

Cita literalmente las frases. Usa la referencia de voz solo para el timbre y define por separado el acento, la emoción y el ritmo.

Diagnóstico de fallos

Siete formas habituales de que falle un prompt de H3 y cómo corregirlas.

El vídeo ignora parte del prompt
Causa probableDemasiados sujetos, estilos y eventos compiten en la misma duración.
SoluciónReduce a un sujeto, un lugar y solo las acciones que caben en el tiempo disponible.
La cámara deriva o se contradice
Causa probableSe piden dos movimientos incompatibles en un mismo plano.
SoluciónUsa un solo recorrido continuo; si necesitas otro movimiento, descríbelo como un corte.
Una referencia controla el elemento equivocado
Causa probableLos recursos se adjuntan sin indicar su función.
SoluciónCita cada recurso por su posición y asígnale una sola función.
La historia va demasiado deprisa
Causa probableSe intenta encajar una narración completa en pocos segundos.
SoluciónCalcula una acción cada tres o cuatro segundos; diez segundos admiten dos o tres acciones.
Apenas hay movimiento
Causa probableEl prompt describe la apariencia en vez del cambio.
SoluciónUsa verbos: qué se mueve, en qué orden y en qué estado termina el plano.
La edición afecta a otras zonas
Causa probableNo se indican regiones o propiedades que deban conservarse.
SoluciónEnumera rostro, vestuario, fondo y encuadre cuando deban mantenerse idénticos.
El audio resulta confuso
Causa probableDiálogo, ambiente y música no tienen una jerarquía.
SoluciónIndica la capa principal, baja las demás y deja espacio para que se entienda el diálogo.

Preguntas frecuentes sobre prompts de MiniMax H3

¿MiniMax H3 y Hailuo 3 son el mismo modelo?

Sí. MiniMax H3 también se conoce como Hailuo 3, Hailuo 3.0 o Hailuo 03. EvoLink usa MiniMax H3 y ofrece rutas de texto a vídeo, imagen a vídeo y referencia a vídeo.

¿Puedo usar estos prompts sin programar?

Sí. «Usar este prompt» envía el prompt original verificado en inglés al Playground de MiniMax H3 y selecciona el flujo adecuado. Allí puedes añadir las referencias.

¿Cuánto puede durar un vídeo de MiniMax H3?

Las tres rutas aceptan duraciones enteras de 4 a 15 segundos y actualmente generan en 2K. La duración de cada tarjeta corresponde al ejemplo publicado.

¿Cuántas referencias puede usar un prompt?

La ruta de referencia admite hasta 9 imágenes, 3 vídeos y 3 audios, con un tope de 12 archivos en total: un conjunto completo de 9 + 3 + 3 se rechaza. Se requiere al menos una imagen o un vídeo; el audio no puede usarse solo. Cada vídeo o audio debe durar entre 2 y 15 segundos.

¿Por qué los prompts dicen «Image 1» o «Video 1»?

La API resuelve los recursos por su posición en image_urls, video_urls y audio_urls. Esas referencias en inglés se conservan en el prompt verificado para asignar una función concreta.

¿De dónde proceden los prompts y los clips?

Cada tarjeta indica su fuente. Los ejemplos oficiales usan una versión inglesa verificada del prompt chino; los ejemplos de la comunidad enlazan la publicación original en X.

¿Puedo usar estos prompts mediante la API?

Sí. El mismo prompt en inglés funciona en el Playground y en el campo prompt de la API. La guía de MiniMax H3 explica solicitudes, tareas asíncronas, callbacks y errores.

Elige un prompt y genera

Cada prompt se asigna a una ruta activa de MiniMax H3 en EvoLink. Envíalo al Playground o crea la misma solicitud con la API unificada.