El modelo que llenó todos los timelines en agosto
Cada pocos meses, un modelo de vídeo se convierte en el que todo creador está probando. Desde agosto, ese modelo es MiniMax H3 — también conocido por su nombre de linaje, Hailuo 3.0. Los clips dejan claro por qué: sonido que encaja con la acción porque se generó junto con la imagen, personajes que mantienen su diseño a lo largo de una toma multisegmento de 15 segundos, y una salida en 2K que aguanta perfectamente en pantalla completa.
Más allá de los demos, H3 tiene un diseño genuinamente distinto: un modelo omnimodal que trata imágenes, clips de vídeo y audio como una sola conversación, más un lanzamiento de pesos abiertos que lo convirtió en el modelo de vídeo más estudiado de la temporada. Y desde finales de agosto hay dos variantes — el H3 original y H3 Max, un tier casi en tiempo real que cambió por completo lo que se siente iterar.
Esta es la introducción en lenguaje sencillo: qué es H3, qué hace cada tier, qué puedes crear con él y cómo usarlo sin desperdiciar un crédito.
Cómo funciona H3 por dentro
H3 es un modelo de generación de vídeo construido alrededor de una sola idea: todo es una referencia. Mientras que la mayoría de los modelos aceptan un prompt y quizás una imagen, H3 admite un conjunto de trabajo —
- hasta 9 imágenes de referencia para personajes, ropa y estilo
- hasta 3 clips de vídeo de referencia para movimiento y ritmo
- hasta 3 clips de audio para orientar el sonido y el ritmo (cada uno vinculado a un visual)
— y los citas en el prompt por orden, igual que harías al darle instrucciones a un animador con un mood board. El modelo compone un clip de 4 a 15 segundos que sigue el movimiento que referenciaste, mantiene los personajes que fijaste y devuelve audio estéreo nativo a 32 kHz generado junto con la imagen. La ambientación, el foley e incluso el diálogo sincronizado con los labios llegan en el mismo pase, ya sincronizados — no hay ningún paso de doblaje aparte que programar o pagar.
La resolución funciona en dos etapas: el modelo base renderiza a 768p, y una etapa de regeneración alojada eleva el resultado final a 2K (2560×1440). Esa separación importa por una razón práctica: MiniMax publicó los pesos base como código abierto, así que investigadores y desarrolladores pueden construir sobre H3 — pero la etapa de acabado en 2K permanece alojada. El autoalojamiento es real, pero está limitado a 768p.
Alrededor del núcleo de generación, la familia incluye edición de vídeo precisa y continuación de audio-vídeo — extender un clip existente con imagen y sonido juntos — lo que lo hace útil para secuencias, no solo para loops.
H3 Max: el tier rápido que superó a su modelo de origen
El 27 de agosto apareció un segundo tier: H3 Max, entrenado en post sobre los pesos abiertos de H3 por fal en colaboración con MiniMax, y ajustado para adherencia al prompt, estética y rendimiento bruto.
El titular es una velocidad que cambia tu ritmo de trabajo: oficialmente, un clip de 5 segundos en menos de 3 segundos; en el uso cotidiano, un clip de 10 segundos vuelve en aproximadamente el tiempo que tardarías en reproducirlo. El precio ronda los $0,05 por segundo a 480p y $0,08 a 768p, y a los pocos días del lanzamiento el tier sumó la misma generación de referencias mixtas que el modelo base — imágenes, clips y audio, con las primeras referencias de imagen gratuitas en el precio por uso.
La sorpresa es que el tier rápido no es el tier tosco. En los rankings públicos de imagen a vídeo, H3 Max ocupa actualmente el primer puesto — por encima del propio H3 base con el que fue entrenado. Su único límite real es la resolución: la etapa 2K no puede heredarse de los pesos abiertos, así que Max tiene un techo estructural de 768p.
La forma más clara de tener la familia en mente:
| MiniMax H3 | H3 Max | |
|---|---|---|
| Mejor para | Shots finales | Velocidad de iteración |
| Resolución | Hasta 2K alojado | 480p / 768p |
| Referencias | 9 imágenes / 3 clips / 3 audio | Igual, añadido días después del lanzamiento |
| Audio nativo | Sí | Sí |
| Ritmo | Lo encolas, lo revisas | Más parecido a regenerar una imagen |
Para la lógica de flujo de trabajo más detallada sobre cómo repartir borradores y versiones finales entre los dos tiers, consulta la guía de flujo de trabajo de H3 Max.
Lo que los creadores están publicando con él
Los carretes de demo se agrupan alrededor de los trabajos que favorece el diseño de H3:
PVs de anime y openings musicales. El audio nativo generado con la imagen significa cortes sincronizados con el beat sin necesidad de un pase de edición — describe la energía de la pista, referencia un clip de audio y los golpes aterrizan sobre el movimiento. Este es el caso de uso con el que H3 despegó primero entre los creadores de anime.
Piezas de personaje con múltiples shots. Una sola generación de 15 segundos puede cortar entre localizaciones mientras la cara, el outfit y las proporciones de un personaje se mantienen — el problema difícil de la narrativa animada, resuelto dentro de una sola petición cuando las referencias son buenas.
Clips de diálogo. Voz sincronizada con los labios, con tono de sala y ambientación en un solo pase, en varios idiomas. Momentos cortos de personaje que antes necesitaban tres herramientas ahora necesitan un solo prompt.
Secuencias con estilo fijo. Dale un lenguaje visual — una paleta, un tipo de línea, una textura de época — y lo mantiene a lo largo de cada corte del clip, que es por qué el trabajo estilizado y retro aparece tan frecuentemente en los showcases de H3.
Cómo usar H3 sin desperdiciar un crédito
H3 está disponible como modelo de generación en ArcLoop — la página del modelo cubre los modos y ajustes — y la diferencia entre resultados de carrete de demo y resultados frustrantes casi siempre viene de la disciplina con las referencias, no de la redacción del prompt.
Tres hábitos cargan con la mayor parte del peso:
Aliméntalo con referencias estables. Los nueve slots de imagen son una invitación a la consistencia, y una trampa si las nueve imágenes no se ponen de acuerdo sobre quién es tu personaje. Mantén el personaje como un character asset con sus referencias canónicas vinculadas, y tira de esa única fuente para cada generación. Referenciar el asset con @ en las descripciones de shots es más fiable que redescribir el personaje cada vez — y significa que tu décimo clip de H3 usa la misma identidad que el primero.
Una acción clara por clip. Los 15 segundos de H3 recompensan un Shot Brief con un principio, un momento clave y un final — no cinco ideas peleando por los mismos fotogramas. Escribe el movimiento de cámara, la acción y el sonido que quieres, en orden.
Genera desde un Storyboard, no desde un cuadro de prompt. En ArcLoop, abre tu Episode y pulsa Generate Shots para dividirlo en shot cards, luego vincula tus assets y ejecuta generaciones por tarjeta — o lánzalas en lote desde el AI Chat Panel con una instrucción directa como "Generate videos for Shots 1, 2, and 3." Cada clip de H3 queda vinculado al shot al que pertenece, así que comparar tomas y reconstruir el montaje se mantiene organizado en lugar de dispersarse entre descargas.
Itera barato, termina una vez. Explora el timing y el blocking en el tier Max o con ajustes más bajos, y gasta el pase 2K en los shots que ya se han ganado su lugar en el montaje — la misma lógica de control de costes que aplica a cualquier familia de modelos por tiers. Si estás comparando H3 con el otro motor de acabado de su categoría, la comparativa H3 vs Seedance 2.0 analiza esa decisión en detalle.
Preguntas frecuentes
¿MiniMax H3 es lo mismo que Hailuo 3.0?
Sí — H3 es el nombre internacional de la línea de modelos que antes se conocía como Hailuo. Algunos rankings también listan el tier Max bajo un nombre interno, MiniMax H3 Turbo.
¿MiniMax H3 es gratis?
Los pesos del modelo base son abiertos, y el acceso alojado es de pago por uso. El tier Max ofrece actualmente un número reducido de generaciones diarias gratuitas en la página de herramienta de su host. Para trabajo en proyectos dentro de ArcLoop, H3 funciona con tus créditos de ArcLoop, con ajustes que dependen del modo de generación.
¿Cuál es la diferencia entre H3 y H3 Max?
Max es un tier de velocidad entrenado en post: generación casi en tiempo real hasta 768p, actualmente en primer lugar en los rankings de imagen a vídeo, con los mismos modos de referencia y audio nativo. El H3 base conserva la etapa de salida alojada en 2K. La división que adoptan la mayoría de los flujos de trabajo es: borradores en Max, versión final en H3.
¿H3 genera realmente el audio junto con el vídeo?
Sí — el audio se predice junto con la imagen en lugar de añadirse después, que es por qué los efectos de sonido aterrizan en los impactos y el diálogo se sincroniza sin un pase de edición. Puedes describir el paisaje sonoro en el mismo prompt que el shot.
¿Cuánto puede durar un vídeo de H3?
De 4 a 15 segundos por generación, con continuación de audio-vídeo disponible para extender un clip existente. Las piezas más largas se construyen shot a shot — y ahí es donde trabajar desde un Storyboard con character assets persistentes supera a generar clips uno a uno desde un prompt.
El modelo es nuevo; la disciplina no lo es
H3 se ganó su momento: referencias mixtas, audio nativo, pesos abiertos y ahora un tier Max lo suficientemente rápido como para pensar con él. Pero cada capacidad de esa lista rinde en proporción a lo estables que sean tus inputs — y esa parte es flujo de trabajo, no modelo. Crea tus personajes como assets, plantea los shots como un director, itera en el tier barato y gasta el 2K donde el público realmente vaya a mirar. Abre un proyecto, fija tu primer personaje y dale a H3 algo que valga la pena reconocer.





