MiniMax H3
Vídeo que llega con su propio sonido
MiniMax H3 genera imagen 2K y una pista estéreo sincronizada en un solo proceso: efectos, tono de sala y diálogos, todo junto. Ya en Popcraft.
Cine hecho con H3
Diálogos, títulos, un tráiler, cine de marca y producto, moda, interfaces, diseño de pósters, efectos, macro y fotogramas anamórficos reales. Se reproducen al hacer scroll; pulsa el altavoz para escuchar.
Alguien hablando de verdad
Una creadora en una terraza, hablando a cámara. Las palabras, la sincronía labial y la calle de fondo surgieron de la misma generación; esta es la capacidad sobre la que se construye el resto del modelo.
Campaña de gafas
Grabado nativo en 9:16 para redes sociales. Lentes de espejo, siluetas esculpidas y un barrido de estudio impecable: la identidad se mantiene en cada corte.
MIDNIGHT LINE
Una secuencia de títulos de crimen: pantallas divididas, bloques de color sólidos y tarjetas de reparto al ritmo de la batería, sobre su propia partitura de jazz de suspense.
Un menú de juego que funciona
Selección de personajes, personalización de armamento, estados de botones legibles. Renderizar interfaces legibles es donde fallan la mayoría de los modelos de vídeo, por eso precisamente está aquí.
THE STARS WERE LISTENING
Un teaser de ciencia ficción de alto contraste. Una pequeña figura frente a un anillo enorme, el título emergiendo de la oscuridad y una partitura que crece con él.
POPUP! Series 001
Un diseño de póster y coleccionable, plano y legible: tipografía de titular, numeración de serie y un personaje renderizado con nitidez suficiente para imprimir.
Fuego y cuero
Moda editorial a pleno contraste: fuego detrás, charol delante y la modelo consistente toma tras toma.
LEATHER IN MOTION
Atardecer, un coche y un estudio de texturas. Movimientos lentos, una sola fuente de luz práctica y tipografía nítida sobre la imagen.
Dibujado sobre el mundo real
Animación de líneas brillantes dibujada a mano sobre metraje real de un tranvía, transformando formas mientras recorre el vagón.
Tan cerca que se ven las escamas
Un gecko crestado en macro extremo, moviendo la lengua sobre el ojo. Textura de piel, reflejos húmedos y micromovimientos mantenidos en 2K.
MINIMAX, 2.35:1
Una pieza de marca entregada a 2944 by 1248: un encuadre anamórfico real en lugar de un recorte 16:9, con la marca de agua colocada de forma limpia y repetida en las balaustradas.
El prompt que lo creó
El briefing, los paneles de referencia y el vídeo resultante: banda sonora, cortes y tipografía en pantalla incluidos, en una sola generación.
Una secuencia de títulos de quince segundos en 16:9 para una película de crimen y suspense ligero. Lenguaje visual: títulos de anime japonés retro, siluetas de bordes duros, collage de cómic, pantallas divididas asimétricas, bloques de color geométricos fuertes, créditos en inglés, algo de katakana, sensación de jazz criminal. Estado de ánimo 60% suspense, 40% jazz: misterioso, genial, urbano; ni terror, ni pesado, ni un vídeo de jazz alegre.
El movimiento debe leerse como un collage gráfico: los marcos de línea se dibujan sobre negro, los límites divididos aparecen, los bloques de color y paneles se pegan bloque por bloque; siluetas, primeros planos de objetos y créditos se deslizan, aparecen y se revelan por máscara al ritmo de los golpes de batería.
Los créditos en inglés deben ser limpios y legibles, y pueden animarse: se dibuja un marco fino, el nombre se desliza, las letras aparecen una a una, un bloque de color enmascara la revelación y luego se mantiene. Sin chino añadido, sin glifos confusos, sin faltas de ortografía. Cada crédito y rol aparece una vez: sin roles repetidos, sin nombres repetidos, nadie con dos trabajos.
Transiciones: máscara circular de vinilo, barrido vertical de puerta de coche, una sombra larga barriendo el encuadre, un corte de línea roja, una máscara de letra gigante, reensamblaje de pantalla dividida, cortes de bloques de color duros. Todo al ritmo. Sin disoluciones suaves, sin metamorfosis fluidas.
Música: una pieza original de 15 segundos para títulos, 60% suspense y 40% jazz — bajo sostenido, cuerdas de pizzicato tensas, un pulso de sintetizador frío, bombo, escobillas dispersas, un fragmento de walking-bass, frases bajas de saxo y golpes cortos de metales. Los graves y los platos crecen durante 2s, bombo a los 3s, bajo de jazz a los 6s, un riff corto de saxo/metal a los 10s y un acorde tenso con batería para congelar los últimos 2s. No imitar ninguna melodía existente.






Los seis paneles a los que apunta el briefing: "referenciar el lenguaje visual de estas imágenes".
Una generación. Las tarjetas de reparto, las pantallas divididas, las transiciones de máscara de vinilo y el jazz de suspense llegaron juntos; nada fue musicalizado, rotulado o editado después.
Para qué lo usará la gente
Trabajos donde el sonido generado y los cortes en una toma cambian la tarea por completo.
Anuncios verticales que se ven bien a la primera
Un corte 9:16 llega con tono de sala, foley y una frase hablada incluida, así que la primera versión que ve un cliente no es una animática muda.
Packshots con movimiento
Delimita una foto de producto con un primer y último fotograma y el modelo rellena el trayecto entre ellos: el mismo tarro, la misma luz, abierto.
Un rostro en toda una serie
Las imágenes de referencia mantienen la identidad y el vestuario entre tomas y cortes internos, que es lo que necesita un personaje recurrente en cámara.
Animáticas con la cámara definida
Los movimientos se escriben como frases de un conjunto definido, así que un push-in es un push-in, en lugar de lo que el modelo quiera hacer.
Versiones cortas sin edición
Los cortes escritos en el prompt se entregan como varias tomas dentro de un clip, con el ambiente fluyendo sin interrupciones entre ellas.
Lo que realmente lo diferencia
Tres cosas, y solo la primera es genuinamente inusual.
Sonido generado con la imagen
Efectos, ambiente y diálogos sincronizados en el mismo archivo. Transcribimos el audio cuatro veces; las líneas del guion volvieron literales y sincronizadas todas las veces.
Cortes dentro de una sola generación
Tres planos y dos cortes secos, colocados donde indicaba el prompt, con cero empalmes no deseados en el archivo entregado, y el ambiente fluyendo entre ellos.
Cualquier segundo exacto, de 5 a 15
La duración se respeta al fotograma en el modo de referencia. Si pides un corte de once segundos, son once, no se redondea a quince.
H3 frente a Seedance 2.0
Nuestra prueba: mismo prompt y mismas imágenes de referencia, con el modelo como única variable. Un prompt, no un benchmark técnico. Un campo tuvo que cambiar: H3 rechaza una relación de aspecto fija si se adjunta una imagen, así que eligió la suya.
| Medición | MiniMax H3 | Seedance 2.0 |
|---|---|---|
| Imagen entregada | 1440 × 2560 · 24 fps | 1248 × 1664 · 24 fps |
| Líneas habladas, transcritas | literales y en sincronía, 4 de 4 | confusas, fuera de sincronía |
| Duración pedida → entregada | 8 s → 8.000 s | 8 s → 8.08 s |
| Instrucción de encuadre mantenida | no — el tarro se alejó y encogió | sí |
| Marca de agua legible, fotograma a fotograma | 134 de 192 | 159 de 193 |
Equiparable en imagen, claramente mejor en sonido, peor siguiendo instrucciones específicas. Ningún prompt incluía diálogos y ambos pedían solo ambiente silencioso; así aprendimos que H3 escribe los suyos si se lo permites.
Cómo escribir los prompts
Tres partes. Indica para qué sirve cada archivo adjunto, escribe una frase de creatividad central y luego describe el clip toma a toma, indicando tiempo de corte, encuadre, movimiento, diálogos y sonidos.
Di lo que no quieres, en voz alta
Una negativa debe ser su propia instrucción. Para el silencio, pon el campo de música no diegética en N/A — escrito como "non_diegetic_music": N/A. Omitir el campo no es la misma petición.
Esto no es opcional. Un prompt nuestro que pedía ambiente silencioso y sin diálogos entregó una locución completa sincronizada, haciendo afirmaciones sobre el producto que nadie escribió.
El paisaje sonoro tiene su propio campo
El sonido de ambiente y acción no va en la descripción de la toma. Va en overall_soundscape, de una a cuatro frases para todo el clip. La música que los personajes no oyen va en non_diegetic_music. El diálogo se queda en la toma.
Cita el texto y ajusta frases a las tomas
Las palabras que deban aparecer en pantalla van en el prompt exactamente como deben leerse, entre comillas. Una frase hablada debe caber en los segundos asignados a su toma; puede durar varios cortes si nombras las tomas que abarca.
Un prompt, completado
las tres partes, en el formato de campos que lee el modelointegrated_multimodal_description: [Shot 1] A barista sets a mug on the marble counter shown in <Picture 1>, keeping the counter, the light and the mug's position. The camera pushes in with small amplitude at slow speed. The barista with a warm, low voice (S1) says: <d>[English] Yours.</d> [Shot 2] At 00:05.000, the shot cuts to an overhead close-up of steam rising from the mug while her last word carries over. overall_soundscape: Ceramic meets stone with one soft knock and low room tone continues underneath. An espresso machine hisses two rooms away. non_diegetic_music: N/A
Cómo usarlo en Popcraft
H3 está en la lista de modelos de vídeo junto a Seedance. Tres pasos, y el tercero es el que la gente suele saltarse.
Elige MiniMax H3
Luego establece la duración —cualquier segundo exacto de cinco a quince— y el nivel de imagen.
Adjunta referencias e indica para qué son
MiniMax indica que un adjunto sin etiquetar es el primer error común. Una imagen es un primer o último fotograma y tú indicas cuál; dos delimitan la toma.
Dirige el sonido, incluyendo el silencio
Escribe el paisaje sonoro e indica lo que no quieres como instrucción propia. Si no se indica, H3 escribirá e interpretará su propio diálogo.
Preguntas frecuentes
El clip llega con efectos, ambiente y diálogos, así que la fase de sonido se convierte en edición en lugar de construcción desde cero. No es una mezcla terminada. Los niveles varían entre tomas, así que prevé un ajuste de sonoridad antes de publicar nada.
Sí, a menos que le digas que no. Esto es lo más importante que debes saber sobre H3. Un prompt nuestro pidió ambiente natural silencioso y nada de diálogo; H3 escribió, interpretó y sincronizó una locución completa, incluyendo reclamos publicitarios. Omitir los campos de sonido no equivale a pedir silencio. Escribe la negativa como instrucción propia y dirige el paisaje sonoro cada vez. Para clientes o categorías reguladas, trátalo como un paso de revisión crítico.
Una petición de 768p devuelve un lado corto de 768 píxeles. Una de 720p devuelve lo mismo. Una petición de 1080p se eleva a 2K —1440 píxeles en el lado corto—, que es el único valor que no devuelve lo solicitado. El nivel pequeño es un 40% más rápido y ocupa un tercio de los bytes. El coste es la tipografía pequeña: una marca de agua sobrevive a 768p, pero una segunda línea más pequeña debajo probablemente no.
Solo si no adjuntas una imagen de referencia. El texto a vídeo respeta la relación indicada. Si adjuntas cualquier referencia, la relación debe ser adaptativa, y no es determinista: no copia simplemente la referencia. Una referencia 3:4 resultó en 9:16 en una de nuestras pruebas. Guíate por el archivo entregado, no por la solicitud.
La identidad sí, el encuadre con menos fiabilidad. Las imágenes de referencia fijan bien la identidad y el vestuario, incluso en cortes internos de una multitoma. Las instrucciones de encuadre se respetaron menos que en Seedance 2.0 con el mismo briefing: nuestro producto se alejó en el encuadre. Repite el tamaño de plano y nombra al personaje en cada corte, que es lo que aconseja la guía de MiniMax.
El mismo modelo con dos nombres. MiniMax lo publica como MiniMax H3; algunos servidores lo llaman Hailuo 3.0. En el selector de Popcraft aparece como Hailuo 3. Esta página usa MiniMax H3 en todo el texto.
H3 cobra por segundo de salida. Para precios actuales, consulta la página de tarifas. Un dato útil: el nivel 768p ocupa un tercio de los bytes que el 2K y es un 40% más rápido, si ese equilibrio te conviene.
Genera un clip que ya tenga su propio sonido
H3 ya está disponible en Popcraft, junto al resto de nuestra gama de vídeo.
Sigue explorando
Modelos relacionados
Seedance 2.5 genera hasta 30 segundos de vídeo en una sola tarea, con hasta 50 recursos de referencia, edición de vídeo controlable, extensión temporal de alta fidelidad, cualquier relación de aspecto de 0,4 a 2,5 y prompts nativos en más de 10 idiomas. Ya disponible en Popcraft.
Genera video cinematográfico en 4K a partir de texto, imágenes o clips con Seedance 2.0 en Popcraft. Audio sincronizado nativo, secuencias multi-toma y detalle nítido hasta 4K (2160p).

Seedance 2.0 Mini es el nivel de vídeo más ligero de ByteDance: hasta un 50 % más económico que Seedance 2.0 estándar y aprox. 2 veces más rápido que Fast, con prompts de texto, imagen, vídeo y audio. Ya disponible en Popcraft.

Convierte imágenes y prompts en vídeo cinematográfico con Seedance 2.0 en Popcraft. Generación de vídeo a partir de referencias, primer/último fotograma y resultados en múltiples relaciones de aspecto en hasta 4K.