NEWO seu próximo anúncio UGC viral está a apenas um clique. Conheça o Studio.Criar anúncio
PopcraftPopcraft
Novo modelo

MiniMax H3

Vídeo que já vem com som

O MiniMax H3 gera imagem 2K e trilha estéreo sincronizada em um único processo — efeitos, tom de ambiente e diálogos, tudo junto. Já na Popcraft.

2K a 24 fpsEstéreo áudio gerado5–15s em passos de 1s6 proporções de telaMulti-shot em um único take
Diálogo
Sequência de abertura
Filme de marca
Interface de jogo
Trailer
Efeitos desenhados
Filme de produto
Macro

Filmes criados com H3

Diálogos, títulos, trailer, filmes de marca e produto, moda, interfaces, design de pôster, efeitos, macro e quadro anamórfico real. Eles tocam ao rolar; toque no alto-falante para ouvir.

Diálogo

Alguém realmente falando

Uma criadora em um café na calçada, falando para a câmera. As palavras, a sincronia labial e a rua atrás dela vieram da mesma geração — esta é a capacidade central do modelo.

Moda, vertical

Campanha de óculos

Gravado nativamente em 9:16 para redes sociais. Lentes espelhadas, silhuetas esculpidas e um estúdio limpo — identidade mantida em cada corte.

Títulos e embalagem

MIDNIGHT LINE

Uma sequência de abertura policial: telas divididas, blocos de cores sólidas e cartões de elenco cortando nas batidas da bateria, sobre uma trilha de suspense-jazz própria.

Interface e jogos

Um menu de jogo funcional

Seleção de personagens, customização de armamento, estados de botões legíveis. Renderizar interfaces legíveis é onde a maioria dos modelos falha, e é por isso que está aqui.

Trailer

THE STARS WERE LISTENING

Um teaser de ficção científica de alto contraste. Uma figura minúscula contra um anel enorme, o título surgindo da escuridão e uma trilha que cresce com a imagem.

Design gráfico

POPUP! Series 001

Design de pôster e colecionável, mantido plano e legível: tipografia de destaque, numeração de série e um personagem renderizado com nitidez para impressão.

Filme de marca

Fogo e couro

Moda editorial em contraste total — chamas ao fundo, couro envernizado à frente e a modelo mantida consistente entre os planos.

Filme de produto

LEATHER IN MOTION

Crepúsculo, um carro e um estudo de textura. Movimentos lentos, uma única fonte de luz prática e tipografia limpa sobre a imagem.

Efeitos

Desenho sobre o mundo real

Animação de linhas brilhantes desenhadas à mão sobre filmagem real de um bonde, transformando formas conforme percorre o vagão.

Macro

Perto o suficiente para contar escamas

Uma lagartixa-de-cresta em macro extremo, língua passando pelo olho. Textura da pele, reflexo úmido e micromovimentos mantidos em 2K.

Ultra-wide

MINIMAX, 2.35:1

Peça de marca entregue em 2944 por 1248 — um quadro anamórfico genuíno em vez de um corte 16:9, com a marca d'água inserida de forma limpa e repetida ao longo das balaustradas.

O prompt que criou isso

O brief, os quadros de referência fornecidos e o filme gerado — trilha, cortes e tipografia incluídos, em uma única geração.

Prompt — rolar

Uma sequência de abertura de quinze segundos em 16:9 para um filme policial de suspense leve. Linguagem visual: títulos de anime retrô japonês, silhuetas de bordas nítidas, colagem de quadrinhos, telas divididas assimétricas, blocos de cores geométricos fortes, créditos em inglês, um pouco de katakana, vibe de jazz policial. Humor 60% suspense, 40% jazz — misterioso, cool, urbano; não é terror nem pesado, e não é um vídeo de jazz alegre.

O movimento deve parecer uma colagem gráfica: linhas se desenham no preto, bordas divididas aparecem, blocos de cores e painéis são colados um a um; silhuetas, closes de objetos e créditos deslizam, surgem e são revelados por máscaras nas batidas da bateria.

Créditos em inglês devem estar limpos e legíveis, e podem ser animados: um quadro fino se desenha, o nome desliza, letras aparecem uma a uma, um bloco de cor mascara a revelação e então para. Sem chinês extra, sem glifos distorcidos, sem erros de ortografia. Cada crédito e cargo aparece uma única vez — sem cargos ou nomes repetidos, ninguém com duas funções.

Transições: máscara circular de vinil, wipe vertical de porta de carro, sombra longa varrendo o quadro, corte de linha vermelha, máscara de letra gigante, remontagem de tela dividida, cortes secos em blocos de cores. Tudo no tempo da batida. Sem dissoluções suaves, sem morphs fluidos.

Música: uma trilha original de abertura de 15 segundos, 60% suspense e 40% jazz — baixo sustentado, cordas em pizzicato tenso, um pulso de sintetizador frio, bumbo, vassourinhas esparsas, fragmento de walking-bass, frases baixas de sax e ataques curtos de metais. Graves e pratos crescem por 2s, bumbo aos 3s, baixo de jazz aos 6s, riff curto de sax/metais aos 10s e acorde tenso com bateria para congelar nos últimos 2s. Não imite nenhuma melodia existente.

Referências
Style reference board 1 for the MIDNIGHT LINE title sequenceStyle reference board 2 for the MIDNIGHT LINE title sequenceStyle reference board 3 for the MIDNIGHT LINE title sequenceStyle reference board 4 for the MIDNIGHT LINE title sequenceStyle reference board 5 for the MIDNIGHT LINE title sequenceStyle reference board 6 for the MIDNIGHT LINE title sequence

Os seis quadros indicados pelo brief — "referencie a linguagem visual destas imagens".

Resultado

Uma geração. Os cartões de elenco, as telas divididas, as transições estilo máscara de vinil e a trilha de suspense-jazz vieram juntos — nada foi sonorizado, legendado ou cortado depois.

Para que as pessoas vão usar

Trabalhos onde som gerado e cortes em um único take mudam a natureza da tarefa.

Marketing

Anúncios verticais assistíveis desde a primeira versão

Um corte 9:16 chega com som ambiente, foley e uma linha de diálogo já incluída, para que a primeira versão vista pelo cliente não seja um animatic mudo.

E-commerce

Packshots com movimento

Defina um produto estático com um frame inicial e final e o modelo preenche o movimento entre eles — o mesmo frasco, a mesma luz, aberto.

Criadores

Um rosto em toda uma série

Imagens de referência mantêm a identidade e o figurino entre takes e entre cortes dentro de um take, o que é essencial para um personagem recorrente.

Cinema e previs

Animatics com câmera descrita

Movimentos são escritos como frases de um conjunto específico, para que um push-in seja de fato um push-in, em vez do que o modelo decidir fazer.

Social

Versões reduzidas sem edição

Cortes escritos no prompt retornam como vários planos dentro de um clipe, com a ambiência correndo sem interrupções entre eles.

O que realmente o diferencia

Três coisas — e apenas a primeira é genuinamente rara.

A raridade

Som gerado junto com a imagem

Efeitos, ambiência e diálogos sincronizados no mesmo arquivo. Transcrevemos o áudio quatro vezes; as falas do roteiro voltaram exatamente iguais e em sincronia em todas as vezes.

A utilidade

Cortes em uma única geração

Três planos e dois cortes secos, posicionados onde o prompt indicou, com zero emendas indesejadas no arquivo final — e com a ambiência fluindo por eles.

A praticidade

Qualquer segundo inteiro, de 5 a 15

A duração é respeitada quadro a quadro no modo de referência. Um corte de onze segundos é entregue com onze, sem arredondar para quinze.

H3 comparado ao Seedance 2.0

Nosso teste: o mesmo prompt e as mesmas imagens de referência, com o modelo como única variável. Um único prompt, não um benchmark geral. Um campo teve que mudar com o modelo: o H3 rejeita uma proporção de tela declarada quando uma imagem de referência é anexada, então ele escolheu a própria.

MediçãoMiniMax H3Seedance 2.0
Imagem entregue1440 × 2560 · 24 fps1248 × 1664 · 24 fps
Falas, transcritas de voltaexatas e sincronizadas, 4 de 4distorcidas, fora de sincronia
Duração pedida → entregue8 s → 8.000 s8 s → 8.08 s
Instrução de enquadramento mantidanão — o frasco ficou menorsim
Marca d'água legível, quadro a quadro134 of 192159 of 193

Comparável em imagem, claramente melhor em som, pior em seguir instruções. Nenhum dos prompts escreveu uma palavra de diálogo e ambos pediram apenas som ambiente silencioso — foi assim que aprendemos que o H3 escreve o próprio diálogo se você permitir.

Como criar prompts

Três partes. Diga para que serve cada anexo, escreva uma frase do conceito criativo e descreva o clipe cena a cena — cada cena com seu tempo de corte, enquadramento, movimento de câmera, diálogo e o som da ação.

A regra mais importante

Diga o que você não quer, explicitamente

Uma negativa deve ser sua própria instrução. Para silêncio, defina o campo de música não diegética como N/A — escrito como "non_diegetic_music": N/A. Omitir o campo não é o mesmo pedido.

Isso não é opcional. Um prompt nosso que pedia ambiente silencioso e não tinha diálogos retornou com uma locução completa, sincronizada, fazendo afirmações sobre o produto que ninguém escreveu.

Som

A paisagem sonora tem seu próprio campo

Ambiência e sons de ação não ficam na descrição da cena. Eles vão em overall_soundscape, de uma a quatro frases para o clipe todo. Trilhas que os personagens não ouvem vão em non_diegetic_music. O diálogo permanece na descrição da cena.

Técnica

Use aspas no texto e ajuste falas às cenas

Palavras que devem aparecer na tela vão no prompt exatamente como devem ser lidas, entre aspas. Uma fala deve caber nos segundos atribuídos à cena; ela pode continuar após um corte se você nomear as cenas que ela abrange.

Um prompt, preenchido

as três partes, no formato de campos que o modelo lê
integrated_multimodal_description: [Shot 1] A barista sets a mug on the marble counter shown in <Picture 1>, keeping the counter, the light and the mug's position. The camera pushes in with small amplitude at slow speed. The barista with a warm, low voice (S1) says:
<d>[English] Yours.</d>
[Shot 2] At 00:05.000, the shot cuts to an overhead close-up of steam rising from the mug while her last word carries over.

overall_soundscape: Ceramic meets stone with one soft knock and low room tone continues underneath. An espresso machine hisses two rooms away.

non_diegetic_music: N/A

Usando na Popcraft

O H3 está na lista de modelos de vídeo ao lado do Seedance. Três passos, e o terceiro é o que as pessoas esquecem.

01

Escolha o MiniMax H3

Depois defina a duração — qualquer segundo inteiro de cinco a quinze — e o nível de qualidade da imagem.

02

Anexe referências e diga para que serve cada uma

O MiniMax aponta anexos sem rótulo como o primeiro erro comum. Uma imagem é o frame inicial ou final e você diz qual; duas delimitam a cena.

03

Direcione o som, incluindo o silêncio

Escreva a paisagem sonora e o que você não quer como uma instrução própria. Se não for especificado, o H3 criará e interpretará seus próprios diálogos.

Perguntas Frequentes

O clipe já chega com efeitos, ambiência e diálogos, transformando o estágio de som em uma edição, em vez de uma construção do zero. No entanto, não é um mix finalizado. Os níveis variam entre os takes, então planeje uma equalização de volume antes de publicar.

Sim, a menos que você diga para não fazer. Esta é a informação mais importante sobre o H3. Um prompt nosso pediu ambiente natural silencioso e não incluiu diálogos; o H3 criou, interpretou e sincronizou uma locução completa, incluindo promessas de produto que ninguém digitou. Omitir campos de som não é o mesmo que pedir silêncio. Escreva a negativa como instrução própria e direcione o soundscape sempre. Para clientes ou categorias reguladas, trate isso como uma etapa obrigatória de revisão.

Um pedido de 768p retorna 768 pixels no lado menor. Um pedido de 720p retorna o mesmo. Um pedido de 1080p é elevado para 2K — 1440 pixels no lado menor — que é o único valor que não retorna conforme solicitado. O nível menor é cerca de 40% mais rápido e ocupa um terço dos bytes. O custo é a perda de detalhes em textos pequenos: uma marca d'água sobrevive em 768p, mas uma segunda linha muito menor embaixo dela geralmente não.

Apenas quando não anexar uma imagem de referência. O modo texto-para-vídeo respeita a proporção declarada. Ao anexar qualquer referência, a proporção deve ser definida como adaptativa — e o modo adaptativo não é determinístico; ele não apenas copia a referência. Uma referência 3:4 retornou 9:16 em um de nossos testes. Baseie-se no arquivo entregue, não no pedido.

A identidade sim, o enquadramento com menos precisão. Imagens de referência travam bem a identidade e o figurino, inclusive nos cortes dentro de um take multi-shot. As instruções de enquadramento foram menos precisas que no Seedance 2.0 com o mesmo brief — nosso produto ficou menor no quadro. Reforce o tamanho do plano e nomeie o personagem em cada corte, conforme aconselha o guia de prompts do MiniMax.

É o mesmo modelo com dois nomes. A MiniMax o publica como MiniMax H3; some hosts o chamam de Hailuo 3.0 — no seletor de modelos da Popcraft, ele aparece como Hailuo 3. Esta página utiliza MiniMax H3 em todo o texto.

O H3 cobra por segundo de saída. Para preços atuais por segundo, consulte a página de preços. Algo útil antes de gerar: o nível 768p é processado cerca de 40% mais rápido e ocupa um terço dos bytes do 2K, se essa troca for adequada ao trabalho.

Gere um clipe que já vem com som

O H3 já está disponível na Popcraft, junto com os outros modelos de vídeo.

Continue explorando

Modelos relacionados