A versão curta, para quem não vai ler além do início. O Gemini Omni 1.1 Flash é o modelo de vídeo do Google que faz de tudo: entrada de texto, imagens ou um clipe; saída de vídeo com som próprio. A versão 1.1 (27 de agosto de 2026) adicionou as duas coisas que realmente importam para o trabalho prático: extensão de cena para 40 segundos e saída em 1080p/4K. Já está disponível no Popcraft. Passamos um dia com ele, e a coisa mais útil que aprendemos é que "estender para 20 segundos" a partir de um clipe de 5 segundos resulta em 25.
| O Google diz | Nós obtivemos | |
|---|---|---|
| Clipe mais longo | 40 s por extensão de cena, em incrementos de 10 s | 40,0 s a partir de um único prompt, 23 minutos de tempo decorrido |
| Extensão | "Analisa até 10 segundos de contexto anterior" | Origem de 5 s → arquivo de 25,0 s, original mantido frame a frame |
| Resolução | 360p a 4K, "pronto para produção profissional" | Trailer em 1080p, testes em 720p; cadeias em 4K param aos 30 s |
| Áudio | Fala, música, efeitos sonoros junto com a imagem | Trilha orquestral no trailer, som ambiente de tempestade na extensão |
| Física | "Compreensão intuitiva de forças como gravidade, energia cinética e dinâmica de fluidos" | Um trecho de 30 s de tinta na água com três fluidos que se comportam bem, abaixo |
| Câmera | Citação de parceiro: "movimento dinâmico de câmera" | Drone e órbita funcionam sempre; whip pan, grua e dolly zoom são suavizados |
Quarta-feira, 10:41. Está valendo.
A Batch AI ativou o modelo em seu gateway de testes na noite anterior. Primeiro, dois fatos do lado deles, porque são esses dois fatos que decidem como você usa o modelo: o texto da resolução é "4K" e ele realmente retorna 3840×2160, e a extensão é um modo de verdade no nível da API, não um truque de prompt. Todo o resto abaixo somos nós apertando botões.
A primeira tarefa foi deliberadamente sem graça. Uma faroleira em uma escada em caracol, vertical, 5 segundos, 720p. O resultado retornou em cerca de dois minutos, com 5,01 segundos de duração e com vento e chuva na faixa de áudio que ninguém pediu. Esse é o padrão do Omni: o guia do desenvolvedor do Google afirma que o modelo "tentará gerar uma faixa de áudio apropriada para um vídeo", e é exatamente isso que ele faz, todas as vezes, a menos que você diga para não fazer.

11:20. A extensão que ficou 5 segundos mais longa do que pedimos
Esta é a parte que faz o artigo valer a pena. Anexamos o clipe de 5 segundos, escrevemos uma linha ("a faroleira sai para a galeria da lanterna e acende a lâmpada") e pedimos um total de 20 segundos.
O arquivo retornado tem 25,0 segundos de duração.
Não é um bug. A publicação de lançamento do Google diz que a extensão funciona "em incrementos de 10 segundos até uma duração total acumulada de 40 segundos", e isso significa incrementos inteiros: 5 mais 10 mais 10. Os primeiros cinco segundos do novo arquivo são os nossos originais, byte por byte, e o áudio da tempestade passa diretamente pela junção. Fica ótimo. Apenas não tem 20 segundos.
Portanto, uma regra para qualquer pessoa que crie com base neste modelo, e a razão pela qual o painel Extender do Popcraft agora lista 15, 25 e 35 para uma origem de 5 segundos em vez dos organizados 10/20/30/40: você só pode chegar ao resultado de origem mais etapas inteiras. Cobramos os segundos que retornam, não o número digitado por você.
"Estenda vídeos em incrementos de 10 segundos até uma duração total acumulada de 40 segundos." — Google, publicação de lançamento do Omni 1.1 Flash
12:05. Quarenta segundos, um prompt
Depois, o teste que realmente queríamos: um trailer de Hollywood, "Pirates of the Cranberries", 16:9, 1080p, 40 segundos, um único pedido. O Popcraft encadeia automaticamente o processo de extensão para você: entra um prompt, sai um arquivo de 40 segundos.
Levou 23 minutos. Nossa própria estimativa dizia 15, então cabe a nós reajustar. O resultado é exatamente 40,0 segundos, 1920×1080, com uma trilha sonora orquestral que cresce aproximadamente nos lugares certos. Mesmo capitão, mesmo navio, a mesma gradação em azul-petróleo e âmbar em todas as quatro etapas. Essa consistência é a janela de contexto de 10 segundos da publicação de lançamento fazendo o seu trabalho, e é o argumento mais forte a favor do modelo.

Aqui está o que deu errado e por que a culpa foi nossa. O prompt era um parágrafo denso de 240 palavras com cinco trechos: tempestade, capitão, baú de tesouro cheio de cranberries, navio rival e final com canhões. O Omni manteve todos os elementos e os reordenou. Os jorros de cranberries aparecem aos oito segundos, antes do baú que deveria liberá-los, e o baú nunca se abre claramente. Prompts densos não falham neste modelo. Eles são comprimidos.
15:10. Tudo bem, vamos testar a alegação sobre física adequadamente
O trailer é um péssimo teste de física: há coisas demais acontecendo, e ninguém consegue dizer se um cranberry quicou corretamente. Por isso, escrevemos o prompt mais sem graça do dia. Um tanque preto com água parada. Um fluido por etapa de 10 segundos: uma gota laranja caindo, uma pluma de tinta índigo e, depois, uma nuvem de pigmento branco iluminada por trás. Sem pessoas, sem história, um arco de câmera lento, 30 segundos em 1080p, um único pedido.
Esta foi a melhor coisa que o modelo produziu o dia todo. A gota atinge a superfície e lança um respingo em forma de coroa que desmorona de volta como a água faz. A pluma índigo entra logo atrás e se desdobra pelo laranja sem que nenhuma das cores borre. Quando a nuvem branca chega, a luz de fundo se dispersa por ela e os fluidos anteriores ainda estão lá por baixo, ainda em movimento. O arco de câmera se mantém durante todas as três etapas e nunca é reiniciado. Observe a transição aos dez e vinte segundos: não conseguimos encontrá-la.
Nossos rascunhos mais baratos primeiro, porque esse é o fluxo de trabalho que recomendamos. Quatro variantes de 10 segundos em 720p (tinta, mel, dominós, um pêndulo de Newton) levaram cerca de dois minutos cada. A tinta e o pêndulo ficaram bons, o mel foi um pouco apressado demais, os dominós caíram na ordem certa, mas sem peso. A tinta venceu, escrevemos a versão de 30 segundos, e a versão de 30 segundos voltou melhor do que o rascunho. Esse não foi o caso com o trailer, onde mais duração significava mais compressão da história. Sem história para comprimir, a extensão é uma vantagem pura.
A afirmação do Google sobre dinâmica de fluidos não é, diante dessas evidências, mero marketing.
16:40. E a alegação sobre a câmera
A outra alegação que continuamos lendo no material de lançamento do Google era sobre a câmera. A citação de um parceiro na página do modelo elogia seu "movimento dinâmico de câmera", e o guia de prompts do Vertex lista o vocabulário que foi ensinado ao modelo: drone, dolly, pan, tilt, tracking, crane, orbit, whip pan e um "dolly zoom" que ele sinaliza como avançado e não suportado oficialmente.
Então pedimos todos eles em uma única tomada de 30 segundos, no mesmo farol da manhã, um movimento por trecho do prompt.
Avaliado movimento a movimento, em relação ao prompt:
- Aproximação com drone. Sim. Raspa a crista das ondas, sobe pelo basalto, chega à lanterna exatamente no segundo solicitado. Os melhores dez segundos de câmera que o modelo nos deu durante todo o dia.
- Órbita. Sim. Os últimos dez segundos circulam a faroleira por trás, passando pelo perfil até um plano aberto no lado oposto, e o farol permanece o mesmo farol do início ao fim.
- Whip pan para o barco. Não. O barco está lá, pequeno no horizonte, mas a câmera desliza até ele em vez de fazer uma transição rápida. O modelo suavizou o movimento rápido transformando-o em um movimento lento.
- Elevação de grua sobre a lanterna. Pela metade. A elevação ocorre na primeira etapa, onde o prompt não pedia isso, e não na segunda, onde pedia.
- Push-in em ângulo baixo com mudança de foco. Não. Terminou em um plano aberto.
- Dolly zoom. Deixamos de fora do prompt de 30 segundos de propósito. Em um teste anterior de 10 segundos, ele retornou como um push-in simples, e o próprio guia do Google o classifica como "oficialmente não suportado", portanto faz sentido.
Duas coisas que ninguém pediu. Entre a primeira e a segunda etapa, a câmera atravessa diretamente o vidro da lanterna para encontrar a faroleira lá dentro, e depois a segue saindo pela porta até a galeria. Não há nenhum corte no arquivo (executamos um detector de cena nele), então o modelo inventou uma transição para ir da posição do drone até a dela. É uma boa invenção. Menos boa: o cabelo dela está preso dentro da lanterna e solto na galeria alguns segundos depois. O card do modelo do Google lista "consistência entre edições" e "movimento complexo" como limitações conhecidas, e é assim que isso se parece na prática.
O padrão, tanto nos testes de 10 quanto nos de 30 segundos, é que movimentos lentos e amplos (drone, orbit, arc, dolly) são confiáveis, enquanto os rápidos ou ópticos (whip pan, dolly zoom) acabam arredondados em algo mais delicado. Se o seu plano precisa de um movimento brusco, gere-o como um clipe curto separado e faça o corte.
A lição sobre a criação de prompts é a mesma do trailer. Nomeie o movimento, um por trecho, usando o vocabulário do próprio guia do Google, e os lentos chegam na hora certa. Descreva uma sensação ("amplo", "dinâmico") e você obterá um push-in lento de qualquer forma.
O que realmente mudou em relação ao Omni Flash 1.0?
A página do modelo do Google usa a mesma tabela de recursos para ambas as versões, portanto a diferença é incomumente honesta:
| Recurso | Omni Flash (Maio de 2026) | Omni 1.1 Flash (Agosto de 2026) |
|---|---|---|
| Texto para vídeo | Sim | Sim |
| Imagem para vídeo | Não suportado | Suportado |
| Imagens / vídeo de referência | Não suportado | Até 10 imagens, 3 vídeos |
| Primeiro e último frame | Não suportado | Suportado |
| Edição de vídeo | Suportado | Suportado |
| Estender vídeos | Não suportado | Suportado, até 40 s |
| Resolução de saída | Apenas 720p | 360p, 720p, 1080p, 4K |
| Geração de som | Fala, música, efeitos | Fala, música, efeitos |
| Proveniência | SynthID, C2PA | SynthID, C2PA |
As afirmações sobre física e conhecimento do mundo da postagem original "Introducing Gemini Omni" ("uma compreensão intuitiva aprimorada de forças como gravidade, energia cinética e dinâmica de fluidos") continuam válidas, e voltamos para testar isso de propósito abaixo. No entanto, o principal destaque do Google é a memória: "cada instrução se baseia na anterior. Seus personagens permanecem consistentes, a física se mantém e a cena se lembra do que veio antes." Depois do trailer, acreditamos na segunda metade dessa frase mais do que esperávamos.
Como dizer a ele o que fazer sem uma alternância de modo?
Você não escolhe, e leva um tempo para se acostumar com isso. O guia do Google: "recomendamos confiar principalmente no uso de prompts e usar o parâmetro de tarefa apenas quando o uso de prompts não funcionar." O que você anexa e o que escreve é o que faz a alternância.
- Nada anexado: texto para vídeo.
- Uma imagem: ela se torna o primeiro frame.
- Duas imagens, além das palavras "first frame" e "last frame": interpolação entre elas. Sem essas palavras, duas imagens são referências de sujeito.
- Até dez imagens: referência de sujeito; as pessoas e objetos permanecem consistentes.
- Um vídeo mais "make it snow" ("faça nevar"): uma edição que mantém o plano, a duração e o enquadramento.
- Um vídeo mais "extend this video" ("estenda este vídeo"): extensão de cena.
As duas últimas pegam as pessoas de surpresa. Se você anexar um clipe e descrever uma continuação sem a palavra extend, o modelo tratará isso como uma edição e retornará a mesma duração. O Popcraft adiciona a palavra-chave para você no painel Extend Video; via API ou MCP, você mesmo a escreve.
O que diríamos a um colega antes de sua primeira renderização de 40 segundos
Não é uma lista de dicas. Três coisas, na ordem em que elas vão te pegar.
Uma ação por etapa. O guia do Google documenta uma sintaxe de código de tempo, e ela se ajusta perfeitamente a etapas de 10 segundos. Este é o prompt de trailer que deveríamos ter enviado:
Um galeão pirata em uma tempestade ao anoitecer, bandeira de caveira, velas pretas rasgadas. Plano contínuo único, sem cortes de cena. [0-10s] O navio avança pelas ondas; a câmera sobe até o convés. [10-20s] O capitão barbudo ao leme grita uma ordem; a tripulação responde rugindo. [20-30s] Ele abre um baú de ferro na proa; ele transborda de cranberries vermelhos. [30-40s] Um navio rival dispara; os cranberries se espalham em câmera lenta enquanto ele ergue o sabre. Visual: flares anamórficos, gradação azul-petróleo e âmbar, trilha orquestral, sem texto na tela.
Diga o que deseja ouvir, inclusive o silêncio. O silêncio é um pedido. "Sem diálogo", "sem música, apenas vento e água" são os próprios exemplos do guia para negativas simples, e eles funcionam. Deixar o som fora do prompt não é o mesmo que pedir para não ter som.
Edite com menos palavras do que parece ideal. Direto do Google: "Prompts simples funcionam melhor para edição de vídeo. Prompts excessivamente descritivos podem levar a alterações não intencionais." Nomeie a alteração, adicione "mantenha todo o resto igual" e pare de digitar.
Como ele se posiciona ao lado do Seedance 2.5 e do Veo 3.1
Hospedamos diversos modelos de vídeo porque nenhum deles se sai melhor em todos os planos. O diferencial do Omni é um único clipe longo, de até 40 segundos e até 4K, com som próprio, a partir de uma única solicitação. O Seedance 2.5 aceita muito mais referências (30 imagens, 10 vídeos) e realiza edições precisas por região. O Veo 3.1 oferece controle rigoroso de enquadramento em 8 segundos. Briefing com um clipe principal e uma trilha sonora: comece com o Omni. Briefing com um produto que precisa parecer idêntico ao longo de doze planos: comece com o Seedance.
O custo no Popcraft é por segundo entregue, de acordo com a resolução: 720p para rascunhos, 1080p para entrega e 4K para o destaque principal, com a sequência limitada a 30 segundos. Escolha qualquer duração entre 3 e 40 segundos no controle deslizante; o Popcraft encadeia automaticamente as extensões nos bastidores, o controle oferece apenas durações que o modelo consegue alcançar e o valor que você vê antes de gerar é exatamente o que paga.
Vá e tente quebrá-lo você mesmo
O Gemini Omni 1.1 Flash já está no gerador de vídeo, nos quadros do Canvas e no conector MCP. Começar é grátis: são 100 créditos e nenhum cartão. Faça como nós: comece com 10 segundos em 720p, avalie o resultado e depois estenda, ou traga um clipe de que você já goste e faça a extensão dele. O trailer e a extensão estão na página do modelo, sem edições, com som e tudo; os dois testes de 30 segundos são os que você acabou de assistir.
Fontes: publicações "Introducing Gemini Omni" e "Gemini Omni 1.1 Flash lets you build with more control" do Google, o card do modelo Gemini Omni Flash do Google DeepMind, as páginas do modelo Omni Flash e Omni 1.1 Flash na Gemini Enterprise Agent Platform e o guia do desenvolvedor da API Gemini. As medições são nossas, de 3 de setembro de 2026.



