La versión corta, para quienes no leerán más allá del primer vistazo. Gemini Omni 1.1 Flash es el modelo de video todoterreno de Google: entra texto, imágenes o un clip, y sale video con su propio sonido. La versión 1.1 (27 de agosto de 2026) añadió las dos cosas que importan para el trabajo real: la extensión de escena a 40 segundos y la salida en 1080p/4K. Ya está disponible en Popcraft. Pasamos un día probándolo, y lo más útil que aprendimos es que «extender a 20 segundos» a partir de un clip de 5 segundos te da 25.
| Google dice | Obtuvimos | |
|---|---|---|
| Clip más largo | 40 s mediante extensión de escena, en incrementos de 10 s | 40,0 s con un solo prompt, 23 minutos de tiempo real |
| Extensión | «Analiza hasta 10 segundos de contexto previo» | 5 s de origen → archivo de 25,0 s, el original se conserva fotograma a fotograma |
| Resolución | De 360p a 4K, «listo para producción profesional» | Tráiler en 1080p, pruebas en 720p; las cadenas en 4K se detienen a los 30 s |
| Audio | Voz, música y efectos de sonido junto con la imagen | Banda sonora orquestal en el tráiler, ambiente de tormenta en la extensión |
| Física | «Comprensión intuitiva de fuerzas como la gravedad, la energía cinética y la dinámica de fluidos» | Una pieza de 30 s de tinta en agua con tres fluidos que se comportan como deben, a continuación |
| Cámara | Cita de colaboradores: «movimiento de cámara dinámico» | Dron u órbita funcionan siempre; el barrido rápido, la grúa y el dolly zoom se suavizan |
Miércoles, 10:41. Ya está en marcha.
Batch AI activó el modelo en su pasarela de pruebas la noche anterior. Primero, dos datos por su parte, porque esos dos datos determinan cómo se usa el modelo: la cadena de resolución es «4K» y realmente devuelve 3840×2160, y la extensión es un modo propio a nivel de API, no un truco de prompt. Todo lo demás a continuación somos nosotros pulsando botones.
La primera tarea fue deliberadamente aburrida. La farera en una escalera de caracol, en vertical, 5 segundos, 720p. El resultado llegó en unos dos minutos con una duración de 5,01 segundos y con viento y lluvia en la pista de audio que nadie había pedido. Ese es el comportamiento por defecto de Omni: la guía para desarrolladores de Google indica que el modelo «intentará generar una pista de audio adecuada para un video», y lo hace siempre, a menos que le indiques lo contrario.

11:20. La extensión que fue 5 segundos más larga de lo que pedimos
Esta es la parte que justifica la lectura de esta entrada. Adjuntamos el clip de 5 segundos, escribimos una sola línea («la farera sale a la galería de la linterna y enciende la lámpara») y pedimos un total de 20 segundos.
El archivo resultante dura 25,0 segundos.
No es un error. La publicación de lanzamiento de Google afirma que la extensión funciona «en incrementos de 10 segundos hasta una longitud acumulada total de 40 segundos», y se refiere a incrementos completos: 5 más 10 más 10. Los primeros cinco segundos del nuevo archivo son los originales, byte por byte, y el audio de la tormenta se transmite perfectamente a través de la unión. Queda genial. Simplemente no son 20 segundos.
Por lo tanto, una regla para cualquiera que desarrolle sobre este modelo, y la razón por la que el panel Extender de Popcraft ahora muestra 15, 25 y 35 para un origen de 5 segundos en lugar de los ordenados 10/20/30/40: solo puedes obtener el origen más tramos completos. Facturamos los segundos que devolvemos, no la cifra que has escrito.
«Extiende videos en incrementos de 10 segundos hasta una duración acumulada total de 40 segundos». — Google, publicación de lanzamiento de Omni 1.1 Flash
12:05. Cuarenta segundos, un prompt
Luego, lo que realmente queríamos: un tráiler al estilo de Hollywood, «Piratas de los Arándanos Rojos», 16:9, 1080p, 40 segundos y una sola solicitud. Popcraft encadena automáticamente el proceso de extensión por ti: introduce un prompt y obtén un archivo de 40 segundos.
Tardó 23 minutos. Nuestra propia estimación decía 15, así que nos toca ajustarla. El resultado es de exactamente 40,0 segundos, 1920×1080, con una banda sonora orquestal que se intensifica más o menos en los momentos adecuados. El mismo capitán, el mismo barco y la misma corrección de color en azul verdoso y ámbar en los cuatro tramos. Esa coherencia es la ventana de contexto de 10 segundos de la publicación de lanzamiento haciendo su trabajo, y es el argumento más sólido a favor del modelo.

Esto es lo que salió mal y por qué fue culpa nuestra. El prompt era un párrafo denso de 240 palabras con cinco momentos clave: tormenta, capitán, cofre del tesoro lleno de arándanos rojos, barco rival y final con cañones. Omni conservó cada elemento y los reordenó. La ráfaga de arándanos rojos aparece a los ocho segundos, antes del cofre del que se suponía que saldría, y el cofre nunca llega a abrirse con claridad. Los prompts densos no fallan en este modelo: se comprimen.
15:10. Muy bien, vamos a probar en serio la afirmación sobre la física
El tráiler es una mala prueba de física: pasan demasiadas cosas y nadie puede decir si un arándano rojo rebotó correctamente. Así que escribimos el prompt más aburrido del día. Un tanque negro con agua en calma. Un fluido por cada tramo de 10 segundos: una gota naranja cayendo, una estela de tinta índigo y luego una nube de pigmento blanco iluminada desde atrás. Sin personas, sin historia, un único arco de cámara lento, 30 segundos a 1080p y una sola solicitud.
Esto es lo mejor que ha generado el modelo en todo el día. La gota cae y crea una salpicadura en forma de corona que vuelve a colapsar exactamente como lo hace el agua. La estela índigo entra justo detrás y se despliega a través del naranja sin que ninguno de los dos colores se difumine en una mancha. Cuando llega la nube blanca, la luz de fondo se dispersa a través de ella y los fluidos anteriores siguen ahí debajo, en movimiento. El arco de cámara se mantiene a lo largo de los tres tramos y no se reinicia en ningún momento. Observa la unión a los diez y a los veinte segundos: nosotros no logramos encontrarla.
Primero nuestros borradores más económicos, porque ese es el flujo de trabajo que recomendamos. Cuatro variantes de 10 segundos en 720p (tinta, miel, fichas de dominó, un péndulo de Newton) tardaron unos dos minutos cada una. La tinta y el péndulo quedaron bien, la miel fue un poco excesiva y las fichas de dominó cayeron en el orden correcto, pero sin peso. Ganó la tinta, redactamos la versión de 30 segundos y esta resultó ser mejor que el borrador. No ocurrió lo mismo con el tráiler, donde una mayor duración implicaba comprimir más la historia. Al no haber historia que comprimir, la extensión no ofrece más que ventajas.
La afirmación de Google sobre la dinámica de fluidos, a juzgar por las pruebas, no es mero marketing.
16:40. Y la afirmación sobre la cámara
La otra afirmación que no dejábamos de ver en el material de presentación de Google tenía que ver con la cámara. Cierta cita de un socio en la página del modelo elogia su «movimiento de cámara dinámico», y la guía de prompts de Vertex incluye el vocabulario que se le enseñó al modelo: drone, dolly, pan, tilt, tracking, crane, orbit, whip pan y un «dolly zoom» que señala como avanzado y sin soporte oficial.
Así que los pedimos todos en una sola toma de 30 segundos, en el mismo faro de la mañana, con un movimiento por cada momento clave del prompt.
Evaluado movimiento por movimiento, respecto al prompt:
- Aproximación con dron. Sí. Roza la cresta de las olas, asciende por el basalto y llega a la linterna exactamente en el segundo que pedimos. Los mejores diez segundos de cámara que nos dio el modelo en todo el día.
- Órbita. Sí. Los últimos diez segundos giran alrededor de la farera desde atrás, pasando por el perfil hasta un plano general en el lado opuesto, y el faro sigue siendo el mismo faro en todo momento.
- Barrido rápido al barco. No. El barco está ahí, pequeño en el horizonte, pero la cámara se desplaza suavemente hacia él en lugar de hacer un movimiento seco. El modelo suavizó el movimiento rápido convirtiéndolo en uno lento.
- Ascenso con grúa sobre la linterna. A medias. La subida ocurre en el primer tramo, donde el prompt no lo pedía, y no en el segundo, donde sí lo hacía.
- Acercamiento en contrapicado con cambio de foco. No. Acabó en un plano general.
- Traveling de compensación (dolly zoom). Lo dejamos fuera del prompt de 30 segundos a propósito. En una prueba anterior de 10 segundos devolvió un simple acercamiento, y la propia guía de Google lo clasifica como «no admitido oficialmente», así que es comprensible.
Dos cosas que nadie había pedido. Entre el primer y el segundo tramo, la cámara atraviesa directamente el cristal de la linterna para encontrar a la farera dentro y luego la sigue fuera por la puerta hasta la galería. No hay ningún corte en todo el archivo (pasamos un detector de escenas), así que el modelo se inventó una transición para ir desde la posición del dron hasta la de ella. Es un buen invento. Lo que no está tan bien: su pelo está recogido dentro de la linterna y suelto en la galería unos segundos después. La ficha técnica del modelo de Google señala la «consistencia entre ediciones» y el «movimiento complejo» como limitaciones conocidas, y esto es lo que significa en la práctica.
El patrón que se observa, tanto en las pruebas de 10 como en las de 30 segundos, es que los movimientos lentos y panorámicos (dron, órbita, arco, dolly) son fiables, mientras que los rápidos u ópticos (barrido rápido, dolly zoom) se suavizan para transformarse en algo más sutil. Si tu toma necesita un cambio brusco, genérala como un clip corto independiente e insértala en el montaje.
La lección de prompting es la misma que la del tráiler. Nombra el movimiento, uno por cada momento clave, usando el vocabulario de la propia guía de Google, y los movimientos lentos se ejecutarán a tiempo. Describe una sensación («envolvente», «dinámico») y obtendrás un acercamiento lento de todos modos.
¿Qué ha cambiado realmente respecto a Omni Flash 1.0?
La página del modelo de Google utiliza la misma tabla de capacidades para ambas versiones, por lo que la diferencia es inusualmente sincera:
| Capacidad | Omni Flash (mayo de 2026) | Omni 1.1 Flash (agosto de 2026) |
|---|---|---|
| Texto a video | Sí | Sí |
| Imagen a video | No compatible | Compatible |
| Imágenes / videos de referencia | No compatible | Hasta 10 imágenes, 3 videos |
| Primer y último fotograma | No compatible | Compatible |
| Edición de video | Compatible | Compatible |
| Extender videos | No compatible | Compatible, hasta 40 s |
| Resolución de salida | Solo 720p | 360p, 720p, 1080p, 4K |
| Generación de sonido | Voz, música, efectos | Voz, música, efectos |
| Procedencia | SynthID, C2PA | SynthID, C2PA |
Las afirmaciones sobre física y conocimiento del mundo del artículo original «Introducing Gemini Omni» («una mejor comprensión intuitiva de fuerzas como la gravedad, la energía cinética y la dinámica de fluidos») se mantienen, y volvimos a poner a prueba esa parte a propósito más adelante. Sin embargo, lo primero que destaca Google es la memoria: «cada instrucción se apoya en la anterior. Tus personajes se mantienen coherentes, las leyes de la física se sostienen y la escena recuerda lo que ocurrió antes». Después de ver el tráiler, nos creemos la segunda mitad de esa frase más de lo que esperábamos.
¿Cómo le dices qué hacer sin un cambio de modo?
No lo haces, y cuesta un minuto acostumbrarse a ello. Guía de Google: «Recomendamos confiar principalmente en el prompting y usar el parámetro de tarea solo cuando el prompting no funcione». Lo que adjuntas y lo que escribes hacen de interruptor.
- Nada adjunto: texto a video.
- Una imagen: se convierte en el primer fotograma.
- Dos imágenes, más las palabras «primer fotograma» y «último fotograma»: interpolación entre ellas. Sin esas palabras, dos imágenes son referencias de sujeto.
- Hasta diez imágenes: referencia de sujeto; las personas y los objetos se mantienen coherentes.
- Un video más «haz que nieve»: una edición que conserva la toma, la duración y el encuadre.
- Un video más «extiende este video»: extensión de escena.
Las dos últimas suelen tomar por sorpresa a la gente. Si adjuntas un clip y describes una continuación sin incluir la palabra extend, el modelo lo tratará como una edición y devolverá la misma duración. Popcraft añade la palabra clave por ti en el panel Extender video; desde la API o el MCP tendrás que escribirla tú mismo.
Lo que le diríamos a un compañero antes de su primer renderizado de 40 segundos
No es una lista de consejos. Tres cosas, en el orden en que te complicarán la vida.
Una acción por tramo. La guía de Google documenta una sintaxis de código de tiempo que encaja perfectamente en tramos de 10 segundos. Este es el prompt de tráiler que deberíamos haber enviado:
Un galeón pirata en una tormenta al atardecer, bandera de calavera, velas negras rasgadas. Un único plano continuo, sin cortes de escena. [0-10s] El barco embiste las olas; la cámara asciende a la cubierta. [10-20s] El capitán con barba al timón grita una orden; la tripulación responde rugiendo. [20-30s] Abre un cofre de hierro en la proa; rebosa arándanos rojos. [30-40s] Un barco rival dispara; los arándanos rojos se esparcen a cámara lenta mientras él levanta su alfanje. Aspecto: destellos anamórficos, corrección de color azul verdoso y ámbar, banda sonora orquestal, sin texto en pantalla.
Di lo que quieres oír, incluso si es nada. El silencio es una petición. «Sin diálogo» y «sin música, solo viento y agua» son los propios ejemplos de negativas simples de la guía, y funcionan. Omitir el sonido en el prompt no es lo mismo que pedir que no haya ninguno.
Edita con menos palabras de las que te parezca adecuado. Directamente de Google: «Los prompts sencillos funcionan mejor para la edición de video. Los prompts excesivamente descriptivos pueden provocar cambios no deseados». Nombra el cambio, añade «mantén todo lo demás igual» y deja de escribir.
Dónde se sitúa junto a Seedance 2.5 y Veo 3.1
Alojamos varios modelos de video porque ninguno de ellos destaca en todas las tomas. La ventaja de Omni es un único clip largo, de hasta 40 segundos y hasta 4K, con su propio sonido, a partir de una sola solicitud. Seedance 2.5 admite muchas más referencias (30 imágenes, 10 videos) y realiza una edición precisa por regiones. Veo 3.1 ofrece un control preciso del encuadre a lo largo de 8 segundos. Si la propuesta requiere un clip principal y una banda sonora: empieza con Omni. Si la propuesta requiere un producto que deba verse idéntico a lo largo de doce tomas: empieza con Seedance.
El costo en Popcraft es por segundo generado, según la resolución: 720p para borradores, 1080p para entregar y 4K para el formato principal con la cadena limitada a 30 segundos. Elige cualquier duración de 3 a 40 segundos en el control deslizante; Popcraft encadena las extensiones automáticamente en segundo plano, el control solo ofrece duraciones alcanzables por el modelo y la cifra que ves antes de generar es lo que pagas.
Ve a romperlo tú mismo
Gemini Omni 1.1 Flash ya está disponible en el generador de video, así como en los tableros de Canvas y en el conector MCP. Puedes empezar gratis con 100 créditos y sin tarjeta. Haz lo mismo que nosotros: genera primero 10 segundos a 720p, evalúalo y luego extiéndelo, o trae un clip que ya te guste y extiéndelo. El tráiler y la extensión están en la página del modelo, sin editar, con sonido y todo; las dos pruebas de 30 segundos son las que acabas de ver.
Fuentes: las publicaciones «Introducing Gemini Omni» y «Gemini Omni 1.1 Flash lets you build with more control» de Google, la ficha del modelo de Google DeepMind para Gemini Omni Flash, las páginas del modelo en Gemini Enterprise Agent Platform para Omni Flash y Omni 1.1 Flash, y la guía para desarrolladores de la API de Gemini. Las mediciones son nuestras, con fecha de 3 de septiembre de 2026.



