Alibaba · Tongyi Lab
Wan 3.0: Vídeos de IA de 30 segundos en una pasada y con sonido propio
Wan 3.0 es el generador de vídeo por IA «todo en uno» de Alibaba. Convierte un prompt, una imagen o un conjunto de referencias en vídeos de cualquier duración entre 2 y 30 segundos en una sola solicitud, hasta 1080p y 30 fps, renderizando diálogo, música y efectos de sonido en el mismo proceso. En Popcraft, disponible desde 11 créditos por segundo.
Disponible en el estudio de vídeo, tableros Canvas y el conector MCP
- 2–30 s
- cualquier segundo completo, una pasada
- 1080p 30 fps
- niveles de 480p y 720p también
- 4 · 5 · 5 refs
- imágenes, clips, audio
- 11 cr / s
- en 480p — 330 por 30 s
Duración nativa de 30s
La característica principal de Alibaba: «una narrativa más completa y libertad creativa» gracias a una pasada nativa de 30 segundos. Aquí mostramos el cortometraje principal en seis puntos de su línea de tiempo, junto con los datos reales de los clips que generamos para esta página.
1s
6s
12s
18s
24s
29s| Solicitud | Entregado | Tiempo real |
|---|---|---|
| 30 s · 1080p · solo texto | 30.02 s · 1920×1080 · estéreo | 5 min 38 s |
| 5 s · 720p · solo texto | 5.04 s · 1280×720 · estéreo | 1 min 37 s |
| 3 s y 10 s · desde un clip de referencia de 6 s | 3.02 s y 10.03 s · el clip marcó el movimiento, no la duración | ≈ 1 min 25 s cada uno |
El tiempo real es desde el envío hasta el archivo en Popcraft, septiembre de 2026. Cada clip llegó con una precisión de centésimas de segundo respecto a lo solicitado, por lo que los créditos previstos son exactamente los que gastas.
Experiencia inmersiva: realismo, textura y diseño de sonido
En palabras de Alibaba: «realismo elevado, textura y diseño de sonido». Tres películas, tres estilos —acción real, CG estilo largometraje, fantasía de marca—, cada una con una solicitud, una toma continua de 30 segundos y banda sonora generada en la misma pasada. Solo cambió el prompt.
Telón
La película principal: una artista de ópera de Pekín desde el espejo del camerino hasta un teatro lleno. Los tambores crecen, suena un gong y el público ruge.
Espíritu de zorro
Un zorro de nueve colas corre por tejados iluminados, salta un vacío mientras los farolillos se dispersan y aterriza en el campanario bajo la luna llena. Estilo 3D pictórico solo mediante prompt de texto.
Máquina expendedora
Una chica con chubasquero amarillo pulsa un botón en un callejón lluvioso y es absorbida por el cristal hacia un mundo de colores pop donde una mascota le entrega una lata. El gas se convierte en fuegos artificiales.
Cada película se muestra tal cual se entregó: sin edición ni música añadida. Los borradores a 480p cuestan 330 créditos; a 1080p, 1.200.
¿Qué es Wan 3.0?
Wan 3.0 (万相 3.0) es el modelo de vídeo de Tongyi Lab (Alibaba), en beta pública desde el 6 de agosto de 2026 y lanzado el 24 de agosto. Alibaba lo define como un modelo de vídeo de referencia integral: un solo modelo para texto-a-vídeo, imagen-a-vídeo, control de primer y último fotograma y generación desde referencias mixtas. Es exclusivo vía API y Popcraft utiliza la edición «prime», la más rápida de las dos que ofrece Alibaba.
Guía de Alibaba Cloud Model Studio y referencia API para wan3.0-video; README oficial del repositorio Wan 3.0; resumen de lanzamiento de la comunidad de desarrolladores de Alibaba. Las afirmaciones son de Alibaba; las mediciones de esta página son nuestras.
“Genera de forma estable hasta 30 segundos de vídeo por solicitud, a 30 fotogramas por segundo.”
Duración
“Emite de forma nativa diálogos, música de fondo y efectos de sonido; sin doblaje en posproducción.”
Sonido
“Consistencia en la apariencia del personaje, ropa, accesorios, entorno y estilo visual; movimientos de cámara tipo push, pull, pan y tracking.”
Consistencia y cámara
- Duración nativa de 30s“Narrativa más completa y libertad creativa.”En Popcraft: cualquier duración de 2 a 30 segundos, en una pasada.
- Omnicreación“Hasta 20 activos de referencia, con análisis de documentos y páginas web.”En Popcraft: 4 imágenes, 5 clips, 5 audios. Documentos y webs próximamente.
- Consistencia perfecta de píxel“Mejora la certeza de entrega para flujos de producción.”En Popcraft: sí — ver los fotogramas inferiores.
- Experiencia inmersiva“Realismo, textura y diseño de sonido elevados.”En Popcraft: sí — diálogo, música y efectos generados con la imagen.
- Edición de vídeo de precisión“Edición más controlable para potenciar la eficiencia creativa.”Aún no en Popcraft — usa Seedance 2.5 o Gemini Omni para editar o extender.
Omnicreación: imágenes, clips y audio en un solo prompt
La segunda gran función de Alibaba: generar a partir de entradas multimodales. En Popcraft, esto permite hasta 4 imágenes, 5 clips de vídeo y 5 clips de audio en una sola solicitud, nombrando cada uno en el prompt como Imagen 1, Vídeo 1 o Audio 1 según el orden adjunto.
Sujetos, productos y escenarios
Una hoja de personaje fija el rostro y vestuario; una foto de producto fija el objeto; una foto de ubicación fija el set. El modelo mantiene lo que hay en la imagen, así que describe los cambios explícitamente. Dos imágenes con «primer fotograma» y «último fotograma» en el prompt se convierten en keyframes.
JPEG, PNG, WEBP o BMP · 240 a 8.000 px por lado · 20 MB cada una
La mujer de la Imagen 1 camina por la calle de la Imagen 2 al anochecer, la cámara la sigue lateralmente. Mantén su pelo, abrigo y bolso exactamente como en la Imagen 1.
Movimiento, cámara e interpretación
Un clip transfiere su trayectoria de cámara y actuación a la nueva toma. Combínalo con una imagen y el sujeto de la imagen realizará el movimiento del clip en el escenario del clip. El clip define el movimiento, no la duración; eso lo marca el control deslizante.
MP4 o MOV · 1 a 15 s cada uno y 15 s en total · 100 MB cada uno
El hombre de la Imagen 1 está entre las columnas. Sigue el movimiento de cámara del Vídeo 1 exactamente: un ángulo bajo abierto orbitando a la derecha hacia un plano medio corto.
El timbre de una voz o el ritmo de una pista
La fórmula de Alibaba: el audio aporta la voz o el ritmo, y la frase va en el prompt; el modelo genera el habla y el movimiento de la boca juntos. No es una herramienta de doblaje directo de grabaciones; para eso, usa modelos de avatar como OmniHuman.
WAV o MP3 · 1 a 15 s cada uno y 15 s en total · 15 MB cada uno
Toma el timbre del Audio 1 y haz que el personaje diga: «¿De verdad? Eso suena genial, ¿cuándo vuelves?». El habla generada dirige el movimiento natural de la boca.
Los fotogramas clave y las referencias no se mezclan. Dos imágenes marcadas como primer y último fotograma crean un clip entre ellas por sí solas; todo lo demás se puede combinar libremente hasta los límites indicados.
Consistencia perfecta de píxel
La tercera función clave de Alibaba: «mejorar la certeza de entrega para flujos de producción». La misma intérprete de la película principal en tres momentos, con 28 segundos de diferencia.
1 s
12 s
29 sCómo escribir prompts para Wan 3.0
El modelo planifica todo el clip a partir del prompt, por lo que este debe indicar qué tipo de clip es. Nuestros resultados fueron consistentes al definir la continuidad: una toma sin cortes o una lista numerada de tomas.
Di «no cuts» y marca los tiempos
Empieza con «one continuous take, no cuts, no transitions», asigna a cada bloque de segundos una acción y un verbo de cámara, mantén un único sujeto principal y escribe el sonido en su propia frase.
UNA SOLA TOMA CONTINUA, SIN CORTES, SIN TRANSICIONES, 30 s. Fotorrealismo cinematográfico, alto contraste. Una intérprete de ópera de Pekín con maquillaje de rostro pintado y túnica carmesí y dorada. 0–6 s: primer plano extremo en un espejo de camerino rodeado de bombillas; abre los ojos. 6–16 s: camina por un pasillo estrecho de backstage, los tramoyistas se apartan, la cámara retrocede frente a ella mientras los tambores crecen. 16–24 s: atraviesa pesadas cortinas de terciopelo rojo hacia una luz cegadora; la cámara gira tras su hombro. 24–30 s: la revelación: un teatro lleno bajo farolillos rojos; levanta una manga de agua mientras suena un gong. Sonido: tambores creciendo, pasos, el roce de la cortina, un gong, aplausos. Sin diálogos, sin texto en pantalla.
- Nombra las referencias
- Imagen 1, Vídeo 1, Audio 1 —numerados por tipo según el orden de adjunto— y especifica su función: «La Imagen 1 es el personaje; el Vídeo 1 es el movimiento de cámara».
- Dirige el sonido
- Por defecto, el modelo crea diálogos, música y efectos. Pide lo que quieras —«lluvia y un tranvía lejano, sin diálogos»— o apaga el interruptor de Audio para un archivo mudo.
- Prioriza la fidelidad
- Dada una imagen, el modelo mantiene su contenido. Para cambios drásticos (clima, vestuario), descríbelos explícitamente en lugar de esperar que el prompt anule la imagen automáticamente.
- Un solo protagonista
- Una sola figura, una trayectoria de cámara definida y las palabras «no cuts» nos dieron tomas limpias siempre. Las multitudes y objetos pequeños son donde los modelos de vídeo suelen perder precisión.
- Bocetos baratos, entregas premium
- 480p usa el mismo modelo a un cuarto del precio de 1080p. Valida la historia en 480p y luego re-renderiza el resultado ganador en 1080p con el mismo prompt.
Wan 3.0 vs Seedance 2.5 vs Gemini Omni 1.1 Flash
Tres modelos en Popcraft que generan sonido con la imagen. La ventaja de Wan es la toma de 30 segundos más barata y la fidelidad a la referencia; la de Seedance es el número de referencias y edición; la de Omni es 4K y 40 segundos por extensión. Elige según el trabajo.
| Capacidad | Wan 3.0 | Seedance 2.5 | Gemini Omni 1.1 Flash |
|---|---|---|---|
| Clip más largo en una solicitud | 30 s en una pasada | 30 s | 40 s por extensión (30 s en 4K) |
| Resoluciones | 480p / 720p / 1080p a 30 fps | Hasta 1080p | 360p (borrador) hasta 4K |
| Audio nativo | Diálogo, música, efectos; desactivable | Sí | Habla, música, efectos de sonido |
| Imágenes de referencia | Hasta 4 | Hasta 30 | Hasta 10 |
| Vídeos de referencia | Hasta 5, 15 s en total | Hasta 10 | Hasta 3 |
| Audio de referencia | Hasta 5, 15 s en total | Hasta 10 | — |
| Editar o extender clip | — (usa Seedance 2.5 u Omni) | Editar; extender antes o después | Editar; extender en bloques de 10 s |
| Borrador de 30 segundos | 330 créditos en 480p | Por segundo, según resolución | 150 créditos en 360p |
Las cifras de Wan son de la guía oficial de Alibaba; los límites de Popcraft son los actuales del selector. Las comparativas completas: Seedance 2.5 · Gemini Omni 1.1 Flash.
Precios de Wan 3.0 en Popcraft
Facturación por segundo entregado, según resolución. Las referencias son gratuitas. Como la duración entregada coincide con la solicitada, el precio que ves antes de generar es el que pagas.
Todos los planes incluyen créditos; la página de precios detalla las tarifas actuales. Las descargas del nivel gratuito llevan marca de agua de Popcraft.
Para qué recomienda Alibaba Wan 3.0
Tres escenarios del material oficial de Alibaba y cómo ejecutarlos en Popcraft.
- 01
Vídeo corto: dramatización de tramas y teasers publicitarios
Escenario de entretenimiento. Hasta 30 segundos de narrativa multiescena con un solo prompt, sonido incluido.
- 02
E-commerce: vitrina de producto desde una imagen
Sube una imagen de producto más una descripción y obtén una presentación dinámica. Adjunta la foto como Imagen 1.
- 03
Educación: simulaciones de escenarios
Consulta médica o llamada de soporte recreada desde un prompt, con el diálogo generado por la IA.
- 04
Boceta en 480p, entrega en 1080p
Añadido de Popcraft: 11 créditos por segundo en 480p permiten validar la historia por solo 330 créditos antes de pasar a 1080p.
Wan 3.0 — Preguntas frecuentes
El modelo de vídeo integral de Alibaba (Tongyi Lab). Cubre texto-a-vídeo, imagen-a-vídeo y generación multireferencia, produciendo clips de hasta 30 segundos a 30 fps con diálogos, música y efectos de sonido integrados.
Cualquier segundo completo de 2 a 30, en una sola pasada. En Popcraft ajustas la duración con un deslizador y el archivo coincide exactamente con lo solicitado. Pagas solo por esos segundos.
Sí, por defecto. Emite nativamente diálogos, música y efectos. El interruptor de Audio en Popcraft permite desactivarlo si prefieres un clip mudo.
Puedes adjuntar hasta 4 imágenes, 5 vídeos y 5 audios. Las imágenes definen sujetos u objetos; los vídeos, el movimiento y la cámara; el audio, el timbre de voz o el ritmo. Los vídeos y audios tienen un tope de 15 segundos en total.
Es su fuerte. Alibaba destaca la consistencia de apariencia, ropa y entorno como capacidad principal. Wan 3.0 prioriza la imagen de referencia que le des.
Aún no en Popcraft. Wan 3.0 usa clips adjuntos como referencia de movimiento; para extender metraje, usa Seedance 2.5 o Gemini Omni.
Las referencias de audio aportan el timbre, pero la frase se escribe en el prompt. El modelo genera el habla y el movimiento labial a la vez. No es una herramienta de «animar esta grabación»; para eso usa OmniHuman.
Se factura por segundo entregado: 11 créditos a 480p, 20 a 720p y 40 a 1080p. Un borrador de 30 segundos a 480p cuesta 330 créditos.
Treinta segundos, una solicitud. Pruébalo primero en 480p.
Crea tu borrador por 330 créditos, juzga la historia y renderiza el ganador en 1080p.
Sigue explorando
Modelos relacionados
Seedance 2.5 genera hasta 30 segundos de vídeo en una sola tarea, con hasta 50 recursos de referencia, edición de vídeo controlable, extensión temporal de alta fidelidad, cualquier relación de aspecto de 0,4 a 2,5 y prompts nativos en más de 10 idiomas. Ya disponible en Popcraft.
Gemini Omni 1.1 Flash es el modelo de vídeo de Google que crea y edita vídeos a partir de cualquier entrada. Hasta 40 segundos mediante ampliación de escenas, salida en 1080p y 4K, interpolación del primer y último fotograma, hasta 10 imágenes de referencia y voz, música y efectos de sonido generados con la imagen. Ya disponible en Popcraft.
MiniMax H3 genera vídeo 2K a 24 fps con banda sonora estéreo sincronizada: efectos, ambiente y diálogos en un solo proceso. Multitoma desde un solo prompt, 5 a 15 segundos, control de primer y último fotograma. Ya en Popcraft.
Genera video cinematográfico en 4K a partir de texto, imágenes o clips con Seedance 2.0 en Popcraft. Audio sincronizado nativo, secuencias multi-toma y detalle nítido hasta 4K (2160p).