NEWTu próximo anuncio UGC viral está a solo un clic. Conoce Studio.Crear anuncio
PopcraftPopcraft
Nuevo modelo de vídeo

Alibaba · Tongyi Lab

Wan 3.0: Vídeos de IA de 30 segundos en una pasada y con sonido propio

Wan 3.0 es el generador de vídeo por IA «todo en uno» de Alibaba. Convierte un prompt, una imagen o un conjunto de referencias en vídeos de cualquier duración entre 2 y 30 segundos en una sola solicitud, hasta 1080p y 30 fps, renderizando diálogo, música y efectos de sonido en el mismo proceso. En Popcraft, disponible desde 11 créditos por segundo.

Disponible en el estudio de vídeo, tableros Canvas y el conector MCP

2–30 s
cualquier segundo completo, una pasada
1080p 30 fps
niveles de 480p y 720p también
4 · 5 · 5 refs
imágenes, clips, audio
11 cr / s
en 480p — 330 por 30 s
00segundos, una sola toma
una sola toma · audio generado · sin edición

Duración nativa de 30s

La característica principal de Alibaba: «una narrativa más completa y libertad creativa» gracias a una pasada nativa de 30 segundos. Aquí mostramos el cortometraje principal en seis puntos de su línea de tiempo, junto con los datos reales de los clips que generamos para esta página.

Segundo 1: primer plano extremo del rostro pintado de la artista en el espejo del camerino1s
Segundo 6: se levanta del espejo con la túnica carmesí y dorada6s
Segundo 12: el pasillo del backstage, los tramoyistas se pegan a las paredes mientras ella pasa12s
Segundo 18: su mano sobre la cortina de terciopelo rojo18s
Segundo 24: atraviesa la cortina hacia la luz del escenario, revelando la sala iluminada con farolillos24s
Segundo 29: levanta la manga de agua ante un teatro lleno bajo farolillos rojos29s
Misma artista, misma túnica, misma gradación del espejo al escenario — camerino, pasillo, telón y sala llena, en una única solicitud sin cortes.
Entregado frente a solicitado
SolicitudEntregadoTiempo real
30 s · 1080p · solo texto30.02 s · 1920×1080 · estéreo5 min 38 s
5 s · 720p · solo texto5.04 s · 1280×720 · estéreo1 min 37 s
3 s y 10 s · desde un clip de referencia de 6 s3.02 s y 10.03 s · el clip marcó el movimiento, no la duración≈ 1 min 25 s cada uno

El tiempo real es desde el envío hasta el archivo en Popcraft, septiembre de 2026. Cada clip llegó con una precisión de centésimas de segundo respecto a lo solicitado, por lo que los créditos previstos son exactamente los que gastas.

Experiencia inmersiva: realismo, textura y diseño de sonido

En palabras de Alibaba: «realismo elevado, textura y diseño de sonido». Tres películas, tres estilos —acción real, CG estilo largometraje, fantasía de marca—, cada una con una solicitud, una toma continua de 30 segundos y banda sonora generada en la misma pasada. Solo cambió el prompt.

Acción real30.0s1 takelive action

Telón

La película principal: una artista de ópera de Pekín desde el espejo del camerino hasta un teatro lleno. Los tambores crecen, suena un gong y el público ruge.

CG cinematográfico30.0s1 take3D-CG look

Espíritu de zorro

Un zorro de nueve colas corre por tejados iluminados, salta un vacío mientras los farolillos se dispersan y aterriza en el campanario bajo la luna llena. Estilo 3D pictórico solo mediante prompt de texto.

Fantasía de marca30.0s1 takebrand fantasy

Máquina expendedora

Una chica con chubasquero amarillo pulsa un botón en un callejón lluvioso y es absorbida por el cristal hacia un mundo de colores pop donde una mascota le entrega una lata. El gas se convierte en fuegos artificiales.

Cada película se muestra tal cual se entregó: sin edición ni música añadida. Los borradores a 480p cuestan 330 créditos; a 1080p, 1.200.

¿Qué es Wan 3.0?

Wan 3.0 (万相 3.0) es el modelo de vídeo de Tongyi Lab (Alibaba), en beta pública desde el 6 de agosto de 2026 y lanzado el 24 de agosto. Alibaba lo define como un modelo de vídeo de referencia integral: un solo modelo para texto-a-vídeo, imagen-a-vídeo, control de primer y último fotograma y generación desde referencias mixtas. Es exclusivo vía API y Popcraft utiliza la edición «prime», la más rápida de las dos que ofrece Alibaba.

Guía de Alibaba Cloud Model Studio y referencia API para wan3.0-video; README oficial del repositorio Wan 3.0; resumen de lanzamiento de la comunidad de desarrolladores de Alibaba. Las afirmaciones son de Alibaba; las mediciones de esta página son nuestras.

En palabras de Alibaba
  1. Genera de forma estable hasta 30 segundos de vídeo por solicitud, a 30 fotogramas por segundo.

    Duración

  2. Emite de forma nativa diálogos, música de fondo y efectos de sonido; sin doblaje en posproducción.

    Sonido

  3. Consistencia en la apariencia del personaje, ropa, accesorios, entorno y estilo visual; movimientos de cámara tipo push, pull, pan y tracking.

    Consistencia y cámara

Las cinco características clave de Alibaba
  1. Duración nativa de 30sNarrativa más completa y libertad creativa.En Popcraft: cualquier duración de 2 a 30 segundos, en una pasada.
  2. OmnicreaciónHasta 20 activos de referencia, con análisis de documentos y páginas web.En Popcraft: 4 imágenes, 5 clips, 5 audios. Documentos y webs próximamente.
  3. Consistencia perfecta de píxelMejora la certeza de entrega para flujos de producción.En Popcraft: sí — ver los fotogramas inferiores.
  4. Experiencia inmersivaRealismo, textura y diseño de sonido elevados.En Popcraft: sí — diálogo, música y efectos generados con la imagen.
  5. Edición de vídeo de precisiónEdición más controlable para potenciar la eficiencia creativa.Aún no en Popcraft — usa Seedance 2.5 o Gemini Omni para editar o extender.

Omnicreación: imágenes, clips y audio en un solo prompt

La segunda gran función de Alibaba: generar a partir de entradas multimodales. En Popcraft, esto permite hasta 4 imágenes, 5 clips de vídeo y 5 clips de audio en una sola solicitud, nombrando cada uno en el prompt como Imagen 1, Vídeo 1 o Audio 1 según el orden adjunto.

Imagen 1 … Imagen 4

Sujetos, productos y escenarios

Una hoja de personaje fija el rostro y vestuario; una foto de producto fija el objeto; una foto de ubicación fija el set. El modelo mantiene lo que hay en la imagen, así que describe los cambios explícitamente. Dos imágenes con «primer fotograma» y «último fotograma» en el prompt se convierten en keyframes.

JPEG, PNG, WEBP o BMP · 240 a 8.000 px por lado · 20 MB cada una

La mujer de la Imagen 1 camina por la calle de la Imagen 2 al anochecer, la cámara la sigue lateralmente. Mantén su pelo, abrigo y bolso exactamente como en la Imagen 1.
Vídeo 1 … Vídeo 5

Movimiento, cámara e interpretación

Un clip transfiere su trayectoria de cámara y actuación a la nueva toma. Combínalo con una imagen y el sujeto de la imagen realizará el movimiento del clip en el escenario del clip. El clip define el movimiento, no la duración; eso lo marca el control deslizante.

MP4 o MOV · 1 a 15 s cada uno y 15 s en total · 100 MB cada uno

El hombre de la Imagen 1 está entre las columnas. Sigue el movimiento de cámara del Vídeo 1 exactamente: un ángulo bajo abierto orbitando a la derecha hacia un plano medio corto.
Audio 1 … Audio 5

El timbre de una voz o el ritmo de una pista

La fórmula de Alibaba: el audio aporta la voz o el ritmo, y la frase va en el prompt; el modelo genera el habla y el movimiento de la boca juntos. No es una herramienta de doblaje directo de grabaciones; para eso, usa modelos de avatar como OmniHuman.

WAV o MP3 · 1 a 15 s cada uno y 15 s en total · 15 MB cada uno

Toma el timbre del Audio 1 y haz que el personaje diga: «¿De verdad? Eso suena genial, ¿cuándo vuelves?». El habla generada dirige el movimiento natural de la boca.

Los fotogramas clave y las referencias no se mezclan. Dos imágenes marcadas como primer y último fotograma crean un clip entre ellas por sí solas; todo lo demás se puede combinar libremente hasta los límites indicados.

Consistencia perfecta de píxel

La tercera función clave de Alibaba: «mejorar la certeza de entrega para flujos de producción». La misma intérprete de la película principal en tres momentos, con 28 segundos de diferencia.

Rostro pintado de la artista en el espejo del camerino al segundo 11 s
La misma artista en el pasillo del backstage al segundo 1212 s
La misma artista en el escenario ante la sala llena al segundo 2929 s
Mismo rostro, tocado y túnica del espejo al escenario. Adjunta una hoja de personaje o foto de producto como Imagen 1 y el modelo respetará lo que le des; en nuestras pruebas, un producto en formato cuadrado se reprodujo fielmente en un marco 16:9.

Cómo escribir prompts para Wan 3.0

El modelo planifica todo el clip a partir del prompt, por lo que este debe indicar qué tipo de clip es. Nuestros resultados fueron consistentes al definir la continuidad: una toma sin cortes o una lista numerada de tomas.

Para una sola toma

Di «no cuts» y marca los tiempos

Empieza con «one continuous take, no cuts, no transitions», asigna a cada bloque de segundos una acción y un verbo de cámara, mantén un único sujeto principal y escribe el sonido en su propia frase.

UNA SOLA TOMA CONTINUA, SIN CORTES, SIN TRANSICIONES, 30 s. Fotorrealismo cinematográfico, alto contraste. Una intérprete de ópera de Pekín con maquillaje de rostro pintado y túnica carmesí y dorada.
0–6 s: primer plano extremo en un espejo de camerino rodeado de bombillas; abre los ojos.
6–16 s: camina por un pasillo estrecho de backstage, los tramoyistas se apartan, la cámara retrocede frente a ella mientras los tambores crecen.
16–24 s: atraviesa pesadas cortinas de terciopelo rojo hacia una luz cegadora; la cámara gira tras su hombro.
24–30 s: la revelación: un teatro lleno bajo farolillos rojos; levanta una manga de agua mientras suena un gong.
Sonido: tambores creciendo, pasos, el roce de la cortina, un gong, aplausos. Sin diálogos, sin texto en pantalla.
Nombra las referencias
Imagen 1, Vídeo 1, Audio 1 —numerados por tipo según el orden de adjunto— y especifica su función: «La Imagen 1 es el personaje; el Vídeo 1 es el movimiento de cámara».
Dirige el sonido
Por defecto, el modelo crea diálogos, música y efectos. Pide lo que quieras —«lluvia y un tranvía lejano, sin diálogos»— o apaga el interruptor de Audio para un archivo mudo.
Prioriza la fidelidad
Dada una imagen, el modelo mantiene su contenido. Para cambios drásticos (clima, vestuario), descríbelos explícitamente en lugar de esperar que el prompt anule la imagen automáticamente.
Un solo protagonista
Una sola figura, una trayectoria de cámara definida y las palabras «no cuts» nos dieron tomas limpias siempre. Las multitudes y objetos pequeños son donde los modelos de vídeo suelen perder precisión.
Bocetos baratos, entregas premium
480p usa el mismo modelo a un cuarto del precio de 1080p. Valida la historia en 480p y luego re-renderiza el resultado ganador en 1080p con el mismo prompt.

Wan 3.0 vs Seedance 2.5 vs Gemini Omni 1.1 Flash

Tres modelos en Popcraft que generan sonido con la imagen. La ventaja de Wan es la toma de 30 segundos más barata y la fidelidad a la referencia; la de Seedance es el número de referencias y edición; la de Omni es 4K y 40 segundos por extensión. Elige según el trabajo.

CapacidadWan 3.0Seedance 2.5Gemini Omni 1.1 Flash
Clip más largo en una solicitud30 s en una pasada30 s40 s por extensión (30 s en 4K)
Resoluciones480p / 720p / 1080p a 30 fpsHasta 1080p360p (borrador) hasta 4K
Audio nativoDiálogo, música, efectos; desactivableHabla, música, efectos de sonido
Imágenes de referenciaHasta 4Hasta 30Hasta 10
Vídeos de referenciaHasta 5, 15 s en totalHasta 10Hasta 3
Audio de referenciaHasta 5, 15 s en totalHasta 10
Editar o extender clip— (usa Seedance 2.5 u Omni)Editar; extender antes o despuésEditar; extender en bloques de 10 s
Borrador de 30 segundos330 créditos en 480pPor segundo, según resolución150 créditos en 360p

Las cifras de Wan son de la guía oficial de Alibaba; los límites de Popcraft son los actuales del selector. Las comparativas completas: Seedance 2.5 · Gemini Omni 1.1 Flash.

Precios de Wan 3.0 en Popcraft

Facturación por segundo entregado, según resolución. Las referencias son gratuitas. Como la duración entregada coincide con la solicitada, el precio que ves antes de generar es el que pagas.

480p
11 créditos / s
Borradores
30 s = 330 créditos
720p
20 créditos / s
Redes sociales
15 s = 300 créditos
1080p
40 créditos / s
Contenido principal
30 s = 1.200 créditos

Todos los planes incluyen créditos; la página de precios detalla las tarifas actuales. Las descargas del nivel gratuito llevan marca de agua de Popcraft.

Para qué recomienda Alibaba Wan 3.0

Tres escenarios del material oficial de Alibaba y cómo ejecutarlos en Popcraft.

  • 01

    Vídeo corto: dramatización de tramas y teasers publicitarios

    Escenario de entretenimiento. Hasta 30 segundos de narrativa multiescena con un solo prompt, sonido incluido.

  • 02

    E-commerce: vitrina de producto desde una imagen

    Sube una imagen de producto más una descripción y obtén una presentación dinámica. Adjunta la foto como Imagen 1.

  • 03

    Educación: simulaciones de escenarios

    Consulta médica o llamada de soporte recreada desde un prompt, con el diálogo generado por la IA.

  • 04

    Boceta en 480p, entrega en 1080p

    Añadido de Popcraft: 11 créditos por segundo en 480p permiten validar la historia por solo 330 créditos antes de pasar a 1080p.

Wan 3.0 — Preguntas frecuentes

El modelo de vídeo integral de Alibaba (Tongyi Lab). Cubre texto-a-vídeo, imagen-a-vídeo y generación multireferencia, produciendo clips de hasta 30 segundos a 30 fps con diálogos, música y efectos de sonido integrados.

Cualquier segundo completo de 2 a 30, en una sola pasada. En Popcraft ajustas la duración con un deslizador y el archivo coincide exactamente con lo solicitado. Pagas solo por esos segundos.

Sí, por defecto. Emite nativamente diálogos, música y efectos. El interruptor de Audio en Popcraft permite desactivarlo si prefieres un clip mudo.

Puedes adjuntar hasta 4 imágenes, 5 vídeos y 5 audios. Las imágenes definen sujetos u objetos; los vídeos, el movimiento y la cámara; el audio, el timbre de voz o el ritmo. Los vídeos y audios tienen un tope de 15 segundos en total.

Es su fuerte. Alibaba destaca la consistencia de apariencia, ropa y entorno como capacidad principal. Wan 3.0 prioriza la imagen de referencia que le des.

Aún no en Popcraft. Wan 3.0 usa clips adjuntos como referencia de movimiento; para extender metraje, usa Seedance 2.5 o Gemini Omni.

Las referencias de audio aportan el timbre, pero la frase se escribe en el prompt. El modelo genera el habla y el movimiento labial a la vez. No es una herramienta de «animar esta grabación»; para eso usa OmniHuman.

Se factura por segundo entregado: 11 créditos a 480p, 20 a 720p y 40 a 1080p. Un borrador de 30 segundos a 480p cuesta 330 créditos.

Treinta segundos, una solicitud. Pruébalo primero en 480p.

Crea tu borrador por 330 créditos, juzga la historia y renderiza el ganador en 1080p.

Sigue explorando

Modelos relacionados