Seedance 2.5 · ByteDance
Treinta segundos, en una sola generación
Un anuncio entero, una demostración de producto o el ritmo de una escena se obtienen como una única generación de treinta segundos en lugar de cinco clips y una unión, cohesionados por hasta cincuenta recursos de referencia y editados después sin volver a generar.
Disponible en Popcraft, junto a Seedance 2.0.
Treinta segundos, dos veces
Dos de las películas de demostración de la propia ByteDance, con la duración para la que se ha diseñado el modelo. Cada una es una sola generación: imagen, cambios de cámara y sonido llegan a la vez, sin nada montado a posteriori.
En qué fijarse
Las cuatro mejoras son los detalles que deciden si una toma se percibe como metraje real o como un resultado generado.
Luz que se adapta a la estancia
Los destellos de luz en los ojos se perciben como cristal con profundidad, mientras que la dirección, el atenuamiento y el rebote siguen la física de la escena en lugar de parecer pintados.
Movimientos que mantienen su línea
Las trayectorias de avance, retroceso, panorámica e inclinación resultan más fluidas y estables, que es lo que hace que un movimiento de treinta segundos aguante sus treinta segundos de duración.
La expresión como una curva
Microexpresiones —un temblor en el ojo, una presión en los labios— transmitidas como un movimiento continuo a lo largo de todo un pulso en lugar de saltar entre poses.
Piel, pelo y el valle inquietante
Textura de la piel, brillo del pelo y pequeños movimientos faciales más parecidos a los que graba una cámara, reduciendo el aspecto de plástico que delata a los rostros generados.
Cambian cuatro cosas, y solo una de ellas es la duración
2.5 avanza en cuatro ejes: generaciones más largas, referencias más ricas, edición precisa y creación multilingüe. La duración es el titular. La edición es el cambio que realmente se nota en la jornada laboral.
Treinta segundos a partir de una sola generación
Hasta treinta segundos en una sola generación, manteniendo el movimiento de cámara, la continuidad y un arco narrativo completo a lo largo de todo el clip. Seedance 2.0 tiene un límite de quince. La extensión temporal de alta fidelidad permite después extender un clip corto hacia adelante, hacia atrás o conectar dos de ellos.
Todo lo que necesita el plano, en una sola instrucción
Se pueden incluir treinta imágenes, diez clips de vídeo y diez clips de audio en una sola generación: reparto, producto, ubicación, comportamiento de la cámara, música y voz, todo junto. En la versión 2.0, el límite era de nueve imágenes y tres clips.
Cambia un detalle, conserva el clip
La edición de vídeo controlable mantiene el encuadre, la cámara y el ritmo, y rediseña únicamente lo que especifiques: un fondo, una prenda, un producto, la expresión de un actor o la música. Un defecto en unos buenos treinta segundos deja de ser motivo para volver a generarlos.
Descríbelo con tus propias palabras
Chino, inglés, español, indonesio, malayo, tailandés, árabe, portugués, vietnamita, japonés y coreano, entre otros, de forma nativa: ya no hace falta traducir el prompt antes de que el modelo lo lea. La comprensión y ejecución de instrucciones es superior en todos los aspectos.
2.5 junto a 2.0, fila por fila
Seedance 2.0 se mantiene en el catálogo, y en 4K sigue siendo la herramienta adecuada para una toma corta.
| Capacidad | Seedance 2.0 | Seedance 2.5 |
|---|---|---|
| Generación única más larga | 15s | 30 s |
| Imágenes de referencia | 9 | 30 |
| Clips de vídeo y audio de referencia | 3 | 10 de vídeo + 10 de audio |
| Duración total de referencia | 15s | 30 s de vídeo, 30 s de audio, contabilizados por separado |
| Referencia solo de audio | — | Soportado |
| Marcas de tiempo en el prompt | Solo números de plano | Marcas de tiempo en segundos completos |
| Imágenes multivista del sujeto | No recomendado | Soportado |
| Relación de aspecto de salida | Seis proporciones fijas | Cualquier relación de 0,4 a 2,5, establecida por la entrada |
| Salida MOV, para edición y extensión | — | Soportado — continuidad de color y audio en una unión |
Cada recurso cumple una función
La cantidad es la parte fácil. Lo que lo hace útil es que cada recurso se adjunta con una @ y se le asigna un rol determinado, de modo que el modelo sabe qué imagen es el actor y cuál es la luz.
Hasta 4K, 30 MB cada una. JPEG, PNG, WebP, BMP, TIFF, GIF, HEIC, HEIF. Los conjuntos multivista del mismo sujeto son compatibles en 2.5, mientras que en 2.0 no se recomendaban.
De 480p a 4K, 200 MB cada uno, de 2 a 30 s por clip, MP4 o MOV. Los clips comparten un total de treinta segundos.
15 MB cada uno, de 2 a 30 s por clip, MP3 o WAV, con su propio total independiente de treinta segundos. Las referencias solo de audio son una novedad en 2.5: una base musical, una voz o una pista de efectos pueden marcar el ritmo, el ajuste de compás y la sincronización labial por sí solas.
Lo que se le puede pedir que aporte una referencia
- Sujeto
- El aspecto o la voz de una persona, animal, producto, objeto de atrezzo, ubicación o personaje inventado —aquello que tiene que mantenerse idéntico durante todo el clip.Usa a la mujer de @image 1 como protagonista, caminando por una calle de la ciudad al atardecer.
- Movimiento
- Acción, movimiento de cámara, temporización y efectos extraídos de un clip y aplicados a un sujeto diferente. Se transfiere entre especies y estilos, no solo entre tomas.Sigue el movimiento de cámara y el ritmo de carrera de @video 1; el sujeto es @image 1.
- Modelo blanco
- Un modelo básico 3D sin texturas dirige la coreografía de la cámara y la puesta en escena; los materiales finalizados, la iluminación y la atmósfera proceden de imágenes fijas. La geometría esquemática funciona mejor aquí que un modelo detallado.Renderiza el movimiento en el modelo en blanco @video 1; sujeto @image 1, escena @image 2.
- Estilo
- Paleta, etalonaje y textura tomados de una imagen o un clip, mientras que el reparto sigue siendo el tuyo.Usa el etalonaje nocturno en azul frío de @video 1, manteniendo a la protagonista de @image 1.
- Audio
- Música, melodía, diálogo o timbre vocal. Asigna una voz por personaje y el vídeo responderá hablando con ella.La voz del padre: grave, pausada, de mediana edad. Referencia @audio 1.
- Guion gráfico
- Un guion gráfico de varias viñetas interpretado como un esquema de la trama. Quince viñetas o menos, preferiblemente un boceto de líneas en lugar de un tablero renderizado, y sin texto dibujado dentro de las viñetas. El resultado sigue la historia, no el dibujo fotograma a fotograma.Sigue los cuatro paneles de @image 1; el personaje es @image 2.
- Fotogramas clave
- Una imagen como primer fotograma, dos como primero y último, o un conjunto de fotogramas clave independientes. A diferencia de un guion gráfico, el resultado los sigue de cerca.@image 1 es el primer fotograma, @image 5 el último; hazla caminar desde el interior hacia el exterior.




El reintento deja de ser la única opción
Ambas funciones toman un clip finalizado como @video 1 y dejan intacto todo lo que no menciones. La edición reescribe parte de lo que ya está ahí. La extensión escribe lo que va antes o después.


Reescribe una región y conserva el resto
Añade un sujeto, elimina uno, cambia una prenda o una escena respecto a una imagen de referencia o modifica el audio: un fondo musical distinto, un efecto añadido o una frase de nuevo locutada. Las marcas de tiempo limitan la edición a un intervalo: 0:02–0:05, y nada fuera de él se mueve.
El patrón que funciona consta de tres partes: señalar la fuente, nombrar el objeto y el cambio, y añadir una cláusula de conservación para que el modelo no modifique el resto del fotograma.
Sustituye la ropa oscura del hombre en @video 1\npor la ropa de @image 2.\nMantén todo lo demás sin cambios.
Escribe lo que va antes y después
Extiende hacia adelante desde el último fotograma, hacia atrás hasta el momento previo al primero o genera el nexo que falta entre dos clips para conectarlos. El personaje, la escena y la cámara se mantienen a lo largo de la unión, y se puede solicitar que la transición sea fluida tanto en imagen como en sonido.
La extensión es la forma en que seis segundos potentes se convierten en treinta terminados sin necesidad de volver a generar la parte que ya funciona. La opción recomendada es utilizar MOV de entrada y MOV de salida, ya que mantiene la coherencia de color, brillo y audio en toda la unión.
Comienza desde el fotograma final de @video 1 y extiende\n6 segundos: ella sale de encuadre, el cielo se oscurece\ny las farolas se encienden una a una. Mantén una transición fluida.
Lo que la entrada decide por ti
2.5 divide las tareas según si los recursos de origen fijan la forma del resultado. 2.0 no establece esa distinción, y esta es la parte que más suele sorprender a quien cambie de versión.
| Tarea | Relación de aspecto | Duración |
|---|---|---|
| Edición | Bloqueado al clip de origen | Sigue al original, con un margen de aproximadamente un tercio de segundo |
| Primer fotograma, o primero y último | Bloqueado a la imagen del primer fotograma | A tu elección |
| Extensión | Bloqueado al clip de origen | A tu elección |
| Generación de referencia | Abierta | A tu elección |
| Guiones gráficos y fotogramas clave | Abierta | A tu elección |
Dónde sacarle partido a treinta segundos
Los casos de uso del modelo se dividen en cinco familias. Cuatro de ellas son tareas que se acortan. La quinta solo es posible cuando una generación dura tanto tiempo.
Una escena que se desarrolla
Un giro argumental que se desarrolla por completo en una sola generación, con un reparto unificado mediante una serie de imágenes de referencia. Las correcciones de continuidad (un soporte visible, un objeto fuera de lugar) se convierten en una edición en lugar de una nueva filmación.
Un máster y, después, cada versión
Un montaje maestro y, después, versiones: cambia el SKU, el modelo, el texto en pantalla o el mercado, con la apariencia del producto y la estética de la marca fijadas por referencia. La locución se adapta a los idiomas que necesites.
Toda la idea en una sola toma
Una idea explicada de principio a fin en treinta segundos, un presentador cambiado sin volver a grabar y el mismo conjunto distribuido en varios idiomas.
Un procedimiento, de principio a fin
Pasos de montaje y funcionamiento mostrados de principio a fin, con placas identificativas, paneles de especificaciones y texto de embalaje reescritos por producto y la toma intacta.
El trabajo que quince segundos rechazaban
Tráileres de juegos y CG, presentadores virtuales, un cortometraje ampliado a serie o un personaje envejecido o rediseñado para una entrega de temporada.
Escríbelo como una lista de tomas
Trata al modelo como a un productor que lee un briefing estructurado. La estructura de abajo es la que se conserva al compartirse con otra persona.









Cinco partes, en este orden
Sujeto, ubicación, evento, género y estilo, movimiento de cámara. A continuación, una secuencia de tomas (se admiten marcas de tiempo en segundos completos o tomas numeradas) que describe por segmento lo que se ve, cómo se mueve la cámara, qué se dice y qué se oye. Concluye con las constantes: el ángulo, el entorno, la atmósfera y el sonido de fondo.
Mantén aproximadamente un segundo de historia por cada segundo de pantalla. Si hay muy poco en una ventana, el modelo improvisa; si hay demasiado, corta de forma frenética o desecha la mitad.
Mapea cada uno en el texto
Enumera los recursos en el orden de carga y vincula cada uno en el prompt: cuál es el sujeto, cuál la voz, cuál la acción y cuál la escena. Escribir un nombre en la imagen y usarlo en el prompt es la forma fiable de obtener dos personajes iguales.
Si una referencia ya es precisa, indica que se siga y detente ahí. Volver a describir el movimiento que contiene le da al modelo dos instrucciones que conciliar.
img1–2 son el personaje 1, con la voz de @audio 1;\nimg3–4 son el personaje 2, con la voz de @audio 2.\nSigue la acción de lanzamiento de hechizo de @video 1 y el\nmovimiento de órbita de @video 2.
- Lenguaje de cámara
- Los términos estándar se incluyen tal cual: tipos de plano, zoom de acercamiento, zoom de alejamiento, panorámica, seguimiento, órbita, contrapicado, plano secuencia, dolly zoom, cámara en mano o cambio de velocidad. Un término muy específico requiere una explicación sencilla a continuación, mientras que una transición debe indicar tanto su punto de activación como su método.
- Acción y expresión
- Describe la mayor parte de la acción a grandes rasgos y reserva los detalles para los dos o tres momentos clave que deban destacar. Las expresiones se interpretan mejor si se describen con palabras que si se nombran mediante modismos.
- Positivo frente a negativo
- Indica lo que debe aparecer. Las indicaciones negativas solo se tienen en cuenta cuando se refieren a subtítulos y audio (sin subtítulos, sin música de fondo), que son además los dos elementos que el modelo suele añadir sin que se lo pidan.
- Sonido
- El ambiente, los efectos, el diálogo y la banda sonora se pueden definir a partir de una referencia de audio y describir en el resumen, indicando incluso cuál de ellos debe ceder paso cuando alguien habla.
Lo que cuesta un segundo de 2.5
Seedance 2.5 se factura por segundo de vídeo generado, a la resolución que elijas. Las tarifas según el nivel del plan se aplican automáticamente: el descuento está vinculado al plan y se aplica en cada generación.
Lo que cuesta una generación de Seedance 2.5 a 720p en la facturación estándar. 480p funciona a 24 créditos por segundo: la forma más económica de iterar antes de un pase final.
−20 % en la facturación mensual. El descuento se aplica a cada generación de Seedance, no solo una vez.
−40 % en la facturación mensual. La tarifa más reducida, y la razón por la que merece la pena ejecutar dos veces una generación de treinta segundos.
Preguntas
Sí — Seedance 2.5 ya está disponible en el selector de modelos de vídeo de Popcraft. Elígelo junto a Seedance 2.0, establece una duración de hasta treinta segundos y genera.
No. Seedance 2.0 y Seedance 2.0 4K siguen estando en la lista de modelos. Un plano de producto de seis segundos no necesita un límite máximo de treinta segundos, y la exportación en 4K es una razón para elegir 2.0 para ello. Lo que añade 2.5 es la duración, la cantidad de referencias y la posibilidad de editar un clip que ya tengas.
Cincuenta es el límite máximo y se recomienda mantenerse muy por debajo: ocho o menos sujetos de imagen, cinco o menos cuando las referencias principales sean de audio o vídeo, clips de cinco a diez segundos y guiones gráficos de quince viñetas o menos. A partir de ahí, la estabilidad disminuye y las generaciones empiezan a requerir repeticiones.
Coge un clip que ya te guste y extiéndelo. La extensión es la prueba más barata de esta afirmación, porque parte de metraje que ya has juzgado. Si la costura aguanta —el rostro, el etalonaje, la velocidad de la cámara—, vale la pena dedicar una generación más larga al resto de las promesas del modelo. Si no aguanta, lo habrás aprendido al precio de unos pocos segundos.
Treinta segundos son todo el anuncio
La unión entre dos clips de quince segundos es donde una película generada se delata. Seedance 2.5 hace que esa unión sea opcional.
Sigue explorando
Modelos relacionados
MiniMax H3 genera vídeo 2K a 24 fps con banda sonora estéreo sincronizada: efectos, ambiente y diálogos en un solo proceso. Multitoma desde un solo prompt, 5 a 15 segundos, control de primer y último fotograma. Ya en Popcraft.
Genera video cinematográfico en 4K a partir de texto, imágenes o clips con Seedance 2.0 en Popcraft. Audio sincronizado nativo, secuencias multi-toma y detalle nítido hasta 4K (2160p).

Seedance 2.0 Mini es el nivel de vídeo más ligero de ByteDance: hasta un 50 % más económico que Seedance 2.0 estándar y aprox. 2 veces más rápido que Fast, con prompts de texto, imagen, vídeo y audio. Ya disponible en Popcraft.

Convierte imágenes y prompts en vídeo cinematográfico con Seedance 2.0 en Popcraft. Generación de vídeo a partir de referencias, primer/último fotograma y resultados en múltiples relaciones de aspecto en hasta 4K.
