NEWВаша следующая вирусная UGC-реклама всего в одном клике. Встречайте Studio.Создать рекламу
PopcraftPopcraft
Новая видеомодель

Alibaba · Tongyi Lab

Wan 3.0: 30-секундные ИИ-видео за один проход, со своим звуком

Wan 3.0 — это универсальный ИИ-генератор видео от Alibaba. Он превращает промпт, изображение или набор референсов в видео любой длины от 2 до 30 секунд по одному запросу, в разрешении до 1080p при 30 fps, и создает диалоги, музыку и звуковые эффекты в рамках того же задания. На Popcraft стоимость начинается от 11 кредитов в секунду.

В видеостудии, на досках Canvas и через MCP-коннектор

2–30 с
любая целая секунда, один проход
1080p 30 fps
также доступны уровни 480p и 720p
4 · 5 · 5 реф.
изображения, клипы, аудио
11 кр / с
в 480p — 330 за 30 с
00секунд, один дубль
один дубль · сгенерированный звук · без монтажа

Нативная длительность 30 с

Первая ключевая особенность от Alibaba: «более целостное повествование и творческая свобода» благодаря нативному 30-секундному проходу. Выше показан главный фильм в шести точках таймлайна, а также данные о времени ожидания и параметрах файлов для клипов, созданных для этой страницы.

1-я секунда: экстремально крупный план накрашенного лица актрисы в зеркале гримерной1s
6-я секунда: она встает перед зеркалом в алом с золотом одеянии6s
12-я секунда: закулисный коридор, рабочие сцены прижимаются к стенам, когда она проходит мимо12s
18-я секунда: ее рука на красном бархатном занавесе18s
24-я секунда: сквозь занавес к свету софитов, за спиной открывается зал с фонарями24s
29-я секунда: взмах длинного рукава перед полным залом под красными фонарями29s
Одна актриса, одно одеяние, единая цветокоррекция от зеркала до сцены — гримерная, коридор, занавес, полный зал за один непрерывный запрос.
Получено против запрошенного
ЗапросРезультатВремя ожидания
30 с · 1080p · только текст30.02 с · 1920×1080 · стерео5 мин 38 с
5 с · 720p · только текст5.04 с · 1280×720 · стерео1 мин 37 с
3 с и 10 с · на базе 6-секундного референса3.02 с и 10.03 с · клип задал движение, а не длину≈ 1 мин 25 с каждый

Время ожидания — это период от нажатия кнопки до получения файла на Popcraft (сентябрь 2026). Каждый клип соответствовал запросу с точностью до сотых долей секунды, поэтому количество кредитов, которое вы видите перед генерацией, совпадает с итоговым расходом.

Эффект погружения: реализм, текстура и саунд-дизайн

По словам Alibaba: «повышенный реализм, детализация текстур и проработка звука». Три фильма, три стиля — игровое кино, качественная CG-графика, брендовая фантазия. Каждый — один запрос, один непрерывный дубль, 30 секунд, с саундтреком, сгенерированным одновременно с видео. Менялся только промпт.

Игровое кино30.0s1 takelive action

Занавес

Главный ролик выше: путь актрисы Пекинской оперы от зеркала через закулисье к полному залу. Нарастает бой барабанов, удар гонга, зал взрывается аплодисментами.

Полнометражная CG30.0s1 take3D-CG look

Дух лисицы

Девятихвостая лисица мчится по крышам, освещенным фонарями, прыгает через провал, замирая на фоне полной луны, и приземляется на колокольню, пока в городе взлетают тысячи огней. Художественный 3D-стиль только из текстового промпта.

Брендовая фантазия30.0s1 takebrand fantasy

Вендинговый автомат

Девочка в желтом дождевике нажимает кнопку в дождливом переулке, и ее затягивает сквозь стекло в яркий мир, где маскот протягивает ей банку напитка. Шипение газировки превращается в фейерверк, и камера возвращается в переулок.

Все фильмы здесь показаны в исходном виде: без монтажа и наложенной музыки. Черновики в 480p стоят 330 кредитов каждый; 1080p — 1200.

Что такое Wan 3.0?

Wan 3.0 (万相 3.0) — это видеомодель от лаборатории Alibaba Tongyi Lab, находящаяся в публичном бета-тестировании с 6 августа 2026 года и запущенная 24 августа. Alibaba называет ее универсальной референсной моделью: одна модель для текста в видео, изображения в видео, управления первым и последним кадрами и генерации из смешанных референсов вместо отдельных моделей для каждой задачи. Доступ предоставляется только через API — открытых весов нет, и Popcraft использует версию Prime, более быструю из двух предлагаемых Alibaba.

Руководство Alibaba Cloud Model Studio и API-справочник для wan3.0-video; официальный README репозитория Wan 3.0; обзор запуска от сообщества разработчиков Alibaba. Утверждения выше принадлежат Alibaba; измерения на этой странице — наши собственные.

Словами Alibaba
  1. Стабильно генерирует до 30 секунд видео за один запрос при 30 кадрах в секунду.

    Длина

  2. Нативно создает диалоги, фоновую музыку и звуковые эффекты — без постпродакшн-озвучки.

    Звук

  3. Стабильность внешности персонажей, одежды, реквизита, окружения и визуального стиля; наезды, отъезды, панорамирование и слежение камеры.

    Стабильность и камера

Пять главных особенностей от Alibaba
  1. Нативная длительность 30 сБолее целостное повествование и творческая свобода.На Popcraft: любая длина от 2 до 30 секунд за один проход.
  2. Омни-креацияДо 20 референс-активов с парсингом документов и веб-страниц.На Popcraft: 4 изображения, 5 клипов, 5 аудио. Документы и веб-страницы пока не поддерживаются.
  3. Пиксельная стабильностьПовышение уверенности в результате для производственных процессов.На Popcraft: да — см. кадры ниже.
  4. Эффект погруженияПовышенный реализм, текстура и саунд-дизайн.На Popcraft: да — диалоги, музыка и эффекты генерируются вместе с картинкой.
  5. Точное редактирование видеоБолее контролируемое редактирование для повышения эффективности.Пока не на Popcraft — используйте Seedance 2.5 или Gemini Omni для правки или расширения.

Омни-креация: фото, видео и звук в одном промпте

Вторая ключевая особенность Alibaba — генерация на основе мультимодальных данных. На Popcraft это до 4 изображений, 5 видеоклипов и 5 аудиофайлов в одном запросе. Называйте их в промпте Image 1, Video 1 или Audio 1 в порядке прикрепления. Платформа Alibaba также умеет анализировать документы и веб-страницы; эта функция появится на Popcraft позже.

Image 1 … Image 4

Персонажи, продукты и локации

Лист персонажа фиксирует лицо и гардероб; фото продукта — объект; фото локации — декорации. Модель сохраняет то, что на картинке, поэтому описывайте изменения явно. Два изображения с пометками «первый кадр» и «последний кадр» в промпте станут ключевыми кадрами.

JPEG, PNG, WEBP или BMP · от 240 до 8000 px по стороне · по 20 МБ каждое

Женщина с Image 1 идет по улице с Image 2 в сумерках, камера следует сбоку. Сохраните ее волосы, пальто и сумку в точности как на Image 1.
Video 1 … Video 5

Движение, камера и игра

Клип переносит траекторию камеры, мизансцену и актерскую игру в новый кадр. Совместите его с фото, и персонаж с фото повторит движение из клипа в тех же декорациях. Клип задает характер движения, а не длину — длину выставляет слайдер.

MP4 или MOV · от 1 до 15 с каждое и до 15 с в сумме · по 100 МБ каждое

Мужчина с Image 1 стоит между колоннами. Точно повторите движение камеры из Video 1: низкий широкий угол с облетом вправо до крупного плана в три четверти.
Audio 1 … Audio 5

Тембр голоса или ритм трека

Рецепт от Alibaba: аудио несет голос или ритм, а текст реплики пишется в промпте; модель генерирует речь и мимику губ одновременно. Это не инструмент для «переозвучки» готового видео — для этого используйте аватар-модели, например OmniHuman.

WAV или MP3 · от 1 до 15 с каждое и до 15 с в сумме · по 15 МБ каждое

Возьмите тембр из Audio 1 и заставьте персонажа сказать: «Правда? Звучит отлично — когда ты вернешься?» Сгенерированная речь управляет естественным движением губ.

Ключевые кадры и референсы не смешиваются. Два изображения, помеченные как первый и последний кадр, создают клип по ключевым кадрам; всё остальное — персонажи, клипы, аудио — сочетается свободно в пределах лимитов.

Пиксельная стабильность

Третья особенность от Alibaba: «повышение предсказуемости результата для рабочих процессов» — в описании модели это названо сохранением деталей персонажа и референса между кадрами. Та же актриса из главного фильма в трех точках с интервалом в 28 секунд.

Накрашенное лицо актрисы в зеркале гримерной на 1-й секунде1 с
Та же актриса в закулисном коридоре на 12-й секунде12 s
Та же актриса на сцене перед полным залом на 29-й секунде29 s
То же лицо, тот же головной убор, то же платье от зеркала до сцены. Прикрепите лист персонажа или фото продукта как Image 1, и модель сохранит детали; в наших тестах квадратное фото продукта было точно воспроизведено в кадре 16:9, а 6-секундный референс-клип управлял результатом в 3 и 10 секунд без изменения объекта.

Как писать промпты для Wan 3.0

Модель планирует весь клип на основе промпта, поэтому в нем должно быть указано, что это за клип. Наши генерации оставались стабильными, когда мы задавали структуру — один непрерывный кадр или нумерованный список сцен. Остальное следует из этого.

Для одного дубля

Укажите «no cuts», затем распишите тайминг

Начните с «one continuous take, no cuts, no transitions», дайте каждому отрезку времени свое действие и глагол движения камеры, держите одного главного героя в кадре и опишите звук отдельным предложением. Главный ролик был написан именно так и получился без единой склейки.

ONE CONTINUOUS TAKE, NO CUTS, NO TRANSITIONS, 30 s. Cinematic photoreal, high contrast. A Beijing-opera performer in painted-face makeup and a crimson-and-gold robe.
0–6 s: extreme close-up in a dressing-room mirror ringed with bulbs; she opens her eyes.
6–16 s: she walks down a narrow backstage corridor, stagehands flattening against the walls, the camera tracking backwards ahead of her as drums build.
16–24 s: she pushes through heavy red velvet curtains into blinding stage light; the camera swings behind her shoulder.
24–30 s: the reveal — a packed theatre under red lanterns; she raises one water-sleeve as a gong strikes.
Sound: drums building, footsteps, the curtain rush, one gong, applause. No dialogue, no on-screen text.
Называйте референсы
Image 1, Video 1, Audio 1 — нумеруйте по типу в порядке прикрепления — и указывайте роль каждого: «Image 1 is the character; Video 1 is the camera move».
Управляйте звуком
По умолчанию модель создает диалоги, музыку и эффекты. Опишите, что вам нужно — «rain and a distant tram, no dialogue» — или выключите переключатель Audio для беззвучного файла.
Точность против креативности
При наличии изображения модель сохраняет его детали. Для серьезных изменений — погоды, одежды, смены декораций — описывайте их явно, не ожидая, что промпт просто «пересилит» картинку.
Один главный объект
Один персонаж, заданный путь камеры и фраза «no cuts» давали нам чистый дубль каждый раз. Толпы, кисти рук и мелкие предметы — это те моменты, где любая видеомодель, включая эту, может терять четкость.
Черновик — дешево, финал — качественно
480p — это та же модель за четверть цены от 1080p. Проверьте сюжет в 480p, а затем перегенерируйте удачный вариант в 1080p с тем же промптом и референсами.

Wan 3.0 vs Seedance 2.5 vs Gemini Omni 1.1 Flash

Три модели на Popcraft, которые создают звук вместе с видео. Преимущество Wan — самый дешевый 30-секундный дубль и точное следование референсу; Seedance — количество референсов и монтаж; Omni — 4K и 40 секунд. Выбирайте под задачу.

ВозможностьWan 3.0Seedance 2.5Gemini Omni 1.1 Flash
Макс. клип за один запрос30 с за один проход30 с40 с через расширение (30 с в 4K)
Разрешение480p / 720p / 1080p при 30 fpsДо 1080pОт 360p (черновик) до 4K
Нативный звукДиалоги, музыка, эффекты; отключаемоДаРечь, музыка, звуковые эффекты
Изображения-референсыДо 4До 30До 10
Видео-референсыДо 5, 15 с всегоДо 10До 3
Аудио-референсыДо 5, 15 с всегоДо 10
Правка или расширение— (используйте Seedance 2.5 или Omni)Правка; расширение до/послеПравка; расширение шагами по 10 с
30-секундный черновик330 кредитов в 480pПосекундно, от разрешения150 кредитов в 360p

Данные для Wan взяты из руководства Alibaba Model Studio; лимиты Popcraft — это то, что доступно в интерфейсе сегодня. Потолки провайдеров меняются; в интерфейсе всегда указаны актуальные данные. Полные сравнения: Seedance 2.5 · Gemini Omni 1.1 Flash.

Цены на Wan 3.0 на Popcraft

Оплата производится посекундно за готовый файл, в зависимости от разрешения. Референсы прикрепляются бесплатно. Поскольку длина видео соответствует запросу, цена, которую вы видите перед генерацией — это финальная стоимость.

480p
11 кредитов / с
Черновики
30 с = 330 кредитов
720p
20 кредитов / с
Соцсети
15 с = 300 кредитов
1080p
40 кредитов / с
Главные креативы
30 с = 1 200 кредитов

В каждый тарифный план включены кредиты; на странице цен указаны текущие ставки для всех моделей. На скачиваниях бесплатного уровня ставится водяной знак Popcraft, в платных планах он отсутствует.

Для чего Alibaba рекомендует Wan 3.0

Три сценария из материалов Alibaba и способы их реализации на Popcraft.

  • 01

    Короткие видео: инсценировка сюжетов и рекламные тизеры

    Развлекательный сценарий Alibaba. До 30 секунд многопланового повествования из одного промпта, включая звук.

  • 02

    E-commerce: демонстрация продукта на основе фото

    Сценарий для электронной коммерции — «загрузите фото товара и описание, получите динамичную презентацию». Прикрепите фото как Image 1.

  • 03

    Образование: симуляция сценариев

    Образовательный сценарий Alibaba — консультация врача или звонок в поддержку, созданные по промпту со сгенерированными диалогами.

  • 04

    Черновик в 480p, финал в 1080p

    Дополнение от Popcraft: 11 кредитов за секунду в 480p позволяют сделать 30-секундный черновик за 330 кредитов перед переходом к 1080p.

Wan 3.0 — часто задаваемые вопросы

Это универсальная видеомодель от Alibaba Tongyi Lab, запущенная в августе 2026 года. Одна модель поддерживает генерацию из текста, из фото, контроль ключевых кадров и мульти-референсы. Она создает видео любой длины от 2 до 30 секунд за один проход при 30 fps, генерируя диалоги, музыку и звуковые эффекты одновременно с изображением.

Любая целая секунда от 2 до 30 за один проход — без склеек и расширений. На Popcraft вы задаете длину слайдером, и файл точно соответствует запросу; в наших тестах отклонение составляло не более сотых долей секунды.

Да, по умолчанию. Модель нативно выводит диалоги, музыку и эффекты, позволяя задавать реплики прямо в промпте. Переключатель Audio на Popcraft позволяет получить файл без звуковой дорожки.

Прикрепите до 4 фото, 5 видео и 5 аудио и сошлитесь на них в промпте как Image 1, Video 1, Audio 1 и т. д. Изображения задают персонажа или сцену, видео — движение, аудио — голос или ритм. Видео и аудио ограничены 15 секундами в сумме. Режим ключевых кадров (первый и последний кадр) несовместим с другими референсами.

Да, это одна из сильных сторон модели. Alibaba заявляет о высокой стабильности внешности, одежды и окружения. В наших тестах персонажи сохраняли идентичность на протяжении 30-секундного дубля. Модель отдает приоритет загруженному изображению, поэтому любые изменения нужно описывать очень детально.

На Popcraft сейчас — нет. Wan 3.0 использует клипы как референс для движения; для редактирования или продления футажа используйте Seedance 2.5 или Gemini Omni 1.1 Flash.

Аудиореференсы в Wan 3.0 передают тембр голоса, а текст реплики берется из промпта; модель сама синтезирует речь и движение губ. Это не инструмент для наложения звука на готовую мимику. Для таких задач используйте аватар-модели, например OmniHuman.

Оплата идет за секунду видео: 11 кредитов в 480p, 20 в 720p и 40 в 1080p. 30-секундный черновик в 480p обойдется в 330 кредитов. Цена всегда видна до начала генерации.

Тридцать секунд, один запрос. Попробуйте сначала в 480p.

Сделайте черновик за 330 кредитов, оцените сюжет, а затем создайте финал в 1080p — или объедините лист персонажа с эталонным движением.

Продолжайте исследовать

Похожие модели

Seedance 2.5
ByteDance

Seedance 2.5 генерирует до 30 секунд видео за один запуск, поддерживает до 50 референсных активов, управляемый видеомонтаж, высокоточное темпоральное расширение, любое соотношение сторон от 0,4 до 2,5 и нативные промпты на более чем 10 языках. Доступно на Popcraft.

Gemini Omni 1.1 Flash
Google

Gemini Omni 1.1 Flash — видеомодель Google, которая создаёт и редактирует видео из любых входных данных. До 40 секунд за счёт расширения сцен, вывод в 1080p и 4K, интерполяция по первому и последнему кадру, до 10 референсных изображений, а также генерация речи, музыки и звуковых эффектов синхронно с картинкой. Доступно на Popcraft.

MiniMax H3
MiniMax

MiniMax H3 создает 2K-видео (24 fps) с синхронным стерео: эффекты, фон и диалоги за один раз. Мультикадр из одного промпта, 5–15 секунд, контроль первого и последнего кадров. Уже на Popcraft.

Seedance 2.0 4K
ByteDance

Генерируйте кинематографическое видео 4K из текста, изображений или клипов с Seedance 2.0 на Popcraft. Нативный синхронизированный звук, многокадровые последовательности и предельная чёткость до 4K (2160p).