Alibaba · Tongyi Lab
Wan 3.0: 30-секундные ИИ-видео за один проход, со своим звуком
Wan 3.0 — это универсальный ИИ-генератор видео от Alibaba. Он превращает промпт, изображение или набор референсов в видео любой длины от 2 до 30 секунд по одному запросу, в разрешении до 1080p при 30 fps, и создает диалоги, музыку и звуковые эффекты в рамках того же задания. На Popcraft стоимость начинается от 11 кредитов в секунду.
В видеостудии, на досках Canvas и через MCP-коннектор
- 2–30 с
- любая целая секунда, один проход
- 1080p 30 fps
- также доступны уровни 480p и 720p
- 4 · 5 · 5 реф.
- изображения, клипы, аудио
- 11 кр / с
- в 480p — 330 за 30 с
Нативная длительность 30 с
Первая ключевая особенность от Alibaba: «более целостное повествование и творческая свобода» благодаря нативному 30-секундному проходу. Выше показан главный фильм в шести точках таймлайна, а также данные о времени ожидания и параметрах файлов для клипов, созданных для этой страницы.
1s
6s
12s
18s
24s
29s| Запрос | Результат | Время ожидания |
|---|---|---|
| 30 с · 1080p · только текст | 30.02 с · 1920×1080 · стерео | 5 мин 38 с |
| 5 с · 720p · только текст | 5.04 с · 1280×720 · стерео | 1 мин 37 с |
| 3 с и 10 с · на базе 6-секундного референса | 3.02 с и 10.03 с · клип задал движение, а не длину | ≈ 1 мин 25 с каждый |
Время ожидания — это период от нажатия кнопки до получения файла на Popcraft (сентябрь 2026). Каждый клип соответствовал запросу с точностью до сотых долей секунды, поэтому количество кредитов, которое вы видите перед генерацией, совпадает с итоговым расходом.
Эффект погружения: реализм, текстура и саунд-дизайн
По словам Alibaba: «повышенный реализм, детализация текстур и проработка звука». Три фильма, три стиля — игровое кино, качественная CG-графика, брендовая фантазия. Каждый — один запрос, один непрерывный дубль, 30 секунд, с саундтреком, сгенерированным одновременно с видео. Менялся только промпт.
Занавес
Главный ролик выше: путь актрисы Пекинской оперы от зеркала через закулисье к полному залу. Нарастает бой барабанов, удар гонга, зал взрывается аплодисментами.
Дух лисицы
Девятихвостая лисица мчится по крышам, освещенным фонарями, прыгает через провал, замирая на фоне полной луны, и приземляется на колокольню, пока в городе взлетают тысячи огней. Художественный 3D-стиль только из текстового промпта.
Вендинговый автомат
Девочка в желтом дождевике нажимает кнопку в дождливом переулке, и ее затягивает сквозь стекло в яркий мир, где маскот протягивает ей банку напитка. Шипение газировки превращается в фейерверк, и камера возвращается в переулок.
Все фильмы здесь показаны в исходном виде: без монтажа и наложенной музыки. Черновики в 480p стоят 330 кредитов каждый; 1080p — 1200.
Что такое Wan 3.0?
Wan 3.0 (万相 3.0) — это видеомодель от лаборатории Alibaba Tongyi Lab, находящаяся в публичном бета-тестировании с 6 августа 2026 года и запущенная 24 августа. Alibaba называет ее универсальной референсной моделью: одна модель для текста в видео, изображения в видео, управления первым и последним кадрами и генерации из смешанных референсов вместо отдельных моделей для каждой задачи. Доступ предоставляется только через API — открытых весов нет, и Popcraft использует версию Prime, более быструю из двух предлагаемых Alibaba.
Руководство Alibaba Cloud Model Studio и API-справочник для wan3.0-video; официальный README репозитория Wan 3.0; обзор запуска от сообщества разработчиков Alibaba. Утверждения выше принадлежат Alibaba; измерения на этой странице — наши собственные.
“Стабильно генерирует до 30 секунд видео за один запрос при 30 кадрах в секунду.”
Длина
“Нативно создает диалоги, фоновую музыку и звуковые эффекты — без постпродакшн-озвучки.”
Звук
“Стабильность внешности персонажей, одежды, реквизита, окружения и визуального стиля; наезды, отъезды, панорамирование и слежение камеры.”
Стабильность и камера
- Нативная длительность 30 с“Более целостное повествование и творческая свобода.”На Popcraft: любая длина от 2 до 30 секунд за один проход.
- Омни-креация“До 20 референс-активов с парсингом документов и веб-страниц.”На Popcraft: 4 изображения, 5 клипов, 5 аудио. Документы и веб-страницы пока не поддерживаются.
- Пиксельная стабильность“Повышение уверенности в результате для производственных процессов.”На Popcraft: да — см. кадры ниже.
- Эффект погружения“Повышенный реализм, текстура и саунд-дизайн.”На Popcraft: да — диалоги, музыка и эффекты генерируются вместе с картинкой.
- Точное редактирование видео“Более контролируемое редактирование для повышения эффективности.”Пока не на Popcraft — используйте Seedance 2.5 или Gemini Omni для правки или расширения.
Омни-креация: фото, видео и звук в одном промпте
Вторая ключевая особенность Alibaba — генерация на основе мультимодальных данных. На Popcraft это до 4 изображений, 5 видеоклипов и 5 аудиофайлов в одном запросе. Называйте их в промпте Image 1, Video 1 или Audio 1 в порядке прикрепления. Платформа Alibaba также умеет анализировать документы и веб-страницы; эта функция появится на Popcraft позже.
Персонажи, продукты и локации
Лист персонажа фиксирует лицо и гардероб; фото продукта — объект; фото локации — декорации. Модель сохраняет то, что на картинке, поэтому описывайте изменения явно. Два изображения с пометками «первый кадр» и «последний кадр» в промпте станут ключевыми кадрами.
JPEG, PNG, WEBP или BMP · от 240 до 8000 px по стороне · по 20 МБ каждое
Женщина с Image 1 идет по улице с Image 2 в сумерках, камера следует сбоку. Сохраните ее волосы, пальто и сумку в точности как на Image 1.
Движение, камера и игра
Клип переносит траекторию камеры, мизансцену и актерскую игру в новый кадр. Совместите его с фото, и персонаж с фото повторит движение из клипа в тех же декорациях. Клип задает характер движения, а не длину — длину выставляет слайдер.
MP4 или MOV · от 1 до 15 с каждое и до 15 с в сумме · по 100 МБ каждое
Мужчина с Image 1 стоит между колоннами. Точно повторите движение камеры из Video 1: низкий широкий угол с облетом вправо до крупного плана в три четверти.
Тембр голоса или ритм трека
Рецепт от Alibaba: аудио несет голос или ритм, а текст реплики пишется в промпте; модель генерирует речь и мимику губ одновременно. Это не инструмент для «переозвучки» готового видео — для этого используйте аватар-модели, например OmniHuman.
WAV или MP3 · от 1 до 15 с каждое и до 15 с в сумме · по 15 МБ каждое
Возьмите тембр из Audio 1 и заставьте персонажа сказать: «Правда? Звучит отлично — когда ты вернешься?» Сгенерированная речь управляет естественным движением губ.
Ключевые кадры и референсы не смешиваются. Два изображения, помеченные как первый и последний кадр, создают клип по ключевым кадрам; всё остальное — персонажи, клипы, аудио — сочетается свободно в пределах лимитов.
Пиксельная стабильность
Третья особенность от Alibaba: «повышение предсказуемости результата для рабочих процессов» — в описании модели это названо сохранением деталей персонажа и референса между кадрами. Та же актриса из главного фильма в трех точках с интервалом в 28 секунд.
1 с
12 s
29 sКак писать промпты для Wan 3.0
Модель планирует весь клип на основе промпта, поэтому в нем должно быть указано, что это за клип. Наши генерации оставались стабильными, когда мы задавали структуру — один непрерывный кадр или нумерованный список сцен. Остальное следует из этого.
Укажите «no cuts», затем распишите тайминг
Начните с «one continuous take, no cuts, no transitions», дайте каждому отрезку времени свое действие и глагол движения камеры, держите одного главного героя в кадре и опишите звук отдельным предложением. Главный ролик был написан именно так и получился без единой склейки.
ONE CONTINUOUS TAKE, NO CUTS, NO TRANSITIONS, 30 s. Cinematic photoreal, high contrast. A Beijing-opera performer in painted-face makeup and a crimson-and-gold robe. 0–6 s: extreme close-up in a dressing-room mirror ringed with bulbs; she opens her eyes. 6–16 s: she walks down a narrow backstage corridor, stagehands flattening against the walls, the camera tracking backwards ahead of her as drums build. 16–24 s: she pushes through heavy red velvet curtains into blinding stage light; the camera swings behind her shoulder. 24–30 s: the reveal — a packed theatre under red lanterns; she raises one water-sleeve as a gong strikes. Sound: drums building, footsteps, the curtain rush, one gong, applause. No dialogue, no on-screen text.
- Называйте референсы
- Image 1, Video 1, Audio 1 — нумеруйте по типу в порядке прикрепления — и указывайте роль каждого: «Image 1 is the character; Video 1 is the camera move».
- Управляйте звуком
- По умолчанию модель создает диалоги, музыку и эффекты. Опишите, что вам нужно — «rain and a distant tram, no dialogue» — или выключите переключатель Audio для беззвучного файла.
- Точность против креативности
- При наличии изображения модель сохраняет его детали. Для серьезных изменений — погоды, одежды, смены декораций — описывайте их явно, не ожидая, что промпт просто «пересилит» картинку.
- Один главный объект
- Один персонаж, заданный путь камеры и фраза «no cuts» давали нам чистый дубль каждый раз. Толпы, кисти рук и мелкие предметы — это те моменты, где любая видеомодель, включая эту, может терять четкость.
- Черновик — дешево, финал — качественно
- 480p — это та же модель за четверть цены от 1080p. Проверьте сюжет в 480p, а затем перегенерируйте удачный вариант в 1080p с тем же промптом и референсами.
Wan 3.0 vs Seedance 2.5 vs Gemini Omni 1.1 Flash
Три модели на Popcraft, которые создают звук вместе с видео. Преимущество Wan — самый дешевый 30-секундный дубль и точное следование референсу; Seedance — количество референсов и монтаж; Omni — 4K и 40 секунд. Выбирайте под задачу.
| Возможность | Wan 3.0 | Seedance 2.5 | Gemini Omni 1.1 Flash |
|---|---|---|---|
| Макс. клип за один запрос | 30 с за один проход | 30 с | 40 с через расширение (30 с в 4K) |
| Разрешение | 480p / 720p / 1080p при 30 fps | До 1080p | От 360p (черновик) до 4K |
| Нативный звук | Диалоги, музыка, эффекты; отключаемо | Да | Речь, музыка, звуковые эффекты |
| Изображения-референсы | До 4 | До 30 | До 10 |
| Видео-референсы | До 5, 15 с всего | До 10 | До 3 |
| Аудио-референсы | До 5, 15 с всего | До 10 | — |
| Правка или расширение | — (используйте Seedance 2.5 или Omni) | Правка; расширение до/после | Правка; расширение шагами по 10 с |
| 30-секундный черновик | 330 кредитов в 480p | Посекундно, от разрешения | 150 кредитов в 360p |
Данные для Wan взяты из руководства Alibaba Model Studio; лимиты Popcraft — это то, что доступно в интерфейсе сегодня. Потолки провайдеров меняются; в интерфейсе всегда указаны актуальные данные. Полные сравнения: Seedance 2.5 · Gemini Omni 1.1 Flash.
Цены на Wan 3.0 на Popcraft
Оплата производится посекундно за готовый файл, в зависимости от разрешения. Референсы прикрепляются бесплатно. Поскольку длина видео соответствует запросу, цена, которую вы видите перед генерацией — это финальная стоимость.
В каждый тарифный план включены кредиты; на странице цен указаны текущие ставки для всех моделей. На скачиваниях бесплатного уровня ставится водяной знак Popcraft, в платных планах он отсутствует.
Для чего Alibaba рекомендует Wan 3.0
Три сценария из материалов Alibaba и способы их реализации на Popcraft.
- 01
Короткие видео: инсценировка сюжетов и рекламные тизеры
Развлекательный сценарий Alibaba. До 30 секунд многопланового повествования из одного промпта, включая звук.
- 02
E-commerce: демонстрация продукта на основе фото
Сценарий для электронной коммерции — «загрузите фото товара и описание, получите динамичную презентацию». Прикрепите фото как Image 1.
- 03
Образование: симуляция сценариев
Образовательный сценарий Alibaba — консультация врача или звонок в поддержку, созданные по промпту со сгенерированными диалогами.
- 04
Черновик в 480p, финал в 1080p
Дополнение от Popcraft: 11 кредитов за секунду в 480p позволяют сделать 30-секундный черновик за 330 кредитов перед переходом к 1080p.
Wan 3.0 — часто задаваемые вопросы
Это универсальная видеомодель от Alibaba Tongyi Lab, запущенная в августе 2026 года. Одна модель поддерживает генерацию из текста, из фото, контроль ключевых кадров и мульти-референсы. Она создает видео любой длины от 2 до 30 секунд за один проход при 30 fps, генерируя диалоги, музыку и звуковые эффекты одновременно с изображением.
Любая целая секунда от 2 до 30 за один проход — без склеек и расширений. На Popcraft вы задаете длину слайдером, и файл точно соответствует запросу; в наших тестах отклонение составляло не более сотых долей секунды.
Да, по умолчанию. Модель нативно выводит диалоги, музыку и эффекты, позволяя задавать реплики прямо в промпте. Переключатель Audio на Popcraft позволяет получить файл без звуковой дорожки.
Прикрепите до 4 фото, 5 видео и 5 аудио и сошлитесь на них в промпте как Image 1, Video 1, Audio 1 и т. д. Изображения задают персонажа или сцену, видео — движение, аудио — голос или ритм. Видео и аудио ограничены 15 секундами в сумме. Режим ключевых кадров (первый и последний кадр) несовместим с другими референсами.
Да, это одна из сильных сторон модели. Alibaba заявляет о высокой стабильности внешности, одежды и окружения. В наших тестах персонажи сохраняли идентичность на протяжении 30-секундного дубля. Модель отдает приоритет загруженному изображению, поэтому любые изменения нужно описывать очень детально.
На Popcraft сейчас — нет. Wan 3.0 использует клипы как референс для движения; для редактирования или продления футажа используйте Seedance 2.5 или Gemini Omni 1.1 Flash.
Аудиореференсы в Wan 3.0 передают тембр голоса, а текст реплики берется из промпта; модель сама синтезирует речь и движение губ. Это не инструмент для наложения звука на готовую мимику. Для таких задач используйте аватар-модели, например OmniHuman.
Оплата идет за секунду видео: 11 кредитов в 480p, 20 в 720p и 40 в 1080p. 30-секундный черновик в 480p обойдется в 330 кредитов. Цена всегда видна до начала генерации.
Тридцать секунд, один запрос. Попробуйте сначала в 480p.
Сделайте черновик за 330 кредитов, оцените сюжет, а затем создайте финал в 1080p — или объедините лист персонажа с эталонным движением.
Продолжайте исследовать
Похожие модели
Seedance 2.5 генерирует до 30 секунд видео за один запуск, поддерживает до 50 референсных активов, управляемый видеомонтаж, высокоточное темпоральное расширение, любое соотношение сторон от 0,4 до 2,5 и нативные промпты на более чем 10 языках. Доступно на Popcraft.
Gemini Omni 1.1 Flash — видеомодель Google, которая создаёт и редактирует видео из любых входных данных. До 40 секунд за счёт расширения сцен, вывод в 1080p и 4K, интерполяция по первому и последнему кадру, до 10 референсных изображений, а также генерация речи, музыки и звуковых эффектов синхронно с картинкой. Доступно на Popcraft.
MiniMax H3 создает 2K-видео (24 fps) с синхронным стерео: эффекты, фон и диалоги за один раз. Мультикадр из одного промпта, 5–15 секунд, контроль первого и последнего кадров. Уже на Popcraft.
Генерируйте кинематографическое видео 4K из текста, изображений или клипов с Seedance 2.0 на Popcraft. Нативный синхронизированный звук, многокадровые последовательности и предельная чёткость до 4K (2160p).