Alibaba · Tongyi Lab
Wan 3.0: 사운드까지 한 번에 생성하는 30초 AI 비디오
Wan 3.0은 Alibaba의 올인원 AI 비디오 생성기입니다. 프롬프트, 이미지 또는 참조 세트를 단 한 번의 요청으로 2초에서 30초 사이의 모든 길이로 변환하며, 최대 1080p 30fps 해상도를 지원합니다. 또한 대사, 음악, 효과음을 한 번의 작업으로 함께 렌더링합니다. Popcraft에서는 초당 11 크레딧부터 시작합니다.
비디오 스튜디오, Canvas 보드 및 MCP 커넥터에서 사용 가능
- 2–30 s
- 초 단위 지정, 단 한 번의 시도
- 1080p 30 fps
- 480p 및 720p 등급도 지원
- 4 · 5 · 5 참조
- 이미지, 클립, 오디오
- 11 cr / s
- 480p 기준 — 30초에 330
네이티브 30초 재생 시간
Alibaba의 핵심 기능인 네이티브 30초 패스는 "더 완벽한 스토리텔링과 창의적 자유"를 선사합니다. 위 히어로 영화의 타임라인별 주요 장면들과, 실제 생성 시 측정된 시간 및 파일 정보를 확인해 보세요.
1s
6s
12s
18s
24s
29s| 요청 사항 | 결과물 | 소요 시간 |
|---|---|---|
| 30초 · 1080p · 텍스트 전용 | 30.02초 · 1920×1080 · 스테레오 | 5분 38초 |
| 5초 · 720p · 텍스트 전용 | 5.04초 · 1280×720 · 스테레오 | 1분 37초 |
| 3초 및 10초 · 6초 참조 클립 사용 | 3.02초 및 10.03초 · 클립은 동작을 결정하며 길이는 영향 미치지 않음 | 각 약 1분 25초 |
소요 시간은 2026년 9월 Popcraft 기준 요청부터 파일 생성까지의 시간입니다. 모든 클립은 요청한 시간의 수백 분의 일 초 오차 범위 내에서 생성되므로, 생성 전 확인한 크레딧만큼만 정확히 차감됩니다.
몰입형 경험: 사실감, 질감 및 사운드 디자인
Alibaba는 이를 "한 차원 높은 사실감, 질감 및 사운드 디자인"이라고 설명합니다. 실사, 장편 애니메이션 스타일의 CG, 브랜드 판타지까지 한 번의 요청, 30초 연속 테이크로 생성된 세 편의 영화를 확인해 보세요. 사운드트랙도 동시에 생성되었으며 오직 프롬프트만 변경되었습니다.
커튼 (Curtain)
위 히어로 영화: 분장실 거울에서 시작해 복도를 지나 벨벳 커튼을 젖히고 관객이 가득 찬 무대로 나가는 경극 배우의 모습입니다. 북소리가 고조되고 징 소리와 함께 관중의 환호성이 들립니다.
구미호 (Fox spirit)
구미호가 등불이 켜진 지붕 위를 달리고, 흩어지는 등불 사이로 도약하여 보름달을 배경으로 종탑에 착륙합니다. 텍스트 프롬프트만으로 구현된 회화적인 3D 룩을 감상해 보세요.
자판기 (Vending machine)
비 내리는 골목에서 노란 우비를 입은 소녀가 버튼을 누르자 유리창 너머 팝한 컬러의 세계로 빨려 들어갑니다. 마스코트가 건네준 캔 음료의 탄산이 불꽃놀이가 되고, 카메라는 다시 골목으로 빠져나옵니다.
여기에 표시된 모든 영화는 편집이나 추가 음악 없이 생성된 그대로의 모습입니다. 480p 초안은 각각 330 크레딧, 1080p는 1,200 크레딧입니다.
Wan 3.0이란 무엇인가요?
Wan 3.0(万相 3.0)은 Alibaba Tongyi Lab의 비디오 모델로, 2026년 8월 6일 공개 베타를 시작하여 8월 24일에 정식 출시되었습니다. Alibaba는 이를 올인원 참조 비디오 모델이라 부릅니다. 각 작업마다 별도의 모델을 사용하는 대신, 하나의 모델로 텍스트-비디오, 이미지-비디오, 첫/마지막 프레임 제어 및 혼합 참조 생성을 모두 처리합니다. 이 모델은 API 전용으로 오픈 웨이트는 제공되지 않으며, Popcraft는 Alibaba가 제공하는 두 가지 에디션 중 더 빠른 프라임 에디션을 실행합니다.
Alibaba Cloud Model Studio 가이드 및 wan3.0-video API 참조, Wan 3.0 공식 리포지토리 README, Alibaba 개발자 커뮤니티 출시 요약 자료를 참고했습니다. 위의 주장은 Alibaba의 것이며, 이 페이지의 측정값은 당사의 테스트 결과입니다.
“요청당 최대 30초의 비디오를 초당 30프레임으로 안정적으로 생성합니다.”
길이
“대사, 배경 음악 및 효과음을 네이티브로 출력하여 후반 작업 더빙이 필요 없습니다.”
사운드
“캐릭터 외형, 의상, 소품, 환경 및 시각적 스타일의 일관성 유지. 푸시, 풀, 팬 및 트래킹 카메라 움직임 지원.”
일관성 및 카메라
- 네이티브 30초 재생 시간“더 완벽한 스토리텔링과 창의적 자유.”Popcraft 지원: 한 번에 2초에서 30초 사이의 모든 길이 생성 가능.
- 옴니 크리에이션 (Omni-Creation)“최대 20개의 참조 에셋과 문서 및 웹페이지 파싱 지원.”Popcraft 지원: 이미지 4개, 클립 5개, 오디오 5개. 문서 및 웹페이지는 준비 중입니다.
- 픽셀 단위의 완벽한 일관성“프로덕션 워크플로우를 위한 결과물의 확실성 향상.”Popcraft 지원: 예 — 아래의 스틸 이미지를 확인하세요.
- 몰입형 경험“한 차원 높은 사실감, 질감 및 사운드 디자인.”Popcraft 지원: 예 — 영상과 함께 대사, 음악, 효과음이 생성됩니다.
- 정밀 비디오 편집“창의적 효율성을 높이는 더욱 제어 가능한 편집.”Popcraft 미지원 — 편집이나 연장은 Seedance 2.5 또는 Gemini Omni를 사용하세요.
옴니 크리에이션: 하나의 프롬프트에 이미지, 클립, 오디오를 모두
Alibaba의 두 번째 핵심 기능은 멀티모달 입력을 통한 생성입니다. Popcraft에서는 단일 요청에 최대 4개의 이미지, 5개의 비디오 클립, 5개의 오디오 클립을 첨부할 수 있으며, 프롬프트에서 첨부된 순서대로 Image 1, Video 1, Audio 1로 명명하여 참조할 수 있습니다. Alibaba 플랫폼의 문서 및 웹페이지 파싱 기능은 아직 Popcraft에서 지원되지 않습니다.
대상, 제품 및 세트
캐릭터 시트는 얼굴과 의상을 고정하고, 제품 사진은 물체를, 장소 사진은 세트를 고정합니다. 모델은 이미지에 있는 내용을 유지하려 하므로, 변경하려는 부분은 프롬프트에 명시하세요. 프롬프트에 "first frame"(첫 프레임)과 "last frame"(마지막 프레임)을 포함한 두 이미지는 키프레임 역할을 합니다.
JPEG, PNG, WEBP 또는 BMP · 한 변당 240~8,000px · 각 20MB
Image 1의 여성이 Image 2의 거리를 황혼녘에 걷고 있고, 카메라는 그녀를 따라 옆에서 트래킹한다. 그녀의 머리 모양, 코트, 가방을 Image 1과 똑같이 유지해라.
동작, 카메라 및 연기
클립의 카메라 경로, 동선, 연기 정보가 새로운 샷에 반영됩니다. 이미지와 함께 사용하면 이미지 속 대상이 클립의 움직임을 해당 세트에서 수행합니다. 클립은 동작을 결정할 뿐 길이를 결정하지는 않습니다. 길이는 슬라이더로 조절하세요.
MP4 또는 MOV · 각 1~15초, 총합 15초 · 각 100MB
Image 1의 남자가 기둥 사이에 서 있다. Video 1의 카메라 움직임을 똑같이 따라가라: 낮은 광각으로 오른쪽으로 회전하며 3/4 클로즈업으로 들어간다.
목소리의 음색 또는 트랙의 비트
오디오는 목소리나 리듬을 전달하고, 대사는 프롬프트에 작성합니다. 모델이 음성과 입 모양 움직임을 동시에 생성합니다. 이 도구는 기존 녹음 파일에 입 모양을 맞추는 도구가 아닙니다. 해당 용도에는 OmniHuman과 같은 아바타 모델을 사용하세요.
WAV 또는 MP3 · 각 1~15초, 총합 15초 · 각 15MB
Audio 1의 음색을 사용하여 캐릭터가 "정말? 그거 좋네 — 언제 돌아와?"라고 말하게 해라. 생성된 음성이 자연스러운 입 모양 움직임을 유도한다.
키프레임과 참조는 혼합할 수 없습니다. 첫 번째와 마지막 프레임으로 표시된 두 이미지는 단독 키프레임 클립을 형성하며, 그 외 대상 이미지, 클립, 오디오는 위 제한 범위 내에서 자유롭게 조합할 수 있습니다.
픽셀 단위의 완벽한 일관성
Alibaba의 세 번째 핵심 기능은 "프로덕션 워크플로우를 위한 결과물의 확실성 향상"입니다. 모델 카드는 이를 프레임 간 캐릭터 및 참조 세부 사항의 보존이라고 설명합니다. 히어로 영화의 주인공 배우가 28초 간격의 세 시점에서 어떻게 유지되는지 확인해 보세요.
1초
12초
29초Wan 3.0 프롬프트 작성법
모델은 프롬프트를 바탕으로 클립 전체를 계획하므로, 프롬프트에 클립의 종류를 명시해야 합니다. 연속성(한 번의 끊김 없는 샷 또는 번호가 매겨진 샷 목록)을 지정했을 때 렌더링 결과가 가장 안정적이었습니다. 나머지는 그에 따릅니다.
"no cuts"라고 말하고 장면의 박자를 조절하세요
"one continuous take, no cuts, no transitions"로 시작하세요. 각 시간대별로 수행할 동작 하나와 카메라 동사 하나를 지정하고, 단일 주인공을 프레임 안에 유지하며, 사운드는 별도의 문장으로 작성하세요. 히어로 영화는 정확히 이 방식으로 작성되었으며 단 한 번의 컷도 없이 완성되었습니다.
ONE CONTINUOUS TAKE, NO CUTS, NO TRANSITIONS, 30 s. Cinematic photoreal, high contrast. A Beijing-opera performer in painted-face makeup and a crimson-and-gold robe. 0–6 s: extreme close-up in a dressing-room mirror ringed with bulbs; she opens her eyes. 6–16 s: she walks down a narrow backstage corridor, stagehands flattening against the walls, the camera tracking backwards ahead of her as drums build. 16–24 s: she pushes through heavy red velvet curtains into blinding stage light; the camera swings behind her shoulder. 24–30 s: the reveal — a packed theatre under red lanterns; she raises one water-sleeve as a gong strikes. Sound: drums building, footsteps, the curtain rush, one gong, applause. No dialogue, no on-screen text.
- 참조 에셋 이름 지정
- 첨부된 순서대로 Image 1, Video 1, Audio 1로 번호를 매기고 각각의 역할을 명시하세요 (예: "Image 1은 캐릭터이고, Video 1은 카메라 움직임이다").
- 사운드 연출
- 기본적으로 모델은 대사, 음악, 효과음을 작성합니다. 원하는 것을 요청하세요 (예: "빗소리와 멀리서 들리는 전차 소리, 대사 없음"). 소리 없는 파일을 원하면 오디오 스위치를 끄세요.
- 이미지 중시, 변경 사항은 강조
- 이미지가 제공되면 모델은 그 내용을 유지합니다. 날씨, 의상, 세트 변경 등 큰 변화를 원할 경우 프롬프트가 이미지를 압도할 것이라 기대하기보다 변화를 구체적으로 설명하세요.
- 한 명의 주인공 유지
- 단일 인물, 지정된 카메라 경로, "no cuts"라는 단어를 사용했을 때 매번 깨끗한 테이크를 얻었습니다. 군중, 손, 작은 소품 등은 다른 비디오 모델과 마찬가지로 묘사가 뭉개질 수 있습니다.
- 저렴하게 초안 잡고, 고화질로 완성
- 480p는 1080p 가격의 1/4 수준으로 동일한 모델을 사용합니다. 480p에서 스토리 구성을 확인한 후, 동일한 프롬프트와 참조를 사용해 1080p로 최종 렌더링하세요.
Wan 3.0 vs Seedance 2.5 vs Gemini Omni 1.1 Flash
Popcraft에는 영상과 사운드를 함께 생성하는 세 가지 모델이 있습니다. Wan의 강점은 가장 저렴한 30초 원테이크와 참조 이미지에 충실한 결과물이며, Seedance는 많은 참조 개수와 편집/연장 기능, Omni는 4K 해상도와 연장을 통한 40초 생성이 특징입니다. 작업 성격에 맞춰 선택하세요.
| 기능 | Wan 3.0 | Seedance 2.5 | Gemini Omni 1.1 Flash |
|---|---|---|---|
| 단일 요청 시 최대 클립 길이 | 한 번에 30초 | 30초 | 장면 연장 시 40초 (4K는 30초) |
| 해상도 | 480p / 720p / 1080p (30 fps) | 최대 1080p | 360p 초안부터 4K까지 |
| 네이티브 오디오 | 대사, 음악, 효과음 (끄기 가능) | 지원 | 음성, 음악, 효과음 |
| 참조 이미지 | 최대 4개 | 최대 30개 | 최대 10개 |
| 참조 비디오 | 최대 5개 (총 15초) | 최대 10개 | 최대 3개 |
| 참조 오디오 | 최대 5개 (총 15초) | 최대 10개 | — |
| 클립 편집 또는 연장 | — (Seedance 2.5 또는 Omni 사용) | 편집 및 앞뒤 연장 가능 | 편집 및 10초 단위 연장 가능 |
| 30초 초안 비용 | 480p 기준 330 크레딧 | 해상도별 초당 과금 | 360p 기준 150 크레딧 |
Wan 수치는 Alibaba Model Studio 가이드 기준이며, Popcraft 제한 사항은 현재 선택 도구에 표시된 값입니다. 제공사 정책에 따라 한도는 변경될 수 있으며, 선택 도구는 항상 현재 사용 가능한 값을 보여줍니다. 상세 비교: Seedance 2.5 · Gemini Omni 1.1 Flash.
Popcraft의 Wan 3.0 가격 정책
해상도에 따라 생성된 초당 비용이 청구됩니다. 참조 에셋 첨부는 무료입니다. 생성된 길이는 요청한 길이와 정확히 일치하므로, 생성 전 표시된 금액이 최종 결제 금액이 됩니다.
모든 요금제에는 크레딧이 포함되어 있습니다. 가격 페이지에서 모든 모델의 현재 요율을 확인하세요. 무료 등급 다운로드에는 Popcraft 워터마크가 표시되며, 유료 요금제에서는 제거됩니다.
Alibaba가 제안하는 Wan 3.0 활용 사례
Alibaba 출시 자료에 명시된 세 가지 시나리오와 Popcraft에서의 실행 방법입니다.
- 01
숏폼 비디오 콘텐츠: 드라마 연출 및 광고 티저
Alibaba의 엔터테인먼트 시나리오입니다. 사운드가 포함된 최대 30초 분량의 멀티 샷 내러티브를 하나의 프롬프트로 생성하세요.
- 02
이커머스: 제품 이미지를 활용한 상품 쇼케이스
Alibaba의 이커머스 시나리오입니다. "제품 사진과 설명을 업로드하여 역동적인 쇼케이스를 제작"하세요. 사진을 Image 1로 첨부하면 됩니다.
- 03
교육: 상황별 시나리오 시뮬레이션
Alibaba의 교육 시나리오입니다. 프롬프트로 설정된 의사 진료나 고객 상담 상황을 생성하며, 대사까지 함께 구현됩니다.
- 04
480p로 초안 잡고, 1080p로 완성
Popcraft만의 활용 팁: 480p에서 초당 11 크레딧으로 30초 초안을 330 크레딧에 확인한 후, 확신이 생기면 1080p로 최종 렌더링하세요.
Wan 3.0 — 자주 묻는 질문
Alibaba Tongyi Lab의 올인원 비디오 모델로, 2026년 8월 출시되었습니다. 하나의 모델로 텍스트-비디오, 이미지-비디오, 키프레임 제어 및 다중 참조 생성을 모두 지원하며, 30fps 속도로 2초에서 30초 사이의 영상을 한 번에 생성합니다. 영상과 함께 대사, 배경 음악, 효과음도 동시에 생성됩니다.
2초에서 30초 사이의 정수 단위로 한 번에 생성 가능합니다. 연장이나 이어 붙이기가 필요 없습니다. Popcraft 슬라이더로 길이를 설정하면 요청한 시간과 거의 정확히 일치하는 파일이 생성되며, 해당 초만큼만 비용을 지불합니다.
네, 기본적으로 생성합니다. Alibaba 가이드에 따르면 모델은 대사, BGM, 효과음을 네이티브로 출력하며 프롬프트에서 이를 지정할 수 있습니다. Popcraft의 오디오 스위치를 끄면 소리 없는 클립이 생성됩니다.
최대 4개의 이미지, 5개의 비디오, 5개의 오디오 클립을 첨부하고 프롬프트에서 Image 1, Video 1 식으로 언급하여 사용합니다. 이미지는 캐릭터나 장면을, 비디오는 동작과 카메라를, 오디오는 음색이나 비트를 제공합니다. 비디오와 오디오는 각각 총합 15초로 제한됩니다. 키프레임으로 지정된 두 이미지는 다른 참조와 섞어 쓸 수 없습니다.
네, 그것이 이 모델의 핵심 설계 목적입니다. 캐릭터의 외형, 의상, 소품, 환경의 일관성 유지는 모델의 주요 기능입니다. 테스트 결과 캐릭터 시트를 사용해 30초 내내 정체성을 유지하거나, 제품 이미지를 프레임 내에 정확히 재현하는 등 우수한 성능을 보였습니다. 참조 이미지를 중시하므로, 큰 변화를 원할 때는 명시적으로 설명해야 합니다.
현재 Popcraft의 Wan 3.0은 첨부된 클립을 동작 참조용으로만 사용합니다. 기존 영상을 연장하거나 편집하려면 '비디오 연장' 패널이 있는 Seedance 2.5 또는 Gemini Omni 1.1 Flash를 사용하세요.
Alibaba의 오디오 참조는 음색과 비트를 가져오는 용도이며, 대사는 프롬프트에 써야 합니다. 그러면 모델이 그 대사에 맞춰 목소리와 입 모양을 생성합니다. 특정 녹음 파일에 입을 맞추는 기능이 아니므로, 해당 기능이 필요하면 OmniHuman 같은 아바타 모델을 사용하세요.
생성된 초당 비용이 청구됩니다. 480p는 11 크레딧, 720p는 20 크레딧, 1080p는 40 크레딧입니다. 30초 초안(480p)은 330 크레딧, 1080p 완성본은 1,200 크레딧입니다. 무료 등급은 워터마크가 포함됩니다.
단 한 번의 요청으로 만드는 30초. 480p로 먼저 시작해 보세요.
330 크레딧으로 초안을 만들어 스토리를 확인하고, 1080p로 최종 렌더링하세요. 캐릭터 시트와 참조 클립을 결합해 놀라운 결과물을 만들 수도 있습니다.
계속 둘러보기
관련 모델
Seedance 2.5는 한 번의 작업으로 최대 30초 영상을 생성합니다. 최대 50개의 참조 에셋 지원, 제어 가능한 영상 편집, 고충실도 시간 확장, 0.4~2.5 범위의 모든 화면 비율, 10개 이상 언어의 네이티브 프롬프트 입력을 지원합니다. Popcraft에서 이용 가능합니다.
Gemini Omni 1.1 Flash는 어떤 입력으로도 영상을 생성하고 편집할 수 있는 구글의 영상 모델입니다. 장면 확장으로 최대 40초, 1080p 및 4K 출력, 첫/마지막 프레임 보간, 최대 10장 참조 이미지를 지원하며 영상과 함께 음성, 음악, 효과음도 자동 생성됩니다. Popcraft에서 바로 이용 가능합니다.
MiniMax H3는 24fps 2K 영상과 동기화된 스테레오 사운드트랙(효과음, 환경음, 대사 포함)을 한 번에 생성합니다. 단일 프롬프트로 멀티샷 가능, 5~15초, 첫/끝 프레임 제어 지원. Popcraft에서 이용 가능.
Popcraft에서 Seedance 2.0으로 텍스트, 이미지 또는 클립으로부터 시네마틱 4K 영상을 생성하세요. 네이티브 동기화 오디오, 멀티샷 시퀀스, 그리고 최대 4K (2160p)의 선명한 디테일.