Alibaba · Tongyi Lab(通義実験室)
Wan 3.0:30秒のAI動画を一度の生成で、音声も同時に
Wan 3.0は、Alibabaが提供するオールインワンのAI動画生成モデルです。プロンプト、画像、またはリファレンスセットから、2秒から30秒までの任意の長さの動画を1回の生成で作成。最大1080p・30 fpsに対応し、会話、音楽、効果音も同じジョブ内でレンダリングします。Popcraftでは1秒あたり11クレジットから利用可能です。
動画スタジオ、Canvasボード、MCPコネクタで利用可能
- 2–30 s
- 1回の生成で任意の秒数を指定
- 1080p 30 fps
- 480pおよび720pプランもあり
- 4 · 5 · 5 refs
- 画像、クリップ、オーディオ
- 11 cr / s
- 480pの場合 — 30秒で330クレジット
ネイティブ対応の30秒生成
Alibabaが打ち出す最大の特長:ネイティブな30秒生成による「より完全なストーリーテリングとクリエイティブな自由」。上のメイン動画のタイムライン上の6つの時点と、実際に生成されたクリップのステータスをご確認ください。
1s
6s
12s
18s
24s
29s| リクエスト | 出力内容 | 生成時間 |
|---|---|---|
| 30秒 · 1080p · テキストのみ | 30.02秒 · 1920×1080 · ステレオ | 5分38秒 |
| 5秒 · 720p · テキストのみ | 5.04秒 · 1280×720 · ステレオ | 1分37秒 |
| 3秒および10秒 · 6秒のリファレンスクリップ使用 | 3.02秒および10.03秒 · 長さではなく動きをリファレンス化 | 各 約1分25秒 |
生成時間は2026年9月時点のPopcraft上での計測値。すべてのクリップがリクエストに対して0.01秒単位の精度で出力されるため、生成前に表示されたクレジットがそのまま消費額となります。
没入体験:リアリズム、質感、サウンドデザイン
Alibabaの言葉を借りれば「進化したリアリズム、質感、サウンドデザイン」。実写、映画レベルのCG、ブランドファンタジーの3つのスタイル。それぞれ一度のリクエスト、30秒の連続ワンカットで、サウンドトラックも同時に生成。変更したのはプロンプトのみです。
カーテン
上のメイン動画:京劇の役者が楽屋から舞台へと進む様子。太鼓の音が響き、銅鑼が打ち鳴らされ、客席の歓声が沸き上がります。
九尾の狐
提灯が灯る屋根の上を疾走する九尾の狐。提灯を散らしながら跳躍し、満月を背に塔へ着地。テキストプロンプトのみから生成された、絵画的な3Dルック。
自動販売機
雨の路地で黄色いレインコートの少女がボタンを押すと、ガラスの中の鮮やかなポップの世界へ引き込まれる。炭酸の弾ける音が花火に変わり、カメラは再び路地へと戻ります。
ここに掲載された動画はすべて未編集です。追加の音楽も使用していません。480pの下書きは各330クレジット、1080pは1,200クレジットです。
Wan 3.0とは?
Wan 3.0(万相 3.0)は、AlibabaのTongyi Lab(通義実験室)による動画生成モデルで、2026年8月6日にパブリックベータが開始され、8月24日に正式リリースされました。Alibabaはこのモデルをオールインワン・リファレンス動画モデルと呼んでいます。テキスト、画像、始点・終点フレームの制御、複数のリファレンスからの生成を、タスクごとのモデルに分けることなく一つのモデルで処理します。API専用(重みの一般公開はなし)であり、PopcraftではAlibabaが提供する2つのエディションのうち、より高速なプライム版を採用しています。
Alibaba Cloud Model Studioガイド、wan3.0-video APIリファレンス、公式README、および開発者コミュニティ向けサマリーより。上記の主張はAlibabaによるものであり、本ページでの測定値は自社調べです。
“1回のリクエストで最大30秒の動画を、毎秒30フレームで安定して生成します。”
長さ
“セリフ、BGM、効果音をネイティブに出力。ポストプロダクションでのアフレコは不要です。”
サウンド
“キャラクターの外見、服装、小道具、環境、視覚スタイルの妥協のない一貫性。押し、引き、パン、トラッキングなどのカメラワークに対応。”
一貫性とカメラワーク
- ネイティブ30秒生成“より完全なストーリーテリングとクリエイティブな自由を。”Popcraftでは:2〜30秒の任意の長さを一度に生成可能。
- Omni-Creation(オムニ・クリエイション)“ドキュメントやウェブページの解析を含む、最大20個のリファレンス素材に対応。”Popcraftでは:画像4枚、クリップ5つ、オーディオ5つに対応。ドキュメント解析は準備中です。
- ピクセル単位の一貫性“制作ワークフローにおける納品の確実性を向上。”Popcraftでは:対応済み。下の静止画をご覧ください。
- 没入型体験“進化したリアリズム、質感、サウンドデザイン。”Popcraftでは:対応済み。映像と同時に会話、音楽、効果音を生成。
- 精密な動画編集“制作効率を高める、より制御可能な編集機能。”Popcraftでは現在未対応 — 編集や延長にはSeedance 2.5、Gemini Omniをご利用ください。
Omni-Creation:画像、クリップ、音声を一つのプロンプトで
Alibabaの第2の目玉機能 — マルチモーダル入力からの生成。Popcraftでは1回のリクエストで最大4枚の画像、5つの動画クリップ、5つの音声クリップを添付でき、プロンプト内で「Image 1」「Video 1」「Audio 1」のように指定して制御できます。Alibabaのプラットフォームにあるドキュメント解析機能はPopcraftでは現在準備中です。
被写体、製品、セット
キャラクターシートで顔や衣装を固定し、製品写真で対象物を固定し、ロケハン写真でセットを固定。モデルは写真の内容を維持するため、変更したい箇所は明示的に指示してください。2枚の画像に「first frame(始点)」「last frame(終点)」と指定すれば、キーフレームとして機能します。
JPEG, PNG, WEBP, BMP · 短辺240px〜長辺8,000px · 各20 MBまで
Image 1の女性がImage 2の夕暮れの街を歩いている。カメラは彼女の横を並走。髪型、コート、バッグはImage 1と全く同じに保つこと。
動き、カメラ、演技
クリップからカメラパスや演技の構成を新しいカットへ引き継ぎます。画像と組み合わせることで、画像内の被写体にクリップと同じ動きをさせることができます。クリップは動きを指定するものであり、長さはスライダーの設定に従います。
MP4, MOV · 各1〜15秒(合計15秒まで) · 各100 MBまで
Image 1の男性が柱の間に立っている。Video 1のカメラワークを正確に再現:低いワイドアングルから右へ回り込み、斜め前からのアップへ。
声の音色やトラックのリズム
Alibabaの仕組み:オーディオは声色やリズムを決定し、話す内容はプロンプトで指定します。モデルは音声と口の動きを同時に生成します。既存の録音に口を合わせるツールではないため、特定音声でのリップシンクにはOmniHumanなどのアバターモデルを使用してください。
WAV, MP3 · 各1〜15秒(合計15秒まで) · 各15 MBまで
Audio 1の音色でキャラクターにこう言わせる:「本当?それは楽しみだ。いつ戻るの?」生成された音声が自然な口の動きを駆動させる。
キーフレームとリファレンスは併用できません。「始点」と「終点」に指定された2枚の画像はそれだけで独立したキーフレーム動画となりますが、それ以外(被写体画像、クリップ、音声)は制限内であれば自由に組み合わせ可能です。
ピクセル単位の一貫性
Alibabaの第3の特長:「制作ワークフローにおける納品の確実性を向上」。モデルカードには、フレームをまたいでキャラクターやリファレンスの詳細を保持すると記されています。上のメイン動画に登場する同じ演者の、28秒間隔の3つの時点を比較してください。
1秒時点
12秒時点
29秒時点Wan 3.0のプロンプトの書き方
モデルはプロンプトからクリップ全体の構成を計画するため、それがどのような種類のクリップかを指定する必要があります。「継続性の名称」を指定することで、レンダリングの安定性が飛躍的に向上しました。(例:1つの連続したショット、または番号付きのショットリスト)
「no cuts」と指示し、展開のタイミングを指定する
冒頭に「one continuous take, no cuts, no transitions」と記述。秒数ごとの展開とカメラワークの動詞を指定し、一人のメイン被写体をフレーム内に保ち、音声を独立した文章として記述します。メイン動画はこの方法で書かれ、一度のカットも挟まずに生成されました。
ONE CONTINUOUS TAKE, NO CUTS, NO TRANSITIONS, 30 s. Cinematic photoreal, high contrast. A Beijing-opera performer in painted-face makeup and a crimson-and-gold robe. 0–6 s: extreme close-up in a dressing-room mirror ringed with bulbs; she opens her eyes. 6–16 s: she walks down a narrow backstage corridor, stagehands flattening against the walls, the camera tracking backwards ahead of her as drums build. 16–24 s: she pushes through heavy red velvet curtains into blinding stage light; the camera swings behind her shoulder. 24–30 s: the reveal — a packed theatre under red lanterns; she raises one water-sleeve as a gong strikes. Sound: drums building, footsteps, the curtain rush, one gong, applause. No dialogue, no on-screen text.
- リファレンスを名前で呼ぶ
- 添付順に「Image 1, Video 1, Audio 1」と番号を振り、「Image 1はキャラクター用、Video 1はカメラワーク用」のように用途を明示します。
- サウンドを演出する
- デフォルトでは会話、音楽、効果音が生成されます。「雨の音と遠くの電車の音、セリフなし」のように要望を書くか、Audioスイッチをオフにして無音ファイルを作成します。
- 大きな変更は強調する
- 画像を添付すると、モデルはその内容を維持しようとします。天候や衣装、セットを大きく変えたい場合は、画像に頼らず、プロンプトでその変更を明示的に説明してください。
- メイン被写体を一人に絞る
- 「単一の人物」「明確なカメラパス」「no cuts」の組み合わせが、最もクリーンなテイクを生みます。群衆や手、小さな小道具は、他の動画モデルと同様に精度が落ちる傾向があります。
- 下書きは安く、本番は高品質で
- 480pは1080pの4分の1の価格で同じモデルを使用できます。まずは480pでストーリーの繋がりを確認し、納得がいったものを同じプロンプトとリファレンスで1080pで再レンダリングしましょう。
Wan 3.0 vs Seedance 2.5 vs Gemini Omni 1.1 Flash
Popcraft上で映像と音声を同時に生成できる3つのモデルの比較。Wanの強みは、プラットフォーム最安の30秒生成とリファレンスへの忠実度。Seedanceはリファレンス数と編集・延長機能。Omniは4K対応と延長による40秒生成が魅力です。用途に合わせてお選びください。
| 機能 | Wan 3.0 | Seedance 2.5 | Gemini Omni 1.1 Flash |
|---|---|---|---|
| 1リクエストでの最大秒数 | 30秒(一度の生成で) | 30秒 | 40秒(シーン延長による。4Kは30秒) |
| 解像度 | 480p / 720p / 1080p (30 fps) | 最大1080p | 360p(下書き)〜 4K |
| ネイティブオーディオ | セリフ、音楽、効果音(オフ可能) | 対応 | 会話、音楽、効果音 |
| リファレンス画像 | 最大4枚 | 最大30枚 | 最大10枚 |
| リファレンス動画 | 最大5つ(合計15秒) | 最大10個 | 最大3個 |
| リファレンスオーディオ | 最大5つ(合計15秒) | 最大10個 | — |
| 編集・延長 | —(Seedance 2.5, Omniを使用) | 編集、前後への延長 | 編集、10秒ごとの延長 |
| 30秒の下書き料金 | 330クレジット (480p) | 解像度ごとの秒単価 | 150クレジット (360p) |
Wanの数値はAlibabaのガイドに基づき、Popcraftの制限は現在設定されている値です。プロバイダーの制限は変更される場合があります。詳細は Seedance 2.5 · Gemini Omni 1.1 Flash の比較ページをご覧ください。
PopcraftにおけるWan 3.0の料金
解像度ごとの出力秒数に応じた課金となります。リファレンスの添付は無料です。出力される長さはリクエスト通りになるため、生成前に表示される価格がそのまま支払い額となります。
すべてのプランにクレジットが含まれています。料金ページで全モデルの最新レートをご確認いただけます。無料プランのダウンロードにはPopcraftのウォーターマークが入りますが、有料プランでは解除されます。
Alibabaが推奨するWan 3.0の活用シーン
Alibaba公式のリリース資料にある3つのシナリオと、Popcraftでの実行方法です。
- 01
ショート動画:ドラマ仕立てのストーリーや広告ティーザー
エンターテインメント向けシナリオ。一つのプロンプトから最大30秒の物語(音声付き)を生成します。
- 02
Eコマース:商品画像からの製品紹介動画
「製品画像と説明文をアップロードするだけで、動的なショーケース動画を生成」。写真をImage 1として添付してください。
- 03
教育:シチュエーション・シミュレーション
医師の診察やサポートへの電話対応など、プロンプトから会話劇を生成し、教育コンテンツとして活用できます。
- 04
480pで下書き、1080pで本番出力
Popcraft独自の推奨フロー:1秒11クレジットの480pなら、30秒の下書きが330クレジットで試せます。納得したものを1080pで仕上げましょう。
Wan 3.0 — よくある質問
AlibabaのTongyi Labが開発したオールインワン動画モデルです。2026年8月にリリースされ、テキスト、画像、複数のリファレンスから、2〜30秒の動画を30fpsで一度に生成できます。映像と同時にセリフやBGM、効果音を生成するのが大きな特徴です。
2秒から30秒までの任意の秒数を、1回の生成で作成できます。継ぎ足しやステッチングは不要です。Popcraftのスライダーで長さを設定すると、その通りの秒数でファイルが出力されます。誤差は0.01秒単位と非常に正確です。
はい、デフォルトで生成します。Alibabaのガイドによると、セリフ、BGM、効果音をネイティブに出力可能です。Popcraftの「Audio」スイッチをオフにすれば、音声トラックなしのファイルを作成することもできます。
最大4枚の画像、5つの動画、5つの音声を添付し、プロンプト内で「Image 1」「Video 1」のように指定します。画像は被写体、動画は動き、音声は声色のリファレンスになります。動画と音声は合計15秒以内という制限があります。また、始点・終点画像を指定するキーフレーム機能は他のリファレンスと併用できません。
はい、それがこのモデルの得意分野です。キャラクターの外見、服装、小道具、環境の一貫性は主要機能の一つとして掲げられています。テストでも、キャラクターシートから被写体の一貫性が30秒間保たれることが確認されています。リファレンス画像を優先するため、大きな変更を加えたい場合はプロンプトで明確に指示してください。
Popcraft上のWan 3.0は、添付されたクリップを動きのリファレンスとして使用します。既存動画の延長や編集を行いたい場合は、専用の延長パネルがあるSeedance 2.5、またはGemini Omni 1.1 Flashをご利用ください。
音声リファレンスは「声の音色」を引き継ぐためのもので、話す内容はプロンプトで指定します。特定の録音データに合わせて口を動かすツールではないため、完璧なアフレコが必要な場合はOmniHumanなどのアバターモデルが適しています。
出力秒数ごとの課金です。1秒あたり、480pは11、720pは20、1080pは40クレジットです。30秒の下書き(480p)なら330クレジット、本番用(1080p)なら1,200クレジットとなります。生成前に価格が明示されるので安心です。
30秒の物語を、一度のリクエストで。まずは480pでお試しください。
330クレジットでストーリーを検証し、納得したら1080pで仕上げる。キャラクターシートと動画リファレンスを組み合わせて、新しい表現を始めましょう。
さらに探索
関連モデル
Seedance 2.5は、1回のジョブで最大30秒の動画を生成できます。最大50個のアセットを参照でき、動画編集の制御、高忠実度の時間軸拡張、0.4から2.5までの任意のアスペクト比、10以上の言語でのネイティブプロンプトに対応しています。Popcraftで公開中。
Gemini Omni 1.1 Flashは、あらゆる入力から動画を作成・編集するGoogleの動画モデルです。シーン拡張で最大40秒、1080pおよび4K出力、最初と最後のフレームの補間、最大10枚の参照画像、そして映像に合わせて音声、音楽、効果音を生成します。Popcraftで利用可能です。
MiniMax H3は、24fpsの2K動画と同期したステレオ音源(効果音、環境音、台詞)を一度に生成。1つのプロンプトからマルチショット生成、5〜15秒、最初と最後のフレーム制御に対応。Popcraftで公開中。
Popcraft で Seedance 2.0 を使い、テキスト・画像・クリップから映画品質の 4K 動画を生成。ネイティブ同期音声、マルチショットシーケンス、最大 4K (2160p) の極めて精細なディテール。