NEWバズる UGC 広告をワンクリックで。Studio が登場。広告を作成する
PopcraftPopcraft
最新動画生成モデル

Alibaba · Tongyi Lab(通義実験室)

Wan 3.0:30秒のAI動画を一度の生成で、音声も同時に

Wan 3.0は、Alibabaが提供するオールインワンのAI動画生成モデルです。プロンプト、画像、またはリファレンスセットから、2秒から30秒までの任意の長さの動画を1回の生成で作成。最大1080p・30 fpsに対応し、会話、音楽、効果音も同じジョブ内でレンダリングします。Popcraftでは1秒あたり11クレジットから利用可能です。

動画スタジオ、Canvasボード、MCPコネクタで利用可能

2–30 s
1回の生成で任意の秒数を指定
1080p 30 fps
480pおよび720pプランもあり
4 · 5 · 5 refs
画像、クリップ、オーディオ
11 cr / s
480pの場合 — 30秒で330クレジット
00秒、ワンテイク
ワンテイク · 音声同時生成 · 編集なし

ネイティブ対応の30秒生成

Alibabaが打ち出す最大の特長:ネイティブな30秒生成による「より完全なストーリーテリングとクリエイティブな自由」。上のメイン動画のタイムライン上の6つの時点と、実際に生成されたクリップのステータスをご確認ください。

1秒時点:楽屋の鏡に映る、隈取を施した役者の顔のアップ1s
6秒時点:鏡の前から立ち上がる、赤と金の衣装を纏った姿6s
12秒時点:楽屋の通路。彼女が通り過ぎる際、裏方たちが壁際に身を寄せる12s
18秒時点:赤いベルベットのカーテンに置かれた手18s
24秒時点:カーテンを抜け舞台の照明へ。背後に提灯が灯る客席が広がる24s
29秒時点:赤い提灯の下、満員の観客に向けて水袖を掲げる29s
一人の演者、一つの衣装、鏡から舞台までの流れるような一貫性 — 楽屋、通路、カーテン、満員の客席までを、カットなしの一度のリクエストで実現。
リクエストに対する出力結果
リクエスト出力内容生成時間
30秒 · 1080p · テキストのみ30.02秒 · 1920×1080 · ステレオ5分38秒
5秒 · 720p · テキストのみ5.04秒 · 1280×720 · ステレオ1分37秒
3秒および10秒 · 6秒のリファレンスクリップ使用3.02秒および10.03秒 · 長さではなく動きをリファレンス化各 約1分25秒

生成時間は2026年9月時点のPopcraft上での計測値。すべてのクリップがリクエストに対して0.01秒単位の精度で出力されるため、生成前に表示されたクレジットがそのまま消費額となります。

没入体験:リアリズム、質感、サウンドデザイン

Alibabaの言葉を借りれば「進化したリアリズム、質感、サウンドデザイン」。実写、映画レベルのCG、ブランドファンタジーの3つのスタイル。それぞれ一度のリクエスト、30秒の連続ワンカットで、サウンドトラックも同時に生成。変更したのはプロンプトのみです。

実写30.0s1 takelive action

カーテン

上のメイン動画:京劇の役者が楽屋から舞台へと進む様子。太鼓の音が響き、銅鑼が打ち鳴らされ、客席の歓声が沸き上がります。

映画風CG30.0s1 take3D-CG look

九尾の狐

提灯が灯る屋根の上を疾走する九尾の狐。提灯を散らしながら跳躍し、満月を背に塔へ着地。テキストプロンプトのみから生成された、絵画的な3Dルック。

ブランド・ファンタジー30.0s1 takebrand fantasy

自動販売機

雨の路地で黄色いレインコートの少女がボタンを押すと、ガラスの中の鮮やかなポップの世界へ引き込まれる。炭酸の弾ける音が花火に変わり、カメラは再び路地へと戻ります。

ここに掲載された動画はすべて未編集です。追加の音楽も使用していません。480pの下書きは各330クレジット、1080pは1,200クレジットです。

Wan 3.0とは?

Wan 3.0(万相 3.0)は、AlibabaのTongyi Lab(通義実験室)による動画生成モデルで、2026年8月6日にパブリックベータが開始され、8月24日に正式リリースされました。Alibabaはこのモデルをオールインワン・リファレンス動画モデルと呼んでいます。テキスト、画像、始点・終点フレームの制御、複数のリファレンスからの生成を、タスクごとのモデルに分けることなく一つのモデルで処理します。API専用(重みの一般公開はなし)であり、PopcraftではAlibabaが提供する2つのエディションのうち、より高速なプライム版を採用しています。

Alibaba Cloud Model Studioガイド、wan3.0-video APIリファレンス、公式README、および開発者コミュニティ向けサマリーより。上記の主張はAlibabaによるものであり、本ページでの測定値は自社調べです。

Alibaba公式の説明より
  1. 1回のリクエストで最大30秒の動画を、毎秒30フレームで安定して生成します。

    長さ

  2. セリフ、BGM、効果音をネイティブに出力。ポストプロダクションでのアフレコは不要です。

    サウンド

  3. キャラクターの外見、服装、小道具、環境、視覚スタイルの妥協のない一貫性。押し、引き、パン、トラッキングなどのカメラワークに対応。

    一貫性とカメラワーク

Alibabaが掲げる5つの主要機能
  1. ネイティブ30秒生成より完全なストーリーテリングとクリエイティブな自由を。Popcraftでは:2〜30秒の任意の長さを一度に生成可能。
  2. Omni-Creation(オムニ・クリエイション)ドキュメントやウェブページの解析を含む、最大20個のリファレンス素材に対応。Popcraftでは:画像4枚、クリップ5つ、オーディオ5つに対応。ドキュメント解析は準備中です。
  3. ピクセル単位の一貫性制作ワークフローにおける納品の確実性を向上。Popcraftでは:対応済み。下の静止画をご覧ください。
  4. 没入型体験進化したリアリズム、質感、サウンドデザイン。Popcraftでは:対応済み。映像と同時に会話、音楽、効果音を生成。
  5. 精密な動画編集制作効率を高める、より制御可能な編集機能。Popcraftでは現在未対応 — 編集や延長にはSeedance 2.5、Gemini Omniをご利用ください。

Omni-Creation:画像、クリップ、音声を一つのプロンプトで

Alibabaの第2の目玉機能 — マルチモーダル入力からの生成。Popcraftでは1回のリクエストで最大4枚の画像、5つの動画クリップ、5つの音声クリップを添付でき、プロンプト内で「Image 1」「Video 1」「Audio 1」のように指定して制御できます。Alibabaのプラットフォームにあるドキュメント解析機能はPopcraftでは現在準備中です。

Image 1 … Image 4

被写体、製品、セット

キャラクターシートで顔や衣装を固定し、製品写真で対象物を固定し、ロケハン写真でセットを固定。モデルは写真の内容を維持するため、変更したい箇所は明示的に指示してください。2枚の画像に「first frame(始点)」「last frame(終点)」と指定すれば、キーフレームとして機能します。

JPEG, PNG, WEBP, BMP · 短辺240px〜長辺8,000px · 各20 MBまで

Image 1の女性がImage 2の夕暮れの街を歩いている。カメラは彼女の横を並走。髪型、コート、バッグはImage 1と全く同じに保つこと。
Video 1 … Video 5

動き、カメラ、演技

クリップからカメラパスや演技の構成を新しいカットへ引き継ぎます。画像と組み合わせることで、画像内の被写体にクリップと同じ動きをさせることができます。クリップは動きを指定するものであり、長さはスライダーの設定に従います。

MP4, MOV · 各1〜15秒(合計15秒まで) · 各100 MBまで

Image 1の男性が柱の間に立っている。Video 1のカメラワークを正確に再現:低いワイドアングルから右へ回り込み、斜め前からのアップへ。
Audio 1 … Audio 5

声の音色やトラックのリズム

Alibabaの仕組み:オーディオは声色やリズムを決定し、話す内容はプロンプトで指定します。モデルは音声と口の動きを同時に生成します。既存の録音に口を合わせるツールではないため、特定音声でのリップシンクにはOmniHumanなどのアバターモデルを使用してください。

WAV, MP3 · 各1〜15秒(合計15秒まで) · 各15 MBまで

Audio 1の音色でキャラクターにこう言わせる:「本当?それは楽しみだ。いつ戻るの?」生成された音声が自然な口の動きを駆動させる。

キーフレームとリファレンスは併用できません。「始点」と「終点」に指定された2枚の画像はそれだけで独立したキーフレーム動画となりますが、それ以外(被写体画像、クリップ、音声)は制限内であれば自由に組み合わせ可能です。

ピクセル単位の一貫性

Alibabaの第3の特長:「制作ワークフローにおける納品の確実性を向上」。モデルカードには、フレームをまたいでキャラクターやリファレンスの詳細を保持すると記されています。上のメイン動画に登場する同じ演者の、28秒間隔の3つの時点を比較してください。

1秒時点、楽屋の鏡に映るメイクをした役者の顔1秒時点
12秒時点、楽屋の通路にいる同じ役者12秒時点
29秒時点、満員の観客の前に立つ舞台上の同じ役者29秒時点
鏡から舞台まで、同じ顔、同じ髪飾り、同じ衣装。 キャラクターシートや製品写真を「Image 1」として添付すれば、モデルは細部を維持します。テストでは、正方形の製品写真が16:9のフレーム内でも忠実に再現され、6秒のリファレンスクリップから被写体を変えずに3秒と10秒の結果を得ることができました。

Wan 3.0のプロンプトの書き方

モデルはプロンプトからクリップ全体の構成を計画するため、それがどのような種類のクリップかを指定する必要があります。「継続性の名称」を指定することで、レンダリングの安定性が飛躍的に向上しました。(例:1つの連続したショット、または番号付きのショットリスト)

ワンカット撮影の場合

「no cuts」と指示し、展開のタイミングを指定する

冒頭に「one continuous take, no cuts, no transitions」と記述。秒数ごとの展開とカメラワークの動詞を指定し、一人のメイン被写体をフレーム内に保ち、音声を独立した文章として記述します。メイン動画はこの方法で書かれ、一度のカットも挟まずに生成されました。

ONE CONTINUOUS TAKE, NO CUTS, NO TRANSITIONS, 30 s. Cinematic photoreal, high contrast. A Beijing-opera performer in painted-face makeup and a crimson-and-gold robe.
0–6 s: extreme close-up in a dressing-room mirror ringed with bulbs; she opens her eyes.
6–16 s: she walks down a narrow backstage corridor, stagehands flattening against the walls, the camera tracking backwards ahead of her as drums build.
16–24 s: she pushes through heavy red velvet curtains into blinding stage light; the camera swings behind her shoulder.
24–30 s: the reveal — a packed theatre under red lanterns; she raises one water-sleeve as a gong strikes.
Sound: drums building, footsteps, the curtain rush, one gong, applause. No dialogue, no on-screen text.
リファレンスを名前で呼ぶ
添付順に「Image 1, Video 1, Audio 1」と番号を振り、「Image 1はキャラクター用、Video 1はカメラワーク用」のように用途を明示します。
サウンドを演出する
デフォルトでは会話、音楽、効果音が生成されます。「雨の音と遠くの電車の音、セリフなし」のように要望を書くか、Audioスイッチをオフにして無音ファイルを作成します。
大きな変更は強調する
画像を添付すると、モデルはその内容を維持しようとします。天候や衣装、セットを大きく変えたい場合は、画像に頼らず、プロンプトでその変更を明示的に説明してください。
メイン被写体を一人に絞る
「単一の人物」「明確なカメラパス」「no cuts」の組み合わせが、最もクリーンなテイクを生みます。群衆や手、小さな小道具は、他の動画モデルと同様に精度が落ちる傾向があります。
下書きは安く、本番は高品質で
480pは1080pの4分の1の価格で同じモデルを使用できます。まずは480pでストーリーの繋がりを確認し、納得がいったものを同じプロンプトとリファレンスで1080pで再レンダリングしましょう。

Wan 3.0 vs Seedance 2.5 vs Gemini Omni 1.1 Flash

Popcraft上で映像と音声を同時に生成できる3つのモデルの比較。Wanの強みは、プラットフォーム最安の30秒生成とリファレンスへの忠実度。Seedanceはリファレンス数と編集・延長機能。Omniは4K対応と延長による40秒生成が魅力です。用途に合わせてお選びください。

機能Wan 3.0Seedance 2.5Gemini Omni 1.1 Flash
1リクエストでの最大秒数30秒(一度の生成で)30秒40秒(シーン延長による。4Kは30秒)
解像度480p / 720p / 1080p (30 fps)最大1080p360p(下書き)〜 4K
ネイティブオーディオセリフ、音楽、効果音(オフ可能)対応会話、音楽、効果音
リファレンス画像最大4枚最大30枚最大10枚
リファレンス動画最大5つ(合計15秒)最大10個最大3個
リファレンスオーディオ最大5つ(合計15秒)最大10個
編集・延長—(Seedance 2.5, Omniを使用)編集、前後への延長編集、10秒ごとの延長
30秒の下書き料金330クレジット (480p)解像度ごとの秒単価150クレジット (360p)

Wanの数値はAlibabaのガイドに基づき、Popcraftの制限は現在設定されている値です。プロバイダーの制限は変更される場合があります。詳細は Seedance 2.5 · Gemini Omni 1.1 Flash の比較ページをご覧ください。

PopcraftにおけるWan 3.0の料金

解像度ごとの出力秒数に応じた課金となります。リファレンスの添付は無料です。出力される長さはリクエスト通りになるため、生成前に表示される価格がそのまま支払い額となります。

480p
11 クレジット / 秒
下書き・構成確認用
30秒 = 330クレジット
720p
20 クレジット / 秒
SNS投稿用
15秒 = 300クレジット
1080p
40 クレジット / 秒
本番・メインコンテンツ用
30秒 = 1,200クレジット

すべてのプランにクレジットが含まれています。料金ページで全モデルの最新レートをご確認いただけます。無料プランのダウンロードにはPopcraftのウォーターマークが入りますが、有料プランでは解除されます。

Alibabaが推奨するWan 3.0の活用シーン

Alibaba公式のリリース資料にある3つのシナリオと、Popcraftでの実行方法です。

  • 01

    ショート動画:ドラマ仕立てのストーリーや広告ティーザー

    エンターテインメント向けシナリオ。一つのプロンプトから最大30秒の物語(音声付き)を生成します。

  • 02

    Eコマース:商品画像からの製品紹介動画

    「製品画像と説明文をアップロードするだけで、動的なショーケース動画を生成」。写真をImage 1として添付してください。

  • 03

    教育:シチュエーション・シミュレーション

    医師の診察やサポートへの電話対応など、プロンプトから会話劇を生成し、教育コンテンツとして活用できます。

  • 04

    480pで下書き、1080pで本番出力

    Popcraft独自の推奨フロー:1秒11クレジットの480pなら、30秒の下書きが330クレジットで試せます。納得したものを1080pで仕上げましょう。

Wan 3.0 — よくある質問

AlibabaのTongyi Labが開発したオールインワン動画モデルです。2026年8月にリリースされ、テキスト、画像、複数のリファレンスから、2〜30秒の動画を30fpsで一度に生成できます。映像と同時にセリフやBGM、効果音を生成するのが大きな特徴です。

2秒から30秒までの任意の秒数を、1回の生成で作成できます。継ぎ足しやステッチングは不要です。Popcraftのスライダーで長さを設定すると、その通りの秒数でファイルが出力されます。誤差は0.01秒単位と非常に正確です。

はい、デフォルトで生成します。Alibabaのガイドによると、セリフ、BGM、効果音をネイティブに出力可能です。Popcraftの「Audio」スイッチをオフにすれば、音声トラックなしのファイルを作成することもできます。

最大4枚の画像、5つの動画、5つの音声を添付し、プロンプト内で「Image 1」「Video 1」のように指定します。画像は被写体、動画は動き、音声は声色のリファレンスになります。動画と音声は合計15秒以内という制限があります。また、始点・終点画像を指定するキーフレーム機能は他のリファレンスと併用できません。

はい、それがこのモデルの得意分野です。キャラクターの外見、服装、小道具、環境の一貫性は主要機能の一つとして掲げられています。テストでも、キャラクターシートから被写体の一貫性が30秒間保たれることが確認されています。リファレンス画像を優先するため、大きな変更を加えたい場合はプロンプトで明確に指示してください。

Popcraft上のWan 3.0は、添付されたクリップを動きのリファレンスとして使用します。既存動画の延長や編集を行いたい場合は、専用の延長パネルがあるSeedance 2.5、またはGemini Omni 1.1 Flashをご利用ください。

音声リファレンスは「声の音色」を引き継ぐためのもので、話す内容はプロンプトで指定します。特定の録音データに合わせて口を動かすツールではないため、完璧なアフレコが必要な場合はOmniHumanなどのアバターモデルが適しています。

出力秒数ごとの課金です。1秒あたり、480pは11、720pは20、1080pは40クレジットです。30秒の下書き(480p)なら330クレジット、本番用(1080p)なら1,200クレジットとなります。生成前に価格が明示されるので安心です。

30秒の物語を、一度のリクエストで。まずは480pでお試しください。

330クレジットでストーリーを検証し、納得したら1080pで仕上げる。キャラクターシートと動画リファレンスを組み合わせて、新しい表現を始めましょう。

さらに探索

関連モデル