NEWสร้างโฆษณา UGC ให้เป็นไวรัลง่ายๆ เพียงคลิกเดียว พบกับ Studioสร้างโฆษณา
PopcraftPopcraft
โมเดลวิดีโอใหม่

Alibaba · Tongyi Lab

Wan 3.0: วิดีโอ AI 30 วินาทีในครั้งเดียว พร้อมเสียงในตัว

Wan 3.0 คือเครื่องมือสร้างวิดีโอ AI ครบวงจรจาก Alibaba เปลี่ยนคำสั่ง, รูปภาพ หรือชุดข้อมูลอ้างอิงให้เป็นวิดีโอ ความยาวตั้งแต่ 2 ถึง 30 วินาที ในคำขอเดียว ที่ความละเอียดสูงสุด 1080p 30 fps และเรนเดอร์ บทสนทนา ดนตรี และเสียงประกอบในงานเดียวกัน บน Popcraft เริ่มต้นที่ 11 เครดิตต่อวินาที

ใช้งานได้ในสตูดิโอวิดีโอ, กระดาน Canvas และตัวเชื่อมต่อ MCP

2–30 วินาที
เลือกความยาวได้ตามต้องการ, จบในครั้งเดียว
1080p 30 fps
รองรับระดับ 480p และ 720p ด้วย
4 · 5 · 5 ไฟล์อ้างอิง
รูปภาพ, คลิป, เสียง
11 เครดิต / วินาที
ที่ 480p — 330 สำหรับ 30 วินาที
00วินาที, ถ่ายต่อเนื่องในเทคเดียว
เทคเดียว · เสียงสร้างอัตโนมัติ · ไม่มีการตัดต่อ

ความยาว Native 30 วินาที

ฟีเจอร์เด่นอันดับแรกของ Alibaba: "การเล่าเรื่องที่สมบูรณ์ยิ่งขึ้นและอิสระในการสร้างสรรค์" จากการประมวลผล 30 วินาทีแบบ native วิดีโอหลักด้านบนแสดงให้เห็น 6 จุดบนไทม์ไลน์ พร้อมข้อมูลจริงที่ระบบและไฟล์ระบุเกี่ยวกับคลิปที่เราสร้างขึ้นสำหรับหน้านี้

วินาทีที่ 1: ภาพระยะใกล้ใบหน้าที่แต่งแต้มของนักแสดงในกระจกห้องแต่งตัว1s
วินาทีที่ 6: เธอลุกขึ้นจากหน้ากระจกในชุดคลุมสีแดงเข้มและสีทอง6s
วินาทีที่ 12: ทางเดินหลังเวที ทีมงานถอยชิดผนังเมื่อเธอเดินผ่าน12s
วินาทีที่ 18: มือของเธอวางบนม่านกำมะหยี่สีแดง18s
วินาทีที่ 24: ผ่านม่านเข้าสู่แสงไฟบนเวที เห็นที่นั่งผู้ชมที่ประดับด้วยโคมไฟเปิดกว้างอยู่ด้านหลัง24s
วินาทีที่ 29: ชูแขนเสื้อน้ำต่อหน้าโรงละครที่เต็มไปด้วยผู้ชมภายใต้โคมไฟสีแดง29s
นักแสดงคนเดียว ชุดเดิม โทนสีเดิม ตั้งแต่หน้ากระจกจนถึงบนเวที — ห้องแต่งตัว, ทางเดิน, ม่าน, ผู้ชมเต็มโรง ทั้งหมดในคำขอเดียวแบบไม่มีการตัดต่อ
สิ่งที่ได้รับเทียบกับคำขอ
คำขอสิ่งที่ได้รับเวลาที่ใช้จริง
30 วินาที · 1080p · ข้อความเท่านั้น30.02 วินาที · 1920×1080 · สเตอริโอ5 นาที 38 วินาที
5 วินาที · 720p · ข้อความเท่านั้น5.04 วินาที · 1280×720 · สเตอริโอ1 นาที 37 วินาที
3 วินาที และ 10 วินาที · จากคลิปอ้างอิง 6 วินาที3.02 วินาที และ 10.03 วินาที · คลิปกำหนดการเคลื่อนไหว ไม่ใช่ความยาว≈ 1 นาที 25 วินาที ต่อคลิป

เวลาที่ใช้จริงคือตั้งแต่ส่งคำขอจนถึงได้ไฟล์บน Popcraft ณ กันยายน 2026 ทุกคลิปส่งมอบภายในเสี้ยววินาทีที่ร้องขอ ดังนั้นเครดิตที่เห็นก่อนสร้างคือเครดิตที่คุณจ่ายจริง

ประสบการณ์ที่ดื่มด่ำ: ความสมจริง พื้นผิว และการออกแบบเสียง

คำนิยามของ Alibaba: "ยกระดับความสมจริง พื้นผิว และการออกแบบเสียง" วิดีโอสามเรื่อง สามสไตล์ — ไลฟ์แอ็กชัน, CG สไตล์ภาพยนตร์, แฟนตาซีแบรนด์ — แต่ละคลิป ส่งคำขอเดียว ถ่ายต่อเนื่อง 30 วินาที พร้อมเสียงประกอบที่สร้างในขั้นตอนเดียวกัน เปลี่ยนเพียงแค่คำสั่ง (prompt) เท่านั้น

ไลฟ์แอ็กชัน30.0s1 takelive action

ม่าน (Curtain)

วิดีโอหลักด้านบน: นักแสดงงิ้วจากกระจกห้องแต่งตัว เดินไปตามทางเดินหลังเวที ผ่านม่านกำมะหยี่ออกสู่เวทีต่อหน้าผู้ชม เสียงกลองรัว เสียงฆ้องตี และเสียงโห่ร้องของผู้ชม

CG สไตล์ภาพยนตร์30.0s1 take3D-CG look

จิ้งจอกเก้าหาง

จิ้งจอกเก้าหางวิ่งข้ามหลังคาที่ประดับด้วยโคมไฟ กระโดดข้ามช่องว่างขณะที่โคมไฟกระจายตัว ลอยตัวกลางดวงจันทร์เต็มดวง และลงจอดบนหอระฆังขณะที่โคมไฟของเมืองลอยขึ้น งานภาพ 3D สวยงามจากคำสั่งข้อความเพียงอย่างเดียว

แฟนตาซีแบรนด์30.0s1 takebrand fantasy

ตู้ขายของอัตโนมัติ

เด็กหญิงในชุดกันฝนสีเหลืองกดปุ่มในตรอกที่ฝนตกแล้วถูกดึงผ่านกระจกเข้าไปในโลกสีสันสดใส ที่ซึ่งมาสคอตยื่นกระป๋องให้เธอ เสียงซ่ากลายเป็นดอกไม้ไฟ และกล้องถอยกลับออกมายังตรอกเดิม

ทุกวิดีโอที่นี่แสดงผลตามที่ได้รับจริง: ไม่มีการตัดต่อ ไม่มีการเพิ่มดนตรี ร่างแบบ 480p ใช้ 330 เครดิตต่อคลิป ส่วน 1080p ใช้ 1,200 เครดิต

Wan 3.0 คืออะไร?

Wan 3.0 (万相 3.0) คือโมเดลวิดีโอจาก Tongyi Lab ของ Alibaba เปิดให้ทดสอบเบต้าตั้งแต่วันที่ 6 สิงหาคม 2026 และเปิดตัวในวันที่ 24 สิงหาคม Alibaba เรียกสิ่งนี้ว่า โมเดลวิดีโออ้างอิงแบบ all-in-one: โมเดลเดียวสำหรับ text-to-video, image-to-video, การควบคุมเฟรมแรกและเฟรมสุดท้าย และการสร้างจากข้อมูลอ้างอิงหลายชุด แทนที่จะแยกโมเดลตามประเภทงาน ใช้งานผ่าน API เท่านั้น — ไม่มีการเปิดเผยค่าน้ำหนัก — และ Popcraft รันเวอร์ชัน prime ซึ่งเป็นเวอร์ชันที่เร็วที่สุดจากสองตัวเลือกที่ Alibaba มีให้

คู่มือ Alibaba Cloud Model Studio และเอกสารอ้างอิง API สำหรับ wan3.0-video; ไฟล์ README ของ Wan 3.0 อย่างเป็นทางการ; บทสรุปการเปิดตัวของชุมชนนักพัฒนา Alibaba ข้อความอ้างอิงด้านบนมาจาก Alibaba ส่วนการวัดผลในหน้านี้เป็นของเราเอง

จากคำกล่าวของ Alibaba
  1. สร้างวิดีโอได้เสถียรสูงสุด 30 วินาทีต่อคำขอ ที่ 30 เฟรมต่อวินาที

    ความยาว

  2. ให้ผลลัพธ์บทสนทนา ดนตรีประกอบ และเสียงประกอบแบบ native — ไม่ต้องพากย์เสียงในภายหลัง

    เสียง

  3. ความสม่ำเสมอของรูปลักษณ์ตัวละคร, เสื้อผ้า, อุปกรณ์ประกอบฉาก, สภาพแวดล้อม และสไตล์ภาพ รองรับการเคลื่อนกล้องแบบ push, pull, pan และ tracking

    ความสม่ำเสมอและการเคลื่อนกล้อง

5 ฟีเจอร์หลักจาก Alibaba
  1. ความยาว Native 30 วินาทีการเล่าเรื่องที่สมบูรณ์ยิ่งขึ้นและอิสระในการสร้างสรรค์บน Popcraft: ความยาวใดก็ได้ตั้งแต่ 2 ถึง 30 วินาที ในครั้งเดียว
  2. Omni-Creationรองรับไฟล์อ้างอิงสูงสุด 20 รายการ พร้อมการประมวลผลเอกสารและหน้าเว็บบน Popcraft: รูปภาพ 4 รูป, คลิป 5 คลิป, เสียง 5 ไฟล์ ยังไม่รองรับเอกสารและหน้าเว็บ
  3. ความสม่ำเสมอระดับพิกเซลเพิ่มความแน่นอนในการส่งมอบงานสำหรับขั้นตอนการผลิตบน Popcraft: ใช่ — ดูภาพนิ่งด้านล่าง
  4. ประสบการณ์ที่ดื่มด่ำยกระดับความสมจริง พื้นผิว และการออกแบบเสียงบน Popcraft: ใช่ — บทสนทนา ดนตรี และเอฟเฟกต์ถูกสร้างพร้อมกับภาพ
  5. การตัดต่อวิดีโอที่แม่นยำการตัดต่อที่ควบคุมได้มากขึ้นเพื่อเพิ่มประสิทธิภาพในการสร้างสรรค์ยังไม่รองรับบน Popcraft — โปรดใช้ Seedance 2.5 หรือ Gemini Omni เพื่อแก้ไขหรือขยายวิดีโอ

Omni-Creation: รูปภาพ คลิป และเสียงในคำสั่งเดียว

ฟีเจอร์หลักอันดับสองของ Alibaba — สร้างจากอินพุตหลายรูปแบบ บน Popcraft คุณสามารถใส่ รูปภาพสูงสุด 4 รูป, คลิปวิดีโอ 5 คลิป และคลิปเสียง 5 คลิปในคำขอเดียว โดยระบุชื่อในคำสั่งว่าเป็น Image 1, Video 1 หรือ Audio 1 ตามลำดับที่แนบ แพลตฟอร์มของ Alibaba ยังประมวลผลเอกสารและหน้าเว็บได้ด้วย แต่ส่วนนั้นยังไม่มีบน Popcraft

Image 1 … Image 4

ตัวละคร, ผลิตภัณฑ์ และฉาก

แผ่นชีทตัวละครจะช่วยคงใบหน้าและเครื่องแต่งกาย ภาพสินค้าช่วยคงรูปวัตถุ ภาพสถานที่ช่วยคงฉาก โมเดลจะรักษาดีเทลที่มีในรูปไว้ ดังนั้นควรอธิบายส่วนที่เปลี่ยนแปลงให้ชัดเจน หากใช้รูปภาพสองรูปพร้อมระบุ "first frame" และ "last frame" ในคำสั่ง จะกลายเป็นคีย์เฟรมแทน

JPEG, PNG, WEBP หรือ BMP · 240 ถึง 8,000 px ต่อด้าน · ไฟล์ละ 20 MB

ผู้หญิงจาก Image 1 เดินไปตามถนนใน Image 2 ตอนพลบค่ำ กล้องเคลื่อนตามข้างตัวเธอ รักษาทรงผม เสื้อโค้ท และกระเป๋าให้เหมือนใน Image 1 ทุกประการ
Video 1 … Video 5

การเคลื่อนไหว กล้อง และการแสดง

คลิปจะถ่ายทอดทิศทางกล้อง การจัดตำแหน่ง และการแสดงไปยังช็อตใหม่ เมื่อใช้คู่กับรูปภาพ ตัวละครในรูปจะแสดงท่าทางตามคลิปในฉากของคลิปนั้น คลิปจะเป็นตัวกำหนดการเคลื่อนไหว ไม่ใช่ความยาว — ความยาวกำหนดได้ที่แถบเลื่อน

MP4 หรือ MOV · 1 ถึง 15 วินาทีต่อคลิป และรวมไม่เกิน 15 วินาที · ไฟล์ละ 100 MB

ผู้ชายจาก Image 1 ยืนอยู่ระหว่างเสา เคลื่อนกล้องตาม Video 1 ทุกประการ: มุมกว้างจากระดับต่ำโคจรไปทางขวาเข้าสู่ภาพโคลสอัพมุมเฉียง
Audio 1 … Audio 5

เนื้อเสียงของนักพากย์หรือจังหวะ

สูตรของ Alibaba: ไฟล์เสียงจะถ่ายทอดเสียงหรือจังหวะ ส่วนบทพูดจะใส่ไว้ในคำสั่ง โมเดลจะสร้างคำพูดและการขยับปากไปพร้อมกัน นี่ไม่ใช่เครื่องมือลิปซิงค์จากเสียงบันทึก — สำหรับงานลักษณะนั้น โปรดใช้โมเดลอวตารอย่าง OmniHuman

WAV หรือ MP3 · 1 ถึง 15 วินาทีต่อคลิป และรวมไม่เกิน 15 วินาที · ไฟล์ละ 15 MB

ใช้เนื้อเสียงจาก Audio 1 และให้ตัวละครพูดว่า: "จริงเหรอ? ฟังดูดีมากเลย — จะกลับมาเมื่อไหร่ล่ะ?" เสียงที่สร้างขึ้นจะควบคุมการขยับปากให้ดูเป็นธรรมชาติ

คีย์เฟรมและข้อมูลอ้างอิงไม่สามารถใช้ปนกันได้ รูปภาพสองรูปที่กำหนดเป็นเฟรมแรกและเฟรมสุดท้ายจะสร้างคลิปจากคีย์เฟรมด้วยตัวเอง ส่วนข้อมูลอ้างอิงอื่นๆ ทั้งหมด — รูปตัวละคร, คลิป, เสียง — สามารถผสมกันได้อย่างอิสระภายใต้ขีดจำกัดข้างต้น

ความสม่ำเสมอระดับพิกเซล

ฟีเจอร์เด่นอันดับสามของ Alibaba: "เพิ่มความแน่นอนในการส่งมอบงานสำหรับขั้นตอนการผลิต" — คำอธิบายโมเดลระบุว่าเป็นการรักษาตัวละครและรายละเอียดอ้างอิงตลอดทั้งเฟรม ภาพนักแสดงคนเดิมจากวิดีโอหลักใน 3 จุดที่ห่างกัน 28 วินาที

ใบหน้าของนักแสดงที่แต่งแต้มในกระจกห้องแต่งตัวที่วินาทีที่ 11 วินาที
นักแสดงคนเดิมในทางเดินหลังเวทีที่วินาทีที่ 1212 วินาที
นักแสดงคนเดิมบนเวทีต่อหน้าผู้ชมที่วินาทีที่ 2929 วินาที
ใบหน้าเดิม เครื่องประดับศีรษะเดิม ชุดเดิม ตั้งแต่หน้ากระจกจนถึงบนเวที เมื่อแนบแผ่นชีทตัวละครหรือภาพสินค้าเป็น Image 1 โมเดลจะรักษาดีเทลนั้นไว้ ในการทดสอบของเรา ภาพสินค้าสี่เหลี่ยมจัตุรัสถูกสร้างขึ้นได้อย่างถูกต้องในเฟรม 16:9 และคลิปอ้างอิง 6 วินาทีสามารถสร้างผลลัพธ์ 3 วินาทีและ 10 วินาทีได้โดยที่ตัวละครไม่เปลี่ยนไป

วิธีเขียนคำสั่งสำหรับ Wan 3.0

โมเดลจะวางแผนทั้งคลิปจากคำสั่ง ดังนั้นคำสั่งต้องระบุชัดเจนว่าเป็นคลิปประเภทใด ผลลัพธ์ของเราจะแม่นยำเสมอเมื่อระบุความต่อเนื่องไว้ในคำสั่ง — เช่น ช็อตเดียวต่อเนื่อง หรือรายการช็อตที่ใส่ตัวเลขกำกับ ส่วนที่เหลือจะตามมาเอง

สำหรับวิดีโอเทคเดียว

ระบุว่า "no cuts" แล้วกำหนดจังหวะเวลา

เริ่มต้นด้วย "one continuous take, no cuts, no transitions" กำหนดสิ่งที่ต้องทำและการเคลื่อนกล้องในแต่ละช่วงวินาที รักษาตัวละครหลักตัวเดียวในเฟรม และเขียนเรื่องเสียงแยกเป็นประโยคต่างหาก วิดีโอหลักของเราเขียนด้วยวิธีนี้และได้ผลลัพธ์ออกมาโดยไม่มีการตัดต่อเลย

ONE CONTINUOUS TAKE, NO CUTS, NO TRANSITIONS, 30 s. Cinematic photoreal, high contrast. นักแสดงงิ้วแต่งหน้าจัดและสวมชุดสีแดงเข้มและสีทอง
0–6 s: ภาพระยะใกล้มากในกระจกห้องแต่งตัวที่ล้อมรอบด้วยหลอดไฟ เธอเริ่มลืมตา
6–16 s: เธอเดินไปตามทางเดินหลังเวทีที่แคบ ทีมงานถอยชิดผนัง กล้องเคลื่อนถอยหลังนำหน้าเธอขณะที่เสียงกลองดังขึ้น
16–24 s: เธอผลักม่านกำมะหยี่สีแดงหนาหนักเข้าไปในแสงไฟบนเวทีที่สว่างจ้า กล้องเหวี่ยงไปด้านหลังไหล่ของเธอ
24–30 s: การเปิดตัว — โรงละครที่เนืองแน่นภายใต้โคมไฟสีแดง เธอชูแขนเสื้อน้ำขึ้นขณะที่เสียงฆ้องดังขึ้น
Sound: เสียงกลองดังขึ้น, เสียงฝีเท้า, เสียงม่านขยับ, เสียงฆ้องหนึ่งครั้ง, เสียงปรบมือ ไม่มีบทสนทนา ไม่มีข้อความบนหน้าจอ
ระบุชื่อไฟล์อ้างอิง
Image 1, Video 1, Audio 1 — ใส่ตัวเลขตามประเภทและลำดับที่แนบ — และระบุว่าแต่ละอย่างมีไว้เพื่ออะไร: "Image 1 คือตัวละคร; Video 1 คือการเคลื่อนกล้อง"
สั่งงานเรื่องเสียง
โดยค่าเริ่มต้นโมเดลจะสร้างบทสนทนา ดนตรี และเอฟเฟกต์ ระบุสิ่งที่คุณต้องการ — "เสียงฝนและเสียงรถรางไกลๆ, ไม่มีบทสนทนา" — หรือปิดสวิตช์ Audio เพื่อรับไฟล์ที่ไม่มีเสียง
เน้นส่วนที่ต้องการให้แม่นยำ
หากใส่รูปภาพ โมเดลจะรักษาดีเทลนั้นไว้ สำหรับการเปลี่ยนแปลงครั้งใหญ่ — เช่น สภาพอากาศ, เสื้อผ้า, ฉากที่ต่างไป — ให้อธิบายการเปลี่ยนแปลงนั้นให้ชัดเจน ดีกว่าหวังให้คำสั่งไปมีผลเหนือกว่ารูปภาพ
เน้นตัวละครหลักตัวเดียว
ตัวละครตัวเดียว ทิศทางกล้องที่ระบุชัดเจน และคำว่า "no cuts" ช่วยให้เราได้เทคที่สมบูรณ์ทุกครั้ง ฝูงชน มือ และอุปกรณ์ชิ้นเล็กๆ คือจุดที่โมเดลวิดีโอ (รวมถึงตัวนี้) อาจจะแสดงผลได้ไม่คมชัดนัก
ร่างแบบราคาถูก ส่งงานราคาจริง
480p คือโมเดลตัวเดียวกันแต่ราคาเพียง 1 ใน 4 ของ 1080p ทดสอบเนื้อเรื่องที่ 480p ก่อน แล้วค่อยเรนเดอร์ตัวที่เลือกอีกครั้งที่ 1080p ด้วยคำสั่งและไฟล์อ้างอิงเดิม

Wan 3.0 vs Seedance 2.5 vs Gemini Omni 1.1 Flash

โมเดลสามตัวบน Popcraft ที่สร้างเสียงพร้อมภาพได้ทั้งหมด จุดเด่นของ Wan คือการถ่าย 30 วินาทีที่ถูกที่สุดบนแพลตฟอร์มและการรักษาความสม่ำเสมอของไฟล์อ้างอิง ส่วน Seedance เด่นเรื่องจำนวนไฟล์อ้างอิง การตัดต่อ และการขยายวิดีโอ ส่วน Omni เด่นเรื่อง 4K และความยาว 40 วินาที เลือกตามลักษณะงาน

ความสามารถWan 3.0Seedance 2.5Gemini Omni 1.1 Flash
คลิปยาวที่สุดจากคำขอเดียว30 วินาทีในครั้งเดียว30 วินาที40 วินาทีโดยการขยายฉาก (30 วินาทีที่ 4K)
ความละเอียด480p / 720p / 1080p ที่ 30 fpsสูงสุด 1080pตั้งแต่ร่าง 360p จนถึง 4K
เสียง Nativeบทสนทนา, ดนตรี, เอฟเฟกต์; เลือกปิดได้มีคำพูด, ดนตรี, เสียงประกอบ
รูปภาพอ้างอิงสูงสุด 4 รูปสูงสุด 30 รูปสูงสุด 10 รูป
วิดีโออ้างอิงสูงสุด 5 คลิป, รวม 15 วินาทีสูงสุด 10 คลิปสูงสุด 3 คลิป
เสียงอ้างอิงสูงสุด 5 ไฟล์, รวม 15 วินาทีสูงสุด 10 ไฟล์
แก้ไขหรือขยายคลิป— (ใช้ Seedance 2.5 หรือ Omni)แก้ไข; ขยายก่อนหรือหลังแก้ไข; ขยายครั้งละ 10 วินาที
งานร่าง 30 วินาที330 เครดิตที่ 480pต่อวินาที ตามความละเอียด150 เครดิตที่ 360p

ตัวเลขของ Wan มาจากคู่มือ Alibaba Model Studio ส่วนขีดจำกัดของ Popcraft คือข้อมูลปัจจุบัน ขีดจำกัดอาจเปลี่ยนแปลงได้ เครื่องมือเลือกจะแสดงข้อมูลล่าสุดเสมอ เปรียบเทียบฉบับเต็ม: Seedance 2.5 · Gemini Omni 1.1 Flash

ราคา Wan 3.0 บน Popcraft

เรียกเก็บเงิน ตามจำนวนวินาทีที่ส่งมอบ แบ่งตามความละเอียด ไฟล์อ้างอิงแนบฟรี เนื่องจากความยาววิดีโอจะตรงตามคำขอ ราคาที่เห็นก่อนสร้างจึงเป็นราคาที่คุณจ่ายจริง

480p
11 เครดิต / วินาที
งานร่าง
30 วินาที = 330 เครดิต
720p
20 เครดิต / วินาที
โซเชียล
15 วินาที = 300 เครดิต
1080p
40 เครดิต / วินาที
งานหลักคุณภาพสูง
30 วินาที = 1,200 เครดิต

ทุกแพ็กเกจรวมเครดิตไว้แล้ว หน้า ราคา จะแสดงอัตราปัจจุบันของทุกโมเดล การดาวน์โหลดในแพ็กเกจฟรีจะมีลายน้ำ Popcraft ซึ่งแพ็กเกจแบบชำระเงินจะไม่มีลายน้ำนี้

Wan 3.0 เหมาะกับงานอะไร

สถานการณ์สามรูปแบบจากสื่อเปิดตัวของ Alibaba และวิธีใช้งานบน Popcraft

  • 01

    เนื้อหาวิดีโอสั้น: การเล่าเรื่องและโฆษณาตัวอย่าง

    รูปแบบความบันเทิงของ Alibaba สร้างเรื่องราวหลายช็อตความยาวสูงสุด 30 วินาทีจากคำสั่งเดียว พร้อมเสียงประกอบ

  • 02

    อีคอมเมิร์ซ: นำเสนอสินค้าจากภาพนิ่ง

    รูปแบบอีคอมเมิร์ซของ Alibaba — "อัปโหลดภาพสินค้าพร้อมคำอธิบาย เพื่อรับวิดีโอนำเสนอที่น่าสนใจ" แนบรูปถ่ายเป็น Image 1

  • 03

    การศึกษา: จำลองสถานการณ์จำลอง

    รูปแบบการศึกษาของ Alibaba — เช่น การจำลองการปรึกษาแพทย์หรือการสนับสนุนลูกค้าจากคำสั่ง พร้อมบทสนทนาที่สร้างขึ้น

  • 04

    ร่างที่ 480p ส่งงานที่ 1080p

    ส่วนเสริมจาก Popcraft: 11 เครดิตต่อวินาทีที่ 480p ทำให้งานร่าง 30 วินาทีใช้เพียง 330 เครดิต ก่อนตัดสินใจเรนเดอร์ที่ 1080p

Wan 3.0 — คำถามที่พบบ่อย

โมเดลวิดีโอแบบ all-in-one จาก Tongyi Lab ของ Alibaba เปิดทดสอบเบต้าตั้งแต่วันที่ 6 สิงหาคม 2026 และเปิดตัวในวันที่ 24 สิงหาคม โมเดลเดียวครอบคลุมงาน text-to-video, image-to-video, การควบคุมเฟรมแรกและสุดท้าย และการสร้างจากหลายข้อมูลอ้างอิง ผลิตวิดีโอความยาว 2 ถึง 30 วินาทีในครั้งเดียวที่ 30 fps และสร้างบทสนทนา ดนตรี และเอฟเฟกต์เสียงไปพร้อมกับภาพ

ความยาวเท่าใดก็ได้ตั้งแต่ 2 ถึง 30 วินาทีเต็ม ในครั้งเดียว — ไม่มีการขยายหรือตัดต่อเพิ่มเติม บน Popcraft คุณกำหนดความยาวได้จากแถบเลื่อนและไฟล์ที่ได้รับจะตรงตามที่ร้องขอ และคุณจ่ายเงินตามจำนวนวินาทีที่เกิดขึ้นจริงเหล่านั้น

ได้ โดยค่าเริ่มต้น คู่มือของ Alibaba ระบุว่าโมเดล "ให้ผลลัพธ์บทสนทนา ดนตรี และเอฟเฟกต์เสียงแบบ native" และให้คุณระบุบทพูดและเสียงในคำสั่งได้ สวิตช์ Audio บน Popcraft สามารถปิดส่วนนี้ได้ และคลิปที่สร้างขณะปิดสวิตช์จะไม่มีแทร็กเสียงเลย

แนบรูปภาพสูงสุด 4 รูป, คลิปวิดีโอ 5 คลิป และคลิปเสียง 5 ไฟล์ แล้วอ้างอิงในคำสั่งเป็น Image 1, Video 1, Audio 1 ไปเรื่อยๆ รูปภาพใช้กำหนดตัวละครหรือฉาก วิดีโอกำหนดการเคลื่อนไหวและมุมกล้อง ส่วนเสียงใช้กำหนดเนื้อเสียงหรือจังหวะ วิดีโอและเสียงจำกัดความยาวรวมอย่างละ 15 วินาที รูปภาพสองรูปที่ระบุเป็นเฟรมแรกและเฟรมสุดท้ายจะกลายเป็นคีย์เฟรมแทน และไม่สามารถใช้คีย์เฟรมร่วมกับข้อมูลอ้างอิงอื่นได้

นั่นคือจุดประสงค์หลักของโมเดลนี้ Alibaba ระบุว่าความสม่ำเสมอของตัวละคร, เครื่องแต่งกาย, อุปกรณ์ประกอบฉาก และสภาพแวดล้อมเป็นความสามารถหลัก และในการทดสอบของเรา แผ่นชีทตัวละครยังคงเอกลักษณ์ได้ตลอดการเคลื่อนกล้องในคลิปอ้างอิง ภาพสินค้าถูกสร้างใหม่ได้อย่างแม่นยำในเฟรม 16:9 และตัวละครตัวเดียวยังคงเดิมตลอดเทค 30 วินาที

ปัจจุบันบน Popcraft ยังทำไม่ได้ Wan 3.0 ใช้คลิปที่แนบเป็นข้อมูลอ้างอิงสำหรับการเคลื่อนไหวและมุมกล้อง หากต้องการขยายหรือแก้ไขฟุตเทจ โปรดใช้ Seedance 2.5 หรือ Gemini Omni 1.1 Flash ซึ่งมีเครื่องมือขยายวิดีโอ

Alibaba อธิบายว่าไฟล์เสียงอ้างอิงใช้เพื่อกำหนดเนื้อเสียงและจังหวะ โดยใส่บทพูดไว้ในคำสั่ง จากนั้นโมเดลจะสร้างเสียงและการขยับปากให้สัมพันธ์กัน นี่ไม่ใช่เครื่องมือสำหรับนำเสียงบันทึกมาขยับปากโดยตรง สำหรับงานลักษณะนั้น โปรดใช้โมเดลอวตารอย่าง OmniHuman

Wan 3.0 เรียกเก็บเงินตามวินาทีที่ส่งมอบ: 11 เครดิตที่ 480p, 20 ที่ 720p และ 40 ที่ 1080p งานร่าง 30 วินาทีที่ 480p ใช้ 330 เครดิต คลิปเดียวกันที่ 1080p ใช้ 1,200 เครดิต ระบบจะแสดงราคาตามความยาวและความละเอียดก่อนที่คุณจะสร้าง และการดาวน์โหลดในแพ็กเกจฟรีจะมีลายน้ำ Popcraft

สามสิบวินาที ในคำขอเดียว ลองเลยที่ 480p ก่อน

ร่างงานด้วย 330 เครดิต เพื่อดูเนื้อเรื่อง แล้วค่อยเรนเดอร์ตัวที่ถูกใจที่ 1080p — หรือนำแผ่นชีทตัวละครมาเจอกับคลิปอ้างอิงที่นี่

สำรวจต่อ

โมเดลที่เกี่ยวข้อง

Seedance 2.5
ByteDance

Seedance 2.5 สร้างวิดีโอได้สูงสุด 30 วินาทีในครั้งเดียว พร้อมสินทรัพย์อ้างอิงสูงสุด 50 รายการ ตัดต่อวิดีโอที่ควบคุมได้ ขยายเวลาแบบความเที่ยงตรงสูง อัตราส่วนภาพตั้งแต่ 0.4 ถึง 2.5 และพรอมต์ภาษาท้องถิ่นในกว่า 10 ภาษา พร้อมใช้งานบน Popcraft

Gemini Omni 1.1 Flash
Google

Gemini Omni 1.1 Flash คือโมเดลวิดีโอของ Google ที่สร้างและแก้ไขวิดีโอจากอินพุตใดๆ ขยายฉากได้สูงสุด 40 วินาที เอาต์พุต 1080p และ 4K การประมาณค่าเฟรมแรกและเฟรมสุดท้าย ภาพอ้างอิงสูงสุด 10 ภาพ และเสียงพูด ดนตรี และเอฟเฟกต์เสียงที่สร้างพร้อมกับภาพ เปิดให้บริการบน Popcraft

MiniMax H3
MiniMax

MiniMax H3 สร้างวิดีโอ 2K 24fps พร้อมเสียงสเตอริโอที่ซิงค์กัน ทั้งเอฟเฟกต์ เสียงบรรยากาศ และบทสนทนาในงานเดียว ถ่ายหลายช็อตจากพรอมต์เดียว ความยาว 5 ถึง 15 วินาที พร้อมระบบควบคุมเฟรมแรกและเฟรมสุดท้าย ใช้งานได้แล้วบน Popcraft

Seedance 2.0 4K
ByteDance

สร้างวิดีโอระดับภาพยนตร์ความละเอียด 4K จากข้อความ รูปภาพ หรือคลิปด้วย Seedance 2.0 บน Popcraft เสียงซิงค์เนทีฟ ลำดับหลายช็อต และรายละเอียดคมชัดสูงสุดถึง 4K (2160p)