Alibaba · Tongyi Lab
Wan 3.0: วิดีโอ AI 30 วินาทีในครั้งเดียว พร้อมเสียงในตัว
Wan 3.0 คือเครื่องมือสร้างวิดีโอ AI ครบวงจรจาก Alibaba เปลี่ยนคำสั่ง, รูปภาพ หรือชุดข้อมูลอ้างอิงให้เป็นวิดีโอ ความยาวตั้งแต่ 2 ถึง 30 วินาที ในคำขอเดียว ที่ความละเอียดสูงสุด 1080p 30 fps และเรนเดอร์ บทสนทนา ดนตรี และเสียงประกอบในงานเดียวกัน บน Popcraft เริ่มต้นที่ 11 เครดิตต่อวินาที
ใช้งานได้ในสตูดิโอวิดีโอ, กระดาน Canvas และตัวเชื่อมต่อ MCP
- 2–30 วินาที
- เลือกความยาวได้ตามต้องการ, จบในครั้งเดียว
- 1080p 30 fps
- รองรับระดับ 480p และ 720p ด้วย
- 4 · 5 · 5 ไฟล์อ้างอิง
- รูปภาพ, คลิป, เสียง
- 11 เครดิต / วินาที
- ที่ 480p — 330 สำหรับ 30 วินาที
ความยาว Native 30 วินาที
ฟีเจอร์เด่นอันดับแรกของ Alibaba: "การเล่าเรื่องที่สมบูรณ์ยิ่งขึ้นและอิสระในการสร้างสรรค์" จากการประมวลผล 30 วินาทีแบบ native วิดีโอหลักด้านบนแสดงให้เห็น 6 จุดบนไทม์ไลน์ พร้อมข้อมูลจริงที่ระบบและไฟล์ระบุเกี่ยวกับคลิปที่เราสร้างขึ้นสำหรับหน้านี้
1s
6s
12s
18s
24s
29s| คำขอ | สิ่งที่ได้รับ | เวลาที่ใช้จริง |
|---|---|---|
| 30 วินาที · 1080p · ข้อความเท่านั้น | 30.02 วินาที · 1920×1080 · สเตอริโอ | 5 นาที 38 วินาที |
| 5 วินาที · 720p · ข้อความเท่านั้น | 5.04 วินาที · 1280×720 · สเตอริโอ | 1 นาที 37 วินาที |
| 3 วินาที และ 10 วินาที · จากคลิปอ้างอิง 6 วินาที | 3.02 วินาที และ 10.03 วินาที · คลิปกำหนดการเคลื่อนไหว ไม่ใช่ความยาว | ≈ 1 นาที 25 วินาที ต่อคลิป |
เวลาที่ใช้จริงคือตั้งแต่ส่งคำขอจนถึงได้ไฟล์บน Popcraft ณ กันยายน 2026 ทุกคลิปส่งมอบภายในเสี้ยววินาทีที่ร้องขอ ดังนั้นเครดิตที่เห็นก่อนสร้างคือเครดิตที่คุณจ่ายจริง
ประสบการณ์ที่ดื่มด่ำ: ความสมจริง พื้นผิว และการออกแบบเสียง
คำนิยามของ Alibaba: "ยกระดับความสมจริง พื้นผิว และการออกแบบเสียง" วิดีโอสามเรื่อง สามสไตล์ — ไลฟ์แอ็กชัน, CG สไตล์ภาพยนตร์, แฟนตาซีแบรนด์ — แต่ละคลิป ส่งคำขอเดียว ถ่ายต่อเนื่อง 30 วินาที พร้อมเสียงประกอบที่สร้างในขั้นตอนเดียวกัน เปลี่ยนเพียงแค่คำสั่ง (prompt) เท่านั้น
ม่าน (Curtain)
วิดีโอหลักด้านบน: นักแสดงงิ้วจากกระจกห้องแต่งตัว เดินไปตามทางเดินหลังเวที ผ่านม่านกำมะหยี่ออกสู่เวทีต่อหน้าผู้ชม เสียงกลองรัว เสียงฆ้องตี และเสียงโห่ร้องของผู้ชม
จิ้งจอกเก้าหาง
จิ้งจอกเก้าหางวิ่งข้ามหลังคาที่ประดับด้วยโคมไฟ กระโดดข้ามช่องว่างขณะที่โคมไฟกระจายตัว ลอยตัวกลางดวงจันทร์เต็มดวง และลงจอดบนหอระฆังขณะที่โคมไฟของเมืองลอยขึ้น งานภาพ 3D สวยงามจากคำสั่งข้อความเพียงอย่างเดียว
ตู้ขายของอัตโนมัติ
เด็กหญิงในชุดกันฝนสีเหลืองกดปุ่มในตรอกที่ฝนตกแล้วถูกดึงผ่านกระจกเข้าไปในโลกสีสันสดใส ที่ซึ่งมาสคอตยื่นกระป๋องให้เธอ เสียงซ่ากลายเป็นดอกไม้ไฟ และกล้องถอยกลับออกมายังตรอกเดิม
ทุกวิดีโอที่นี่แสดงผลตามที่ได้รับจริง: ไม่มีการตัดต่อ ไม่มีการเพิ่มดนตรี ร่างแบบ 480p ใช้ 330 เครดิตต่อคลิป ส่วน 1080p ใช้ 1,200 เครดิต
Wan 3.0 คืออะไร?
Wan 3.0 (万相 3.0) คือโมเดลวิดีโอจาก Tongyi Lab ของ Alibaba เปิดให้ทดสอบเบต้าตั้งแต่วันที่ 6 สิงหาคม 2026 และเปิดตัวในวันที่ 24 สิงหาคม Alibaba เรียกสิ่งนี้ว่า โมเดลวิดีโออ้างอิงแบบ all-in-one: โมเดลเดียวสำหรับ text-to-video, image-to-video, การควบคุมเฟรมแรกและเฟรมสุดท้าย และการสร้างจากข้อมูลอ้างอิงหลายชุด แทนที่จะแยกโมเดลตามประเภทงาน ใช้งานผ่าน API เท่านั้น — ไม่มีการเปิดเผยค่าน้ำหนัก — และ Popcraft รันเวอร์ชัน prime ซึ่งเป็นเวอร์ชันที่เร็วที่สุดจากสองตัวเลือกที่ Alibaba มีให้
คู่มือ Alibaba Cloud Model Studio และเอกสารอ้างอิง API สำหรับ wan3.0-video; ไฟล์ README ของ Wan 3.0 อย่างเป็นทางการ; บทสรุปการเปิดตัวของชุมชนนักพัฒนา Alibaba ข้อความอ้างอิงด้านบนมาจาก Alibaba ส่วนการวัดผลในหน้านี้เป็นของเราเอง
“สร้างวิดีโอได้เสถียรสูงสุด 30 วินาทีต่อคำขอ ที่ 30 เฟรมต่อวินาที”
ความยาว
“ให้ผลลัพธ์บทสนทนา ดนตรีประกอบ และเสียงประกอบแบบ native — ไม่ต้องพากย์เสียงในภายหลัง”
เสียง
“ความสม่ำเสมอของรูปลักษณ์ตัวละคร, เสื้อผ้า, อุปกรณ์ประกอบฉาก, สภาพแวดล้อม และสไตล์ภาพ รองรับการเคลื่อนกล้องแบบ push, pull, pan และ tracking”
ความสม่ำเสมอและการเคลื่อนกล้อง
- ความยาว Native 30 วินาที“การเล่าเรื่องที่สมบูรณ์ยิ่งขึ้นและอิสระในการสร้างสรรค์”บน Popcraft: ความยาวใดก็ได้ตั้งแต่ 2 ถึง 30 วินาที ในครั้งเดียว
- Omni-Creation“รองรับไฟล์อ้างอิงสูงสุด 20 รายการ พร้อมการประมวลผลเอกสารและหน้าเว็บ”บน Popcraft: รูปภาพ 4 รูป, คลิป 5 คลิป, เสียง 5 ไฟล์ ยังไม่รองรับเอกสารและหน้าเว็บ
- ความสม่ำเสมอระดับพิกเซล“เพิ่มความแน่นอนในการส่งมอบงานสำหรับขั้นตอนการผลิต”บน Popcraft: ใช่ — ดูภาพนิ่งด้านล่าง
- ประสบการณ์ที่ดื่มด่ำ“ยกระดับความสมจริง พื้นผิว และการออกแบบเสียง”บน Popcraft: ใช่ — บทสนทนา ดนตรี และเอฟเฟกต์ถูกสร้างพร้อมกับภาพ
- การตัดต่อวิดีโอที่แม่นยำ“การตัดต่อที่ควบคุมได้มากขึ้นเพื่อเพิ่มประสิทธิภาพในการสร้างสรรค์”ยังไม่รองรับบน Popcraft — โปรดใช้ Seedance 2.5 หรือ Gemini Omni เพื่อแก้ไขหรือขยายวิดีโอ
Omni-Creation: รูปภาพ คลิป และเสียงในคำสั่งเดียว
ฟีเจอร์หลักอันดับสองของ Alibaba — สร้างจากอินพุตหลายรูปแบบ บน Popcraft คุณสามารถใส่ รูปภาพสูงสุด 4 รูป, คลิปวิดีโอ 5 คลิป และคลิปเสียง 5 คลิปในคำขอเดียว โดยระบุชื่อในคำสั่งว่าเป็น Image 1, Video 1 หรือ Audio 1 ตามลำดับที่แนบ แพลตฟอร์มของ Alibaba ยังประมวลผลเอกสารและหน้าเว็บได้ด้วย แต่ส่วนนั้นยังไม่มีบน Popcraft
ตัวละคร, ผลิตภัณฑ์ และฉาก
แผ่นชีทตัวละครจะช่วยคงใบหน้าและเครื่องแต่งกาย ภาพสินค้าช่วยคงรูปวัตถุ ภาพสถานที่ช่วยคงฉาก โมเดลจะรักษาดีเทลที่มีในรูปไว้ ดังนั้นควรอธิบายส่วนที่เปลี่ยนแปลงให้ชัดเจน หากใช้รูปภาพสองรูปพร้อมระบุ "first frame" และ "last frame" ในคำสั่ง จะกลายเป็นคีย์เฟรมแทน
JPEG, PNG, WEBP หรือ BMP · 240 ถึง 8,000 px ต่อด้าน · ไฟล์ละ 20 MB
ผู้หญิงจาก Image 1 เดินไปตามถนนใน Image 2 ตอนพลบค่ำ กล้องเคลื่อนตามข้างตัวเธอ รักษาทรงผม เสื้อโค้ท และกระเป๋าให้เหมือนใน Image 1 ทุกประการ
การเคลื่อนไหว กล้อง และการแสดง
คลิปจะถ่ายทอดทิศทางกล้อง การจัดตำแหน่ง และการแสดงไปยังช็อตใหม่ เมื่อใช้คู่กับรูปภาพ ตัวละครในรูปจะแสดงท่าทางตามคลิปในฉากของคลิปนั้น คลิปจะเป็นตัวกำหนดการเคลื่อนไหว ไม่ใช่ความยาว — ความยาวกำหนดได้ที่แถบเลื่อน
MP4 หรือ MOV · 1 ถึง 15 วินาทีต่อคลิป และรวมไม่เกิน 15 วินาที · ไฟล์ละ 100 MB
ผู้ชายจาก Image 1 ยืนอยู่ระหว่างเสา เคลื่อนกล้องตาม Video 1 ทุกประการ: มุมกว้างจากระดับต่ำโคจรไปทางขวาเข้าสู่ภาพโคลสอัพมุมเฉียง
เนื้อเสียงของนักพากย์หรือจังหวะ
สูตรของ Alibaba: ไฟล์เสียงจะถ่ายทอดเสียงหรือจังหวะ ส่วนบทพูดจะใส่ไว้ในคำสั่ง โมเดลจะสร้างคำพูดและการขยับปากไปพร้อมกัน นี่ไม่ใช่เครื่องมือลิปซิงค์จากเสียงบันทึก — สำหรับงานลักษณะนั้น โปรดใช้โมเดลอวตารอย่าง OmniHuman
WAV หรือ MP3 · 1 ถึง 15 วินาทีต่อคลิป และรวมไม่เกิน 15 วินาที · ไฟล์ละ 15 MB
ใช้เนื้อเสียงจาก Audio 1 และให้ตัวละครพูดว่า: "จริงเหรอ? ฟังดูดีมากเลย — จะกลับมาเมื่อไหร่ล่ะ?" เสียงที่สร้างขึ้นจะควบคุมการขยับปากให้ดูเป็นธรรมชาติ
คีย์เฟรมและข้อมูลอ้างอิงไม่สามารถใช้ปนกันได้ รูปภาพสองรูปที่กำหนดเป็นเฟรมแรกและเฟรมสุดท้ายจะสร้างคลิปจากคีย์เฟรมด้วยตัวเอง ส่วนข้อมูลอ้างอิงอื่นๆ ทั้งหมด — รูปตัวละคร, คลิป, เสียง — สามารถผสมกันได้อย่างอิสระภายใต้ขีดจำกัดข้างต้น
ความสม่ำเสมอระดับพิกเซล
ฟีเจอร์เด่นอันดับสามของ Alibaba: "เพิ่มความแน่นอนในการส่งมอบงานสำหรับขั้นตอนการผลิต" — คำอธิบายโมเดลระบุว่าเป็นการรักษาตัวละครและรายละเอียดอ้างอิงตลอดทั้งเฟรม ภาพนักแสดงคนเดิมจากวิดีโอหลักใน 3 จุดที่ห่างกัน 28 วินาที
1 วินาที
12 วินาที
29 วินาทีวิธีเขียนคำสั่งสำหรับ Wan 3.0
โมเดลจะวางแผนทั้งคลิปจากคำสั่ง ดังนั้นคำสั่งต้องระบุชัดเจนว่าเป็นคลิปประเภทใด ผลลัพธ์ของเราจะแม่นยำเสมอเมื่อระบุความต่อเนื่องไว้ในคำสั่ง — เช่น ช็อตเดียวต่อเนื่อง หรือรายการช็อตที่ใส่ตัวเลขกำกับ ส่วนที่เหลือจะตามมาเอง
ระบุว่า "no cuts" แล้วกำหนดจังหวะเวลา
เริ่มต้นด้วย "one continuous take, no cuts, no transitions" กำหนดสิ่งที่ต้องทำและการเคลื่อนกล้องในแต่ละช่วงวินาที รักษาตัวละครหลักตัวเดียวในเฟรม และเขียนเรื่องเสียงแยกเป็นประโยคต่างหาก วิดีโอหลักของเราเขียนด้วยวิธีนี้และได้ผลลัพธ์ออกมาโดยไม่มีการตัดต่อเลย
ONE CONTINUOUS TAKE, NO CUTS, NO TRANSITIONS, 30 s. Cinematic photoreal, high contrast. นักแสดงงิ้วแต่งหน้าจัดและสวมชุดสีแดงเข้มและสีทอง 0–6 s: ภาพระยะใกล้มากในกระจกห้องแต่งตัวที่ล้อมรอบด้วยหลอดไฟ เธอเริ่มลืมตา 6–16 s: เธอเดินไปตามทางเดินหลังเวทีที่แคบ ทีมงานถอยชิดผนัง กล้องเคลื่อนถอยหลังนำหน้าเธอขณะที่เสียงกลองดังขึ้น 16–24 s: เธอผลักม่านกำมะหยี่สีแดงหนาหนักเข้าไปในแสงไฟบนเวทีที่สว่างจ้า กล้องเหวี่ยงไปด้านหลังไหล่ของเธอ 24–30 s: การเปิดตัว — โรงละครที่เนืองแน่นภายใต้โคมไฟสีแดง เธอชูแขนเสื้อน้ำขึ้นขณะที่เสียงฆ้องดังขึ้น Sound: เสียงกลองดังขึ้น, เสียงฝีเท้า, เสียงม่านขยับ, เสียงฆ้องหนึ่งครั้ง, เสียงปรบมือ ไม่มีบทสนทนา ไม่มีข้อความบนหน้าจอ
- ระบุชื่อไฟล์อ้างอิง
- Image 1, Video 1, Audio 1 — ใส่ตัวเลขตามประเภทและลำดับที่แนบ — และระบุว่าแต่ละอย่างมีไว้เพื่ออะไร: "Image 1 คือตัวละคร; Video 1 คือการเคลื่อนกล้อง"
- สั่งงานเรื่องเสียง
- โดยค่าเริ่มต้นโมเดลจะสร้างบทสนทนา ดนตรี และเอฟเฟกต์ ระบุสิ่งที่คุณต้องการ — "เสียงฝนและเสียงรถรางไกลๆ, ไม่มีบทสนทนา" — หรือปิดสวิตช์ Audio เพื่อรับไฟล์ที่ไม่มีเสียง
- เน้นส่วนที่ต้องการให้แม่นยำ
- หากใส่รูปภาพ โมเดลจะรักษาดีเทลนั้นไว้ สำหรับการเปลี่ยนแปลงครั้งใหญ่ — เช่น สภาพอากาศ, เสื้อผ้า, ฉากที่ต่างไป — ให้อธิบายการเปลี่ยนแปลงนั้นให้ชัดเจน ดีกว่าหวังให้คำสั่งไปมีผลเหนือกว่ารูปภาพ
- เน้นตัวละครหลักตัวเดียว
- ตัวละครตัวเดียว ทิศทางกล้องที่ระบุชัดเจน และคำว่า "no cuts" ช่วยให้เราได้เทคที่สมบูรณ์ทุกครั้ง ฝูงชน มือ และอุปกรณ์ชิ้นเล็กๆ คือจุดที่โมเดลวิดีโอ (รวมถึงตัวนี้) อาจจะแสดงผลได้ไม่คมชัดนัก
- ร่างแบบราคาถูก ส่งงานราคาจริง
- 480p คือโมเดลตัวเดียวกันแต่ราคาเพียง 1 ใน 4 ของ 1080p ทดสอบเนื้อเรื่องที่ 480p ก่อน แล้วค่อยเรนเดอร์ตัวที่เลือกอีกครั้งที่ 1080p ด้วยคำสั่งและไฟล์อ้างอิงเดิม
Wan 3.0 vs Seedance 2.5 vs Gemini Omni 1.1 Flash
โมเดลสามตัวบน Popcraft ที่สร้างเสียงพร้อมภาพได้ทั้งหมด จุดเด่นของ Wan คือการถ่าย 30 วินาทีที่ถูกที่สุดบนแพลตฟอร์มและการรักษาความสม่ำเสมอของไฟล์อ้างอิง ส่วน Seedance เด่นเรื่องจำนวนไฟล์อ้างอิง การตัดต่อ และการขยายวิดีโอ ส่วน Omni เด่นเรื่อง 4K และความยาว 40 วินาที เลือกตามลักษณะงาน
| ความสามารถ | Wan 3.0 | Seedance 2.5 | Gemini Omni 1.1 Flash |
|---|---|---|---|
| คลิปยาวที่สุดจากคำขอเดียว | 30 วินาทีในครั้งเดียว | 30 วินาที | 40 วินาทีโดยการขยายฉาก (30 วินาทีที่ 4K) |
| ความละเอียด | 480p / 720p / 1080p ที่ 30 fps | สูงสุด 1080p | ตั้งแต่ร่าง 360p จนถึง 4K |
| เสียง Native | บทสนทนา, ดนตรี, เอฟเฟกต์; เลือกปิดได้ | มี | คำพูด, ดนตรี, เสียงประกอบ |
| รูปภาพอ้างอิง | สูงสุด 4 รูป | สูงสุด 30 รูป | สูงสุด 10 รูป |
| วิดีโออ้างอิง | สูงสุด 5 คลิป, รวม 15 วินาที | สูงสุด 10 คลิป | สูงสุด 3 คลิป |
| เสียงอ้างอิง | สูงสุด 5 ไฟล์, รวม 15 วินาที | สูงสุด 10 ไฟล์ | — |
| แก้ไขหรือขยายคลิป | — (ใช้ Seedance 2.5 หรือ Omni) | แก้ไข; ขยายก่อนหรือหลัง | แก้ไข; ขยายครั้งละ 10 วินาที |
| งานร่าง 30 วินาที | 330 เครดิตที่ 480p | ต่อวินาที ตามความละเอียด | 150 เครดิตที่ 360p |
ตัวเลขของ Wan มาจากคู่มือ Alibaba Model Studio ส่วนขีดจำกัดของ Popcraft คือข้อมูลปัจจุบัน ขีดจำกัดอาจเปลี่ยนแปลงได้ เครื่องมือเลือกจะแสดงข้อมูลล่าสุดเสมอ เปรียบเทียบฉบับเต็ม: Seedance 2.5 · Gemini Omni 1.1 Flash
ราคา Wan 3.0 บน Popcraft
เรียกเก็บเงิน ตามจำนวนวินาทีที่ส่งมอบ แบ่งตามความละเอียด ไฟล์อ้างอิงแนบฟรี เนื่องจากความยาววิดีโอจะตรงตามคำขอ ราคาที่เห็นก่อนสร้างจึงเป็นราคาที่คุณจ่ายจริง
ทุกแพ็กเกจรวมเครดิตไว้แล้ว หน้า ราคา จะแสดงอัตราปัจจุบันของทุกโมเดล การดาวน์โหลดในแพ็กเกจฟรีจะมีลายน้ำ Popcraft ซึ่งแพ็กเกจแบบชำระเงินจะไม่มีลายน้ำนี้
Wan 3.0 เหมาะกับงานอะไร
สถานการณ์สามรูปแบบจากสื่อเปิดตัวของ Alibaba และวิธีใช้งานบน Popcraft
- 01
เนื้อหาวิดีโอสั้น: การเล่าเรื่องและโฆษณาตัวอย่าง
รูปแบบความบันเทิงของ Alibaba สร้างเรื่องราวหลายช็อตความยาวสูงสุด 30 วินาทีจากคำสั่งเดียว พร้อมเสียงประกอบ
- 02
อีคอมเมิร์ซ: นำเสนอสินค้าจากภาพนิ่ง
รูปแบบอีคอมเมิร์ซของ Alibaba — "อัปโหลดภาพสินค้าพร้อมคำอธิบาย เพื่อรับวิดีโอนำเสนอที่น่าสนใจ" แนบรูปถ่ายเป็น Image 1
- 03
การศึกษา: จำลองสถานการณ์จำลอง
รูปแบบการศึกษาของ Alibaba — เช่น การจำลองการปรึกษาแพทย์หรือการสนับสนุนลูกค้าจากคำสั่ง พร้อมบทสนทนาที่สร้างขึ้น
- 04
ร่างที่ 480p ส่งงานที่ 1080p
ส่วนเสริมจาก Popcraft: 11 เครดิตต่อวินาทีที่ 480p ทำให้งานร่าง 30 วินาทีใช้เพียง 330 เครดิต ก่อนตัดสินใจเรนเดอร์ที่ 1080p
Wan 3.0 — คำถามที่พบบ่อย
โมเดลวิดีโอแบบ all-in-one จาก Tongyi Lab ของ Alibaba เปิดทดสอบเบต้าตั้งแต่วันที่ 6 สิงหาคม 2026 และเปิดตัวในวันที่ 24 สิงหาคม โมเดลเดียวครอบคลุมงาน text-to-video, image-to-video, การควบคุมเฟรมแรกและสุดท้าย และการสร้างจากหลายข้อมูลอ้างอิง ผลิตวิดีโอความยาว 2 ถึง 30 วินาทีในครั้งเดียวที่ 30 fps และสร้างบทสนทนา ดนตรี และเอฟเฟกต์เสียงไปพร้อมกับภาพ
ความยาวเท่าใดก็ได้ตั้งแต่ 2 ถึง 30 วินาทีเต็ม ในครั้งเดียว — ไม่มีการขยายหรือตัดต่อเพิ่มเติม บน Popcraft คุณกำหนดความยาวได้จากแถบเลื่อนและไฟล์ที่ได้รับจะตรงตามที่ร้องขอ และคุณจ่ายเงินตามจำนวนวินาทีที่เกิดขึ้นจริงเหล่านั้น
ได้ โดยค่าเริ่มต้น คู่มือของ Alibaba ระบุว่าโมเดล "ให้ผลลัพธ์บทสนทนา ดนตรี และเอฟเฟกต์เสียงแบบ native" และให้คุณระบุบทพูดและเสียงในคำสั่งได้ สวิตช์ Audio บน Popcraft สามารถปิดส่วนนี้ได้ และคลิปที่สร้างขณะปิดสวิตช์จะไม่มีแทร็กเสียงเลย
แนบรูปภาพสูงสุด 4 รูป, คลิปวิดีโอ 5 คลิป และคลิปเสียง 5 ไฟล์ แล้วอ้างอิงในคำสั่งเป็น Image 1, Video 1, Audio 1 ไปเรื่อยๆ รูปภาพใช้กำหนดตัวละครหรือฉาก วิดีโอกำหนดการเคลื่อนไหวและมุมกล้อง ส่วนเสียงใช้กำหนดเนื้อเสียงหรือจังหวะ วิดีโอและเสียงจำกัดความยาวรวมอย่างละ 15 วินาที รูปภาพสองรูปที่ระบุเป็นเฟรมแรกและเฟรมสุดท้ายจะกลายเป็นคีย์เฟรมแทน และไม่สามารถใช้คีย์เฟรมร่วมกับข้อมูลอ้างอิงอื่นได้
นั่นคือจุดประสงค์หลักของโมเดลนี้ Alibaba ระบุว่าความสม่ำเสมอของตัวละคร, เครื่องแต่งกาย, อุปกรณ์ประกอบฉาก และสภาพแวดล้อมเป็นความสามารถหลัก และในการทดสอบของเรา แผ่นชีทตัวละครยังคงเอกลักษณ์ได้ตลอดการเคลื่อนกล้องในคลิปอ้างอิง ภาพสินค้าถูกสร้างใหม่ได้อย่างแม่นยำในเฟรม 16:9 และตัวละครตัวเดียวยังคงเดิมตลอดเทค 30 วินาที
ปัจจุบันบน Popcraft ยังทำไม่ได้ Wan 3.0 ใช้คลิปที่แนบเป็นข้อมูลอ้างอิงสำหรับการเคลื่อนไหวและมุมกล้อง หากต้องการขยายหรือแก้ไขฟุตเทจ โปรดใช้ Seedance 2.5 หรือ Gemini Omni 1.1 Flash ซึ่งมีเครื่องมือขยายวิดีโอ
Alibaba อธิบายว่าไฟล์เสียงอ้างอิงใช้เพื่อกำหนดเนื้อเสียงและจังหวะ โดยใส่บทพูดไว้ในคำสั่ง จากนั้นโมเดลจะสร้างเสียงและการขยับปากให้สัมพันธ์กัน นี่ไม่ใช่เครื่องมือสำหรับนำเสียงบันทึกมาขยับปากโดยตรง สำหรับงานลักษณะนั้น โปรดใช้โมเดลอวตารอย่าง OmniHuman
Wan 3.0 เรียกเก็บเงินตามวินาทีที่ส่งมอบ: 11 เครดิตที่ 480p, 20 ที่ 720p และ 40 ที่ 1080p งานร่าง 30 วินาทีที่ 480p ใช้ 330 เครดิต คลิปเดียวกันที่ 1080p ใช้ 1,200 เครดิต ระบบจะแสดงราคาตามความยาวและความละเอียดก่อนที่คุณจะสร้าง และการดาวน์โหลดในแพ็กเกจฟรีจะมีลายน้ำ Popcraft
สามสิบวินาที ในคำขอเดียว ลองเลยที่ 480p ก่อน
ร่างงานด้วย 330 เครดิต เพื่อดูเนื้อเรื่อง แล้วค่อยเรนเดอร์ตัวที่ถูกใจที่ 1080p — หรือนำแผ่นชีทตัวละครมาเจอกับคลิปอ้างอิงที่นี่
สำรวจต่อ
โมเดลที่เกี่ยวข้อง
Seedance 2.5 สร้างวิดีโอได้สูงสุด 30 วินาทีในครั้งเดียว พร้อมสินทรัพย์อ้างอิงสูงสุด 50 รายการ ตัดต่อวิดีโอที่ควบคุมได้ ขยายเวลาแบบความเที่ยงตรงสูง อัตราส่วนภาพตั้งแต่ 0.4 ถึง 2.5 และพรอมต์ภาษาท้องถิ่นในกว่า 10 ภาษา พร้อมใช้งานบน Popcraft
Gemini Omni 1.1 Flash คือโมเดลวิดีโอของ Google ที่สร้างและแก้ไขวิดีโอจากอินพุตใดๆ ขยายฉากได้สูงสุด 40 วินาที เอาต์พุต 1080p และ 4K การประมาณค่าเฟรมแรกและเฟรมสุดท้าย ภาพอ้างอิงสูงสุด 10 ภาพ และเสียงพูด ดนตรี และเอฟเฟกต์เสียงที่สร้างพร้อมกับภาพ เปิดให้บริการบน Popcraft
MiniMax H3 สร้างวิดีโอ 2K 24fps พร้อมเสียงสเตอริโอที่ซิงค์กัน ทั้งเอฟเฟกต์ เสียงบรรยากาศ และบทสนทนาในงานเดียว ถ่ายหลายช็อตจากพรอมต์เดียว ความยาว 5 ถึง 15 วินาที พร้อมระบบควบคุมเฟรมแรกและเฟรมสุดท้าย ใช้งานได้แล้วบน Popcraft
สร้างวิดีโอระดับภาพยนตร์ความละเอียด 4K จากข้อความ รูปภาพ หรือคลิปด้วย Seedance 2.0 บน Popcraft เสียงซิงค์เนทีฟ ลำดับหลายช็อต และรายละเอียดคมชัดสูงสุดถึง 4K (2160p)