MiniMax H3
วิดีโอที่มาพร้อมกับเสียงในตัว
MiniMax H3 สร้างภาพ 2K และแทร็กเสียงสเตอริโอที่ซิงค์กันในการสั่งงานครั้งเดียว ทั้งเอฟเฟกต์ เสียงในห้อง และบทสนทนาพร้อมกัน ใช้งานได้แล้วบน Popcraft
ภาพยนตร์ที่สร้างด้วย MiniMax H3
บทสนทนา, ชื่อเรื่อง, ตัวอย่างหนัง, วิดีโอแบรนด์และสินค้า, แฟชั่น, อินเทอร์เฟซเกม, ดีไซน์โปสเตอร์, เอฟเฟกต์, มาโคร และเฟรมอะนามอร์ฟิกแท้ วิดีโอจะเล่นขณะคุณเลื่อน แตะที่ลำโพงเพื่อฟังเสียง
คนที่มีบทพูดจริงๆ
ครีเอเตอร์ที่คาเฟ่ริมถนนกำลังพูดหน้ากล้อง ทั้งคำพูด การขยับปาก และบรรยากาศถนนด้านหลังล้วนมาจากการเจนเนอเรตครั้งเดียว นี่คือความสามารถหลักที่รากฐานของโมเดลนี้สร้างขึ้น
แคมเปญแว่นตา
ถ่ายแบบ 9:16 สำหรับโซเชียลโดยเฉพาะ ทั้งเลนส์สะท้อน รูปทรงแว่นที่เด่นชัด และฉากสตูดิโอที่สะอาดตา — รักษาเอกลักษณ์ได้ครบถ้วนในทุกการตัดต่อ
MIDNIGHT LINE
ลำดับชื่อเรื่องแนวอาชญากรรม: หน้าจอแยก บล็อกสีที่ชัดเจน และการตัดภาพนักแสดงตามจังหวะกลอง พร้อมดนตรีแจ๊สแนวระทึกขวัญในตัว
เมนูเกมที่ใช้งานได้จริง
การเลือกตัวละคร การปรับแต่งอาวุธ สถานะปุ่มที่อ่านออก การเรนเดอร์ UI ที่อ่านง่ายคือจุดที่โมเดลวิดีโอส่วนใหญ่มักทำไม่ได้ และนั่นคือเหตุผลที่เรานำมาแสดงที่นี่
THE STARS WERE LISTENING
ทีเซอร์ไซไฟคอนทราสต์สูง ร่างเล็กๆ ท่ามกลางวงแหวนขนาดมหึมา ชื่อเรื่องที่ค่อยๆ ปรากฏขึ้นจากความมืด พร้อมดนตรีประกอบที่เร่งเร้าตามอารมณ์ภาพ
POPUP! Series 001
ดีไซน์โปสเตอร์และของสะสมที่คมชัดและอ่านง่าย: หัวข้อ ลำดับซีรีส์ และตัวละครที่เรนเดอร์ได้สะอาดตาพอสำหรับการนำไปสั่งพิมพ์
ไฟและหนัง
แฟชั่นแนว Editorial ที่มีคอนทราสต์จัดจ้าน — เปลวไฟด้านหลัง หนังแก้วด้านหน้า และตัวแบบที่รักษาความคงเส้นคงวาได้ทุกช็อต
LEATHER IN MOTION
ช่วงโพล้เพล้ รถยนต์ และการโชว์พื้นผิว การเคลื่อนไหวที่นุ่มนวล แหล่งกำเนิดแสงจริงเพียงจุดเดียว และข้อความที่จัดวางอย่างสะอาดตาบนภาพ
งานวาดทับโลกแห่งความจริง
อนิเมชั่นเส้นเรืองแสงวาดด้วยมือบนฟุตเทจวิดีโอรถรางจริง เปลี่ยนรูปทรงไปตามการเคลื่อนที่ในขบวนรถ
ใกล้จนนับเกล็ดได้
ตุ๊กแกแมวในมุมมาโครสุดขีด ลิ้นที่ตวัดผ่านดวงตา พื้นผิวผิวหนัง แสงสะท้อน และการเคลื่อนไหวขนาดเล็กที่ยังคมชัดระดับ 2K
MINIMAX, 2.35:1
งานแบรนด์ในขนาด 2944 by 1248 — เป็นเฟรมแบบอะนามอร์ฟิกแท้แทนที่จะเป็นแค่การครอปจาก 16:9 พร้อมโลโก้ที่วางไว้อย่างสะอาดตาตลอดแนวลูกกรง
พรอมต์ที่สร้างผลงานนี้
ทั้งบรีฟ มู้ดบอร์ดที่ได้รับ และภาพยนตร์ที่สร้างออกมา — มีทั้งดนตรี การตัดต่อ และข้อความบนหน้าจอ ทั้งหมดในการเจนเนอเรตครั้งเดียว
ลำดับชื่อเรื่องความยาว 15 วินาที ขนาด 16:9 สำหรับภาพยนตร์อาชญากรรมระทึกขวัญ ภาษาภาพ: อนิเมะญี่ปุ่นย้อนยุค, เงาร่างขอบคม, คอลลาจสไตล์คอมมิก, หน้าจอแยกแบบไม่สมมาตร, บล็อกสีเรขาคณิตที่ชัดเจน, เครดิตภาษาอังกฤษ, มีตัวคาตาคานะเล็กน้อย, อารมณ์แจ๊สอาชญากรรม มู้ดระทึกขวัญ 60% แจ๊ส 40% — ลึกลับ เท่ สไตล์เมือง; ไม่ใช่สยองขวัญ ไม่หนักอึ้ง และไม่ใช่เพลงแจ๊สที่ร่าเริง
การเคลื่อนไหวควรดูเหมือนคอลลาจกราฟิก: เส้นกรอบวาดบนพื้นดำ, ขอบเขตจอแยกโผล่ออกมา, บล็อกสีและแผงต่างๆ ปรากฏขึ้นทีละส่วน; เงาร่าง, ภาพโคลสอัพอุปกรณ์ประกอบ และเครดิตเลื่อน ปรากฏ และเปิดเผยแบบมาสก์ ตามจังหวะกลอง
เครดิตภาษาอังกฤษต้องสะอาดและอ่านง่าย และอาจมีอนิเมชั่น: กรอบบางๆ วาดขึ้น, ชื่อเลื่อนเข้ามา, ตัวอักษรปรากฏทีละตัว, บล็อกสีบังการเปิดเผย แล้วหยุดนิ่ง ไม่มีภาษาจีนเพิ่มเติม ไม่มีสัญลักษณ์ที่สับสน ไม่สะกดผิด ทุกเครดิตและบทบาทปรากฏเพียงครั้งเดียว — ไม่มีการซ้ำบทบาท ไม่มีการซ้ำชื่อ ไม่มีใครทำงานสองอย่าง
การเปลี่ยนฉาก: circular vinyl mask, การปาดแบบประตูรถแนวตั้ง, เงาทอดยาวพาดผ่านเฟรม, การตัดด้วยเส้นสีแดง, มาสก์รูปตัวอักษรยักษ์, การประกอบหน้าจอแยก, การตัดแบบบล็อกสีชัดเจน ทั้งหมดตามจังหวะเพลง ไม่มีการละลายภาพ (dissolve) หรือการแปลงรูปร่าง (morph) ที่ลื่นไหล
Music: ดนตรีประกอบต้นฉบับ 15 วินาที ระทึกขวัญ 60% และแจ๊ส 40% — เสียงเบสลากยาว, เสียงดีดสาย pizzicato ที่ตึงเครียด, เสียงซินธ์เย็นเยือก, กระเดื่อง, เสียงแปรงกลองเบาๆ, ท่อนวอล์คกิ้งเบสสั้นๆ, ท่อนแซกโซโฟนเสียงต่ำ และเสียงเครื่องเป่าสั้นๆ เสียงย่านต่ำและไฮแฮทไล่ระดับใน 2 วินาทีแรก, กระเดื่องที่วินาทีที่ 3, แจ๊สเบสที่วินาทีที่ 6, ท่อนแซก/เครื่องเป่าสั้นๆ ที่วินาทีที่ 10 และคอร์ดที่ตึงเครียดพร้อมกลองเพื่อหยุดนิ่งใน 2 วินาทีสุดท้าย ห้ามลอกเลียนทำนองที่มีอยู่






บอร์ดทั้ง 6 ที่ระบุไว้ในบรีฟ — "อ้างอิงภาษาภาพจากรูปภาพเหล่านี้"
การเจนเนอเรตครั้งเดียว ทั้งรายชื่อนักแสดง หน้าจอแยก การเปลี่ยนฉากแบบ vinyl-mask และดนตรีแจ๊สระทึกขวัญล้วนมาพร้อมกัน — ไม่มีการทำดนตรี ใส่ตัวอักษร หรือตัดต่อเพิ่มเติมภายหลัง
สิ่งที่ผู้คนจะนำไปใช้งาน
งานที่เสียงและการตัดต่อในเทคเดียวที่สร้างขึ้นมาจะเปลี่ยนกระบวนการทำงานไปอย่างสิ้นเชิง
โฆษณาแนวตั้งที่ดูจบได้ในรอบเดียว
วิดีโอ 9:16 มาพร้อมเสียงบรรยากาศ เสียงเอฟเฟกต์ และบทสนทนาในตัว เพื่อให้เวอร์ชันแรกที่ผู้เกี่ยวข้องเห็นไม่ใช่แค่ภาพเคลื่อนไหวที่เงียบสนิท
ภาพสินค้าที่เคลื่อนไหวได้
กำหนดขอบเขตภาพนิ่งของสินค้าด้วยเฟรมแรกและเฟรมสุดท้าย แล้วโมเดลจะเติมการเคลื่อนไหวระหว่างนั้นให้เอง — สินค้าเดิม แสงเดิม แต่ถูกเปิดออก
ใบหน้าเดียวตลอดทั้งซีรีส์
ภาพอ้างอิงช่วยรักษาเอกลักษณ์และเครื่องแต่งกายในแต่ละเทคและการตัดต่อภายในเทค ซึ่งเป็นสิ่งจำเป็นสำหรับตัวละครหลักที่ต้องปรากฏตัวซ้ำ
อนิมิติกที่มีการกำกับมุมกล้อง
การเคลื่อนที่ถูกเขียนเป็นประโยคจากชุดคำสั่งที่กำหนดไว้ ดังนั้นการซูมเข้าคือการซูมเข้าจริงๆ ไม่ใช่สิ่งที่โมเดลสุ่มทำขึ้นมาเอง
ตัดต่อเสร็จโดยไม่ต้องแก้ไข
การระบุจุดตัดไว้ในพรอมต์จะทำให้ได้หลายช็อตในคลิปเดียว โดยมีเสียงบรรยากาศต่อเนื่องกันตลอดการตัดต่อเหล่านั้น
สิ่งที่ทำให้แตกต่างอย่างแท้จริง
สามสิ่งนี้ — และอย่างแรกเท่านั้นที่หาได้ยากอย่างแท้จริง
เสียงที่สร้างมาพร้อมกับภาพ
ทั้งเอฟเฟกต์ เสียงบรรยากาศ และบทสนทนาที่ซิงค์ปากอยู่ในไฟล์เดียวกัน เราลองถอดเสียงกลับมาสี่ครั้ง บทสนทนาตรงตามสคริปต์เป๊ะและซิงค์กันทุกครั้ง
การตัดต่อภายในการเจนเนอเรตเดียว
สามช็อตและการตัดแบบ hard cut สองครั้ง วางตามจุดที่ระบุในพรอมต์ โดยไม่มีรอยต่อที่ไม่ได้ตั้งใจในไฟล์ที่ส่งมอบ — และมีเสียงบรรยากาศต่อเนื่องตลอด
เลือกเวลาได้ทุกวินาที ตั้งแต่ 5 ถึง 15
ระยะเวลาจะแม่นยำตามเฟรมในโหมดอ้างอิง หากขอ 11 วินาที ก็จะได้ 11 วินาที ไม่มีการปัดเศษเป็น 15
H3 เทียบกับ Seedance 2.0
การทดสอบของเรา: ใช้พรอมต์และภาพอ้างอิงเดียวกัน โดยมีโมเดลเป็นตัวแปรเดียว นี่คือหนึ่งพรอมต์ ไม่ใช่การวัดผลมาตรฐาน มีหนึ่งส่วนที่ต้องเปลี่ยนตามโมเดล: H3 ไม่รับค่าอัตราส่วนภาพหากแนบภาพอ้างอิง ดังนั้นมันจึงเลือกเอง
| การวัดผล | MiniMax H3 | Seedance 2.0 |
|---|---|---|
| ภาพที่ส่งมอบ | 1440 × 2560 · 24 fps | 1248 × 1664 · 24 fps |
| บทสนทนาที่ถอดเสียงกลับ | ตรงตามสคริปต์และซิงค์กัน 4 จาก 4 | สับสนและไม่ซิงค์ |
| ระยะเวลาที่ขอ → ที่ส่งมอบ | 8 s → 8.000 s | 8 s → 8.08 s |
| ทำตามคำสั่งจัดเฟรมภาพ | ไม่ — ตัวสินค้าเล็กลงเรื่อยๆ | ใช่ |
| โลโก้อ่านออกทุกเฟรม | 134 of 192 | 159 of 193 |
ภาพสูสีกัน แต่เสียงดีกว่าอย่างชัดเจน ทว่าการทำตามคำสั่งด้านองค์ประกอบภาพยังด้อยกว่า ทั้งสองพรอมต์ไม่ได้เขียนบทสนทนาและขอเพียงเสียงบรรยากาศเงียบๆ — ซึ่งทำให้เราได้รู้ว่า H3 จะเขียนบทเองถ้าคุณปล่อยให้มันทำ
วิธีเขียนพรอมต์
แบ่งเป็นสามส่วน ระบุหน้าที่ของไฟล์แนบแต่ละไฟล์ เขียนประโยคหลักของงานสร้างสรรค์ แล้วบรรยายคลิปทีละช็อต — แต่ละช็อตต้องระบุเวลาตัด มุมกล้อง การเคลื่อนไหว บทสนทนา และเสียงของการกระทำนั้นๆ
ระบุสิ่งที่คุณไม่ต้องการออกมาให้ชัดเจน
คำสั่งเชิงลบต้องแยกเป็นคำสั่งเฉพาะ สำหรับความเงียบ ให้ตั้งค่าฟิลด์เพลงประกอบเป็น N/A — เขียนว่า "non_diegetic_music": N/A การเว้นฟิลด์นี้ไว้ไม่เหมือนกับการระบุความต้องการ
นี่ไม่ใช่ทางเลือก พรอมต์หนึ่งของเราที่ขอเสียงบรรยากาศเงียบๆ และไม่ได้เขียนบทสนทนา กลับได้ไฟล์ที่มีเสียงพูดเต็มรูปแบบ ซิงค์ปาก และพูดสรรพคุณสินค้าที่ไม่มีใครพิมพ์ไว้
เสียงประกอบมีฟิลด์เฉพาะ
เสียงบรรยากาศและเสียงการกระทำไม่ต้องใส่ในรายละเอียดช็อต แต่ให้ใส่ใน overall_soundscape ประมาณ 1-4 ประโยคสำหรับทั้งคลิป ส่วนดนตรีประกอบที่ตัวละครไม่ได้ยินให้ใส่ใน non_diegetic_music ส่วนบทสนทนาให้ระบุไว้ในช็อตนั้นๆ
ใส่ข้อความในเครื่องหมายอัญประกาศ และจัดบทพูดให้พอดีช็อต
ข้อความที่ต้องการให้ปรากฏบนจอต้องใส่ในพรอมต์ตามที่ต้องการให้อ่านเป๊ะๆ ในเครื่องหมายอัญประกาศ บทพูดต้องพอดีกับวินาทีของช็อตนั้นๆ แต่อาจพูดต่อเนื่องข้ามจุดตัดได้หากคุณระบุชื่อช็อตที่ครอบคลุม
ตัวอย่างพรอมต์ที่สมบูรณ์
ทั้งสามส่วนในรูปแบบฟิลด์ที่โมเดลอ่านintegrated_multimodal_description: [Shot 1] A barista sets a mug on the marble counter shown in <Picture 1>, keeping the counter, the light and the mug's position. The camera pushes in with small amplitude at slow speed. The barista with a warm, low voice (S1) says: <d>[English] Yours.</d> [Shot 2] At 00:05.000, the shot cuts to an overhead close-up of steam rising from the mug while her last word carries over. overall_soundscape: Ceramic meets stone with one soft knock and low room tone continues underneath. An espresso machine hisses two rooms away. non_diegetic_music: N/A
การใช้งานบน Popcraft
H3 อยู่ในรายการโมเดลวิดีโอข้างๆ Seedance มีสามขั้นตอน และขั้นตอนที่สามคือสิ่งที่คนมักจะข้าม
เลือก MiniMax H3
จากนั้นตั้งค่าความยาว — วินาทีใดก็ได้ตั้งแต่ห้าถึงสิบห้า — และระดับความคมชัดของภาพ
แนบภาพอ้างอิง และระบุหน้าที่ของแต่ละภาพ
MiniMax ระบุว่าการแนบไฟล์โดยไม่ระบุชื่อคือสาเหตุแรกของความผิดพลาด ภาพเดียวอาจเป็นเฟรมแรกหรือเฟรมสุดท้ายและคุณต้องระบุให้ชัดเจน สองภาพคือการกำหนดกรอบของช็อต
กำกับเสียง รวมถึงความเงียบด้วย
เขียนรายละเอียดเสียงบรรยากาศ และเขียนสิ่งที่คุณไม่ต้องการแยกเป็นคำสั่งเฉพาะ หากไม่เขียนไว้ H3 จะเขียนและแสดงบทสนทนาของมันเอง
คำถาม
คลิปที่ได้จะมาพร้อมเอฟเฟกต์ เสียงบรรยากาศ และบทสนทนาในตัว ดังนั้นขั้นตอนการทำเสียงจึงเป็นการตัดต่อแทนที่จะเป็นการสร้างจากศูนย์ แต่นี่ไม่ใช่การมิกซ์เสียงที่เสร็จสมบูรณ์ ระดับเสียงอาจต่างกันในแต่ละเทค ดังนั้นควรวางแผนการปรับระดับเสียงก่อนเผยแพร่
ใช่ เว้นแต่คุณจะสั่งห้ามไว้ นี่คือสิ่งที่สำคัญที่สุดที่ต้องรู้เกี่ยวกับ H3 พรอมต์หนึ่งของเราขอเสียงบรรยากาศเงียบๆ และไม่มีบทสนทนาเลย แต่ H3 กลับเขียน แสดง และซิงค์ปากบทพูดเต็มรูปแบบ รวมถึงพูดสรรพคุณสินค้าที่ไม่มีใครพิมพ์ไว้ การเว้นฟิลด์เสียงไว้ไม่เท่ากับการขอความเงียบ ให้เขียนคำสั่งเชิงลบแยกออกมาและกำกับเสียงบรรยากาศทุกครั้ง สำหรับลูกค้าหรืองานที่มีกฎระเบียบ ให้ถือว่านี่คือขั้นตอนการตรวจสอบที่จำเป็น
การขอ 768p จะได้ด้านสั้น 768 พิกเซล การขอ 720p ก็จะได้เท่ากัน ส่วนการขอ 1080p จะถูกดันขึ้นไปเป็น 2K — คือด้านสั้น 1440 พิกเซล — ซึ่งเป็นค่าเดียวที่ไม่ได้ตามที่ขอ ระดับความชัดขนาดเล็กจะเสร็จเร็วกว่าราว 40% และใช้ไฟล์เล็กลงเหลือ 1 ใน 3 สิ่งที่ต้องแลกคือตัวอักษรขนาดเล็ก: โลโก้อาจจะรอดที่ 768 แต่บรรทัดที่สองที่เล็กกว่ามากมักจะไม่รอด
ได้เฉพาะตอนที่ไม่แนบภาพอ้างอิงเท่านั้น การสร้างวิดีโอจากข้อความจะทำตามอัตราส่วนที่ระบุ แต่หากแนบภาพอ้างอิง อัตราส่วนต้องตั้งเป็น adaptive — และค่านี้ไม่ได้ตายตัว มันไม่ได้เลียนแบบจากภาพอ้างอิงโดยตรง เช่น ภาพอ้างอิง 3:4 อาจจะได้ผลลัพธ์เป็น 9:16 ในบางงานของเรา ดังนั้นให้ยึดตามไฟล์ที่ได้รับมากกว่าพรอมต์ที่สั่งไป
รักษาเอกลักษณ์ได้ดี แต่การจัดเฟรมภาพไม่แน่นอนนัก ภาพอ้างอิงล็อคเอกลักษณ์และเครื่องแต่งกายได้ดี รวมถึงข้ามจุดตัดภายในเทคเดียว แต่คำสั่งเรื่องขนาดภาพทำได้ไม่ดีเท่า Seedance 2.0 ในบรีฟเดียวกัน ตัวสินค้าของเราเล็กลงในเฟรม ดังนั้นควรย้ำขนาดภาพและชื่อตัวละครในทุกๆ จุดตัด ตามที่คู่มือของ MiniMax แนะนำ
เป็นโมเดลเดียวกันแต่มีสองชื่อ MiniMax เผยแพร่ในชื่อ MiniMax H3 ส่วนบางแห่งเรียกว่า Hailuo 3.0 ในหน้าเลือกโมเดลของ Popcraft จะปรากฏชื่อ Hailuo 3 ส่วนในหน้านี้จะใช้ชื่อ MiniMax H3 เป็นหลัก
H3 คิดราคาตามวินาทีของวิดีโอที่ออกมา สามารถดูราคาปัจจุบันได้ที่หน้า Pricing สิ่งที่ควรรู้ก่อนสร้างคือ ระดับ 768p จะมีขนาดไฟล์ประมาณ 1 ใน 3 ของ 2K และเร็วกว่าราว 40% หากคุณยอมรับความต่างนี้ได้สำหรับงานของคุณ
สร้างคลิปที่มาพร้อมเสียงในตัว
H3 ใช้งานได้แล้วบน Popcraft พร้อมกับโมเดลวิดีโออื่นๆ ในรายการของเรา
สำรวจต่อ
โมเดลที่เกี่ยวข้อง
Seedance 2.5 สร้างวิดีโอได้สูงสุด 30 วินาทีในครั้งเดียว พร้อมสินทรัพย์อ้างอิงสูงสุด 50 รายการ ตัดต่อวิดีโอที่ควบคุมได้ ขยายเวลาแบบความเที่ยงตรงสูง อัตราส่วนภาพตั้งแต่ 0.4 ถึง 2.5 และพรอมต์ภาษาท้องถิ่นในกว่า 10 ภาษา พร้อมใช้งานบน Popcraft
สร้างวิดีโอระดับภาพยนตร์ความละเอียด 4K จากข้อความ รูปภาพ หรือคลิปด้วย Seedance 2.0 บน Popcraft เสียงซิงค์เนทีฟ ลำดับหลายช็อต และรายละเอียดคมชัดสูงสุดถึง 4K (2160p)

Seedance 2.0 Mini เป็นระดับวิดีโอที่ประหยัดที่สุดของ ByteDance — ถูกกว่า Seedance 2.0 มาตรฐานสูงสุด 50% และเร็วกว่า Fast ประมาณ 2 เท่า พร้อมพรอมต์ข้อความ ภาพ วิดีโอ และเสียง เปิดให้ใช้บน Popcraft

เปลี่ยนภาพและพรอมต์เป็นวิดีโอระดับภาพยนตร์ด้วย Seedance 2.0 บน Popcraft สร้างวิดีโอจากอ้างอิง เฟรมแรก/สุดท้าย และเอาต์พุตหลายอัตราส่วนที่ความละเอียดสูงสุด 4K