เปลี่ยนรูปถ่ายเดียวเป็นวิดีโอพูดได้ด้วย OmniHuman 1.5
ใส่รูปพอร์ตเทรตเดียวและแทร็กเสียงใดก็ได้ แล้ว OmniHuman 1.5 จะสร้างลิปซิงค์ระดับภาพยนตร์ การแสดงสีหน้าที่มีอารมณ์ และท่าทางศีรษะที่เป็นธรรมชาติ
OmniHuman 1.5 ทำอะไรได้บ้าง
อวาตาร์จากรูปเดียว
ทำให้รูปพอร์ตเทรตเดียวเป็นตัวละครที่แสดงได้เต็มรูปแบบ — ไม่ต้อง rig ไม่ต้องเทรน ไม่ต้องถ่ายใหม่
ลิปซิงค์แม่นยำ
รูปปาก การเคลื่อนไหวขากรรไกร และจังหวะโฟนีมล็อคตรงกับแทร็กเสียงที่คุณใส่
การแสดงอารมณ์
สีหน้า การเคลื่อนไหวเล็กๆ น้อยๆ และท่าทางศีรษะตอบสนองต่อจังหวะและพลังงานของเสียง
คุณภาพระดับภาพยนตร์
ตัวสร้างที่อัปเกรดของ ByteDance ให้ผิว ผม และแสงที่เป็นธรรมชาติ คมชัดแม้ในช็อตใกล้
แนวตั้ง สี่เหลี่ยม แนวนอน
ส่งออก 9:16 สำหรับ Shorts, 1:1 สำหรับฟีด และ 16:9 สำหรับ YouTube หรือเว็บจากรูปต้นฉบับเดียวกัน
การกำหนดเป้าหมายด้วยมาสก์
ใช้มาสก์เพื่อล็อคลิปซิงค์กับบุคคลที่ถูกต้องเมื่อมีหลายใบหน้าในเฟรม
สร้างมาเพื่อครีเอเตอร์ตัวจริง
วิดีโอโฆษกบนโซเชียลมีเดีย
เปลี่ยนรูปถ่ายผู้ก่อตั้งเป็นวิดีโออธิบายบน TikTok, Reels และ Shorts ในภาษาใดก็ได้ โดยไม่ต้องจองสตูดิโอหรือนักแสดง
ครีเอทีฟโฆษณาและเดโมสินค้า
สร้างโฆษณาอวาตาร์หลายภาษาหลายสิบชิ้นจากรูปเดียว — เปลี่ยนสคริปต์และเสียงขณะที่การแสดงยังคงสม่ำเสมอ
วิดีโอคอร์สและการฝึกอบรม
สร้างโมดูลออนบอร์ด HR และ e-learning ที่ผู้สอนที่เป็นมิตรพูดตรงกับกล้องในเวลาไม่เกิน 30 วินาที
การเข้าถึงส่วนตัวและการขาย
สร้างอินโทร talking-head 15 วินาทีสำหรับอีเมลและ LinkedIn ที่รู้สึกเหมือนบันทึกจริงแต่ขยายขนาดได้เหมือนข้อความ
สเปค
- ผู้ให้บริการ
- ByteDance
- ประเภทอินพุต
- รูปพอร์ตเทรต + เสียง
- รูปแบบภาพที่รองรับ
- JPEG / PNG
- รูปแบบเสียงที่รองรับ
- MP3 / WAV / M4A
- อัตราส่วนภาพ
- 9:16, 16:9, 1:1
- ความละเอียด
- 720p, 1080p
- ความยาวสูงสุด (720p)
- 60 วินาที
- ความยาวสูงสุด (1080p)
- 30 วินาที
- รองรับมาสก์
- ใช่ (กำหนดเป้าหมายใบหน้าเฉพาะ)
- การนำทางด้วยพรอมต์
- เลือกได้
Popcraft ใช้ OmniHuman 1.5 อย่างไร
OmniHuman 1.5 ขับเคลื่อนเวิร์กโฟลว์วิดีโอพูดได้ของ Character Studio ใน Popcraft อัปโหลดรูปพอร์ตเทรต แนบแทร็กเสียงจาก ElevenLabs TTS หรือจากการบันทึกของคุณ เลือกอัตราส่วนภาพและความละเอียด แล้ว Popcraft จัดการการเลือกมาสก์ การส่งผ่าน Batch AI gateway และการสตรีมความคืบหน้าผ่าน SSE คลิปสำเร็จจะบันทึกในโปรเจกต์ Avatar และแกลเลอรีสื่อ พร้อมตัดเข้าไปป์ไลน์ AI Agent ข้าง B-roll SFX และเพลงประกอบบนไทม์ไลน์หลายแทร็กของ Remotion
คำถามที่พบบ่อย
OmniHuman 1.5 คือโมเดลวิดีโอ talking-head จาก ByteDance ที่ทำให้รูปพอร์ตเทรตเดียวเป็นตัวละครพูดที่เหมือนจริง สร้างลิปซิงค์ที่มีอารมณ์ การแสดงสีหน้า และการเคลื่อนไหวศีรษะที่ละเอียดอ่อนจากรูปเดียวกับเสียง
คุณใส่รูปพอร์ตเทรตและแทร็กเสียง โมเดลจะวิเคราะห์เสียงสำหรับจังหวะ โทนเสียง และโฟนีม จากนั้นสร้างวิดีโอที่บุคคลในรูปพูดซิงค์กับเสียงและแสดงสีหน้าที่สอดคล้องกัน
บัญชีฟรี Popcraft รวมเครดิตที่ใช้กับ OmniHuman 1.5 ได้ การเรนเดอร์ที่ยาวกว่าหรือความละเอียดสูงกว่าจะใช้เครดิตมากขึ้น แพลนแบบชำระเงินหรือเติมเครดิตเพิ่มงบประมาณรายเดือนของคุณ
แพลนแบบชำระเงินของ Popcraft ให้สิทธิ์เชิงพาณิชย์สำหรับวิดีโอที่คุณเรนเดอร์ คุณยังคงต้องได้รับความยินยอมในการใช้รูปลักษณ์ของบุคคลจริงในรูปต้นฉบับ — ห้ามสร้างวิดีโอ talking-head ของบุคคลโดยไม่ได้รับอนุญาต
สูงสุด 30 วินาทีต่อการเรนเดอร์ที่ 1080p และสูงสุด 60 วินาทีที่ 720p วิดีโอที่ยาวกว่าสร้างได้โดยต่อหลายคลิปบนไทม์ไลน์ Remotion
9:16 สำหรับวิดีโอสั้นแนวตั้ง, 16:9 สำหรับ YouTube แนวนอนและหน้าแลนดิ้ง, และ 1:1 สำหรับโพสต์ฟีดสี่เหลี่ยม Popcraft เปิดให้ใช้ทั้งสามจาก Character Studio
เปิดหน้า Character อัปโหลดรูปพอร์ตเทรต แนบเสียง เลือกอัตราส่วนภาพและความละเอียด แล้วส่ง ความคืบหน้าสตรีมสดและวิดีโอ talking-head สำเร็จจะอยู่ในแกลเลอรีของคุณ
พร้อมลอง OmniHuman 1.5 แล้วหรือยัง?
เริ่มสร้างได้ในไม่กี่วินาทีด้วยเครดิตฟรี 100 เครดิต — ไม่ต้องใช้บัตร
ลองวิดีโอพูดได้ฟรีสำรวจต่อ
โมเดลที่เกี่ยวข้อง
สร้างวิดีโออวาตาร์พูดได้แบบยาวด้วย Kling Avatar บน Popcraft เอาต์พุต 9:16, 16:9 และ 1:1 ยาวสูงสุด 60 วินาทีจากรูปเดียวและเสียง
Seedance 2.5 สร้างวิดีโอได้สูงสุด 30 วินาทีในครั้งเดียว พร้อมสินทรัพย์อ้างอิงสูงสุด 50 รายการ ตัดต่อวิดีโอที่ควบคุมได้ ขยายเวลาแบบความเที่ยงตรงสูง อัตราส่วนภาพตั้งแต่ 0.4 ถึง 2.5 และพรอมต์ภาษาท้องถิ่นในกว่า 10 ภาษา พร้อมใช้งานบน Popcraft
MiniMax H3 สร้างวิดีโอ 2K 24fps พร้อมเสียงสเตอริโอที่ซิงค์กัน ทั้งเอฟเฟกต์ เสียงบรรยากาศ และบทสนทนาในงานเดียว ถ่ายหลายช็อตจากพรอมต์เดียว ความยาว 5 ถึง 15 วินาที พร้อมระบบควบคุมเฟรมแรกและเฟรมสุดท้าย ใช้งานได้แล้วบน Popcraft
สร้างวิดีโอระดับภาพยนตร์ความละเอียด 4K จากข้อความ รูปภาพ หรือคลิปด้วย Seedance 2.0 บน Popcraft เสียงซิงค์เนทีฟ ลำดับหลายช็อต และรายละเอียดคมชัดสูงสุดถึง 4K (2160p)