MiniMax H3
Video đi kèm âm thanh riêng
MiniMax H3 tạo hình ảnh 2K và âm thanh stereo đồng bộ trong cùng một tác vụ — hiệu ứng, tiếng nền và lời thoại cùng lúc. Đã có trên Popcraft.
Phim tạo bởi H3
Hội thoại, tiêu đề, trailer, phim thương hiệu và sản phẩm, thời trang, giao diện game, thiết kế poster, hiệu ứng, macro và khung hình anamorphic thực thụ. Video tự phát khi cuộn; nhấn vào loa để nghe.
Người nói chuyện thực thụ
Một nhà sáng tạo tại quán cà phê vỉa hè, đang nói chuyện trước camera. Lời nói, khớp môi và cảnh đường phố phía sau đều được tạo ra trong cùng một lần — đây chính là khả năng cốt lõi làm nên sức mạnh của mô hình.
Chiến dịch kính mắt
Quay gốc tỉ lệ 9:16 cho mạng xã hội. Tròng kính tráng gương, hình khối điêu khắc và bối cảnh studio tối giản — bản sắc thương hiệu được giữ vững qua mọi cảnh cắt.
MIDNIGHT LINE
Một chuỗi tiêu đề phim hình sự: màn hình chia nhỏ, các khối màu sắc nét và thẻ danh đề cắt theo nhịp trống, trên nền nhạc jazz kịch tính tự thân.
Menu game hoạt động mượt mà
Chọn nhân vật, tùy chỉnh vũ khí, trạng thái nút bấm rõ ràng. Khả năng hiển thị UI dễ đọc là nơi hầu hết các mô hình video thất bại, và đó chính xác là lý do nó xuất hiện ở đây.
THE STARS WERE LISTENING
Teaser khoa học viễn tưởng độ tương phản cao. Một bóng người nhỏ bé trước một vòng nhẫn khổng lồ, tiêu đề hiện ra từ bóng tối cùng âm nhạc trỗi dậy đồng bộ.
POPUP! Series 001
Thiết kế poster và vật phẩm sưu tầm, hiển thị phẳng và rõ nét: tiêu đề chính, số thứ tự series và nhân vật được kết xuất đủ sạch để in ấn.
Lửa và da thuộc
Thời trang phong cách biên tập với độ tương phản tối đa — ngọn lửa phía sau, da bóng phía trước, và người mẫu giữ được sự nhất quán qua từng cảnh quay.
LEATHER IN MOTION
Hoàng hôn, một chiếc xe và nghiên cứu về chất liệu. Chuyển động chậm, một nguồn sáng thực tế duy nhất và kiểu chữ được đặt sạch sẽ trên hình ảnh.
Vẽ đè lên thế giới thực
Hoạt ảnh đường nét phát sáng vẽ tay chạy trên thước phim thực tế của một chuyến xe điện, biến đổi hình dạng liên tục khi di chuyển dọc toa xe.
Cận cảnh đến từng lớp vảy
Một con tắc kè mào trong cảnh siêu cận cảnh (macro), lưỡi lướt qua mắt. Kết cấu da, độ bóng và các chuyển động vi mô được giữ vững ở độ phân giải 2K.
MINIMAX, 2.35:1
Một tác phẩm thương hiệu ở độ phân giải 2944 by 1248 — khung hình anamorphic thực thụ thay vì cắt từ 16:9, với logo được đặt lặp lại và rõ nét dọc theo lan can.
Prompt đã tạo nên tác phẩm
Bản tóm tắt, các bảng tham chiếu được cung cấp và bộ phim nhận về — bao gồm cả âm nhạc, các cảnh cắt và chữ trên màn hình, tất cả trong một lần tạo duy nhất.
Một chuỗi tiêu đề 15 giây tỷ lệ 16:9 cho phim hình sự kịch tính nhẹ. Ngôn ngữ thị giác: tiêu đề anime Nhật Bản cổ điển, hình bóng sắc nét, cắt dán comic, màn hình chia nhỏ bất đối xứng, các khối màu hình học mạnh mẽ, danh đề tiếng Anh, một ít katakana, cảm giác jazz hình sự. Tâm trạng 60% kịch tính, 40% jazz — bí ẩn, ngầu, đô thị; không kinh dị, không nặng nề, không phải video jazz vui vẻ.
Chuyển động theo phong cách collage đồ họa: các khung đường nét vẽ trên nền đen, ranh giới chia tách bật ra, các khối màu và bảng panel dán vào từng khối một; hình bóng, cận cảnh đạo cụ và danh đề trượt, hiện và lộ diện qua mặt nạ theo nhịp trống.
Danh đề tiếng Anh phải sạch và dễ đọc, có thể chuyển động: một khung mỏng hiện ra, tên trượt vào, các chữ cái xuất hiện từng chữ một, một khối màu che phủ rồi hiện ra, sau đó giữ nguyên. Không thêm chữ Trung Quốc, không ký tự lạ, không sai chính tả. Mỗi danh đề và vai trò xuất hiện một lần — không lặp lại vai trò, không lặp lại tên, không ai giữ hai vai trò.
Chuyển cảnh: mặt nạ vinyl tròn, hiệu ứng gạt cửa xe dọc, bóng dài quét qua khung hình, cắt đường kẻ đỏ, mặt nạ chữ cái khổng lồ, lắp ráp khung hình chia tách, cắt khối màu sắc nét. Tất cả theo nhịp điệu. Không hòa tan mềm, không biến đổi mượt.
Âm nhạc: một đoạn nhạc tiêu đề 15 giây nguyên bản, 60% kịch tính và 40% jazz — bass ngân dài, dây pizzicato căng thẳng, nhịp synth lạnh, kick, chổi trống thưa thớt, một đoạn walking-bass, cụm từ sax thấp và kèn đồng đâm ngắn. Âm trầm và hats tăng dần trong 2 giây, kick ở 3 giây, jazz bass ở 6 giây, riff sax/đồng ngắn ở 10 giây, và một hợp âm căng thẳng với trống để dừng lại ở 2 giây cuối. Không bắt chước bất kỳ giai điệu hiện có nào.






Sáu bảng tham chiếu mà bản tóm tắt hướng tới — "tham chiếu ngôn ngữ thị giác của những hình ảnh này".
Một lần tạo. Các thẻ danh đề, màn hình chia nhỏ, hiệu ứng chuyển cảnh vinyl-mask và nhạc jazz kịch tính đều xuất hiện cùng nhau — không có gì được chèn nhạc, viết chữ hay cắt ghép sau đó.
Mọi người sẽ sử dụng nó để làm gì
Những công việc mà âm thanh tự tạo và các cảnh cắt trong một lần quay sẽ thay đổi hoàn toàn quy trình.
Quảng cáo dọc xem được ngay từ bản đầu tiên
Một bản cắt 9:16 đi kèm với tiếng nền, tiếng động thực tế và lời thoại đã có sẵn, giúp khách hàng thấy ngay bản dựng hoàn chỉnh thay vì một bản vẽ tĩnh không âm thanh.
Hình ảnh sản phẩm chuyển động
Giới hạn một ảnh tĩnh sản phẩm bằng khung hình đầu và cuối, mô hình sẽ lấp đầy quá trình chuyển động giữa chúng — cùng một chiếc hũ, cùng một nguồn sáng, nhưng được mở ra.
Một gương mặt cho cả series
Hình ảnh tham chiếu giúp giữ vững danh tính và trang phục qua nhiều cảnh quay và các cảnh cắt trong cùng một lần quay, đáp ứng nhu cầu về một nhân vật xuất hiện xuyên suốt.
Animatics với chuyển động camera được chỉ định
Các chuyển động được viết thành câu từ một bộ quy tắc có sẵn, giúp cú máy push-in đúng nghĩa là push-in thay vì để mô hình tự ý thực hiện.
Cắt ghép không cần hậu kỳ
Các cảnh cắt được viết vào prompt sẽ trả về nhiều cảnh quay trong cùng một clip, với âm thanh môi trường chạy liên tục xuyên suốt các cảnh đó.
Điều thực sự tạo nên sự khác biệt
Ba điều — và chỉ điều đầu tiên là thực sự hiếm có.
Âm thanh được tạo cùng hình ảnh
Hiệu ứng, tiếng nền và hội thoại khớp môi trong cùng một tệp. Chúng tôi đã chép lại âm thanh bốn lần; các câu thoại khớp chính xác từng từ và đúng nhịp mọi lần.
Cắt cảnh trong một lần tạo
Ba cảnh quay và hai lần cắt sắc nét, được đặt đúng vị trí prompt yêu cầu, không có lỗi ghép nối ngoài ý muốn trên tệp thành phẩm — và tiếng nền vẫn chạy xuyên suốt.
Tùy chọn độ dài từ 5 đến 15 giây
Thời lượng được tuân thủ chính xác đến từng khung hình trong chế độ tham chiếu. Một bản cắt 11 giây được yêu cầu sẽ là 11 giây, không bị làm tròn lên 15.
H3 so với Seedance 2.0
Thử nghiệm của chúng tôi: cùng một prompt và cùng hình ảnh tham chiếu, với mô hình là biến số duy nhất. Một prompt đơn lẻ, không phải bài kiểm tra tiêu chuẩn. Một trường thông tin phải thay đổi theo mô hình: H3 từ chối tỷ lệ khung hình cố định khi có ảnh tham chiếu, nên nó đã tự chọn tỷ lệ cho mình.
| Thông số | MiniMax H3 | Seedance 2.0 |
|---|---|---|
| Hình ảnh trả về | 1440 × 2560 · 24 fps | 1248 × 1664 · 24 fps |
| Lời thoại, được chép lại | nguyên văn và khớp nhịp, 4 trên 4 | bị xáo trộn, lệch nhịp |
| Thời lượng yêu cầu → thực tế | 8 s → 8.000 s | 8 s → 8.08 s |
| Tuân thủ hướng dẫn bố cục | không — chiếc hũ bị trôi nhỏ lại | có |
| Logo rõ nét, qua từng khung hình | 134 trên 192 | 159 trên 193 |
Hình ảnh tương đồng, âm thanh vượt trội rõ rệt, nhưng kém hơn ở việc tuân thủ chỉ dẫn. Cả hai prompt đều không viết một lời thoại nào và đều yêu cầu tiếng nền yên tĩnh — đó là cách chúng tôi biết H3 tự viết thoại nếu bạn để nó tự do.
Cách viết prompt
Gồm ba phần. Nêu rõ mục đích của từng tệp đính kèm, viết một câu về ý tưởng sáng tạo cốt lõi, sau đó mô tả clip theo từng cảnh — mỗi cảnh bao gồm thời điểm cắt, bố cục, chuyển động camera, hội thoại và âm thanh của hành động.
Nói rõ những gì bạn không muốn
Một yêu cầu phủ định phải là một chỉ dẫn riêng biệt. Để giữ im lặng, hãy đặt trường âm nhạc phi diegetic thành N/A — viết là "non_diegetic_music": N/A. Việc bỏ trống trường này không có giá trị tương đương.
Điều này là bắt buộc. Một prompt của chúng tôi yêu cầu tiếng nền yên tĩnh và không viết lời thoại đã trả về một bản đọc đầy đủ, khớp môi, đưa ra các khẳng định về sản phẩm mà không ai soạn thảo.
Không gian âm thanh có trường riêng
Âm thanh môi trường và hành động không nằm trong phần mô tả cảnh quay. Chúng nằm trong overall_soundscape, từ một đến bốn câu cho toàn bộ clip. Nhạc nền mà nhân vật không nghe thấy nằm trong non_diegetic_music. Hội thoại vẫn nằm trong cảnh quay.
Trích dẫn văn bản và khớp thoại với cảnh
Các từ ngữ dự định xuất hiện trên màn hình phải được đưa vào prompt chính xác như cách chúng nên hiển thị, trong dấu ngoặc kép. Một câu thoại phải khớp với số giây của cảnh đó; nó có thể kéo dài qua một cảnh cắt nếu bạn nêu tên các cảnh mà nó bao phủ.
Một prompt mẫu hoàn chỉnh
ba phần, theo định dạng trường mà mô hình đọcintegrated_multimodal_description: [Shot 1] A barista sets a mug on the marble counter shown in <Picture 1>, keeping the counter, the light and the mug's position. The camera pushes in with small amplitude at slow speed. The barista with a warm, low voice (S1) says: <d>[English] Yours.</d> [Shot 2] At 00:05.000, the shot cuts to an overhead close-up of steam rising from the mug while her last word carries over. overall_soundscape: Ceramic meets stone with one soft knock and low room tone continues underneath. An espresso machine hisses two rooms away. non_diegetic_music: N/A
Sử dụng trên Popcraft
H3 nằm trong danh sách mô hình video bên cạnh Seedance. Ba bước, và bước thứ ba là bước mọi người thường bỏ qua.
Chọn MiniMax H3
Sau đó đặt thời lượng — bất kỳ giây nguyên nào từ 5 đến 15 — và cấp độ hình ảnh.
Đính kèm tham chiếu và nêu rõ mục đích
MiniMax coi một tệp đính kèm không nhãn là lỗi đầu tiên. Một hình ảnh là khung hình đầu hoặc cuối và bạn phải nêu rõ; hai hình ảnh sẽ giới hạn cảnh quay.
Điều phối âm thanh, bao gồm cả sự im lặng
Viết không gian âm thanh (soundscape) và viết những gì bạn không muốn thành một chỉ dẫn riêng. Nếu để trống, H3 sẽ tự viết và thực hiện hội thoại của riêng nó.
Câu hỏi thường gặp
Một clip trả về đã có sẵn hiệu ứng, tiếng nền và hội thoại, vì vậy giai đoạn âm thanh trở thành việc chỉnh sửa thay vì xây dựng từ con số không. Tuy nhiên, đây không phải là một bản mix hoàn chỉnh. Mức âm lượng thay đổi giữa các lần quay, vì vậy hãy lập kế hoạch xử lý âm lượng (loudness pass) trước khi xuất bản.
Có, trừ khi bạn bảo nó không làm vậy. Đây là điều quan trọng nhất cần biết về H3. Một prompt của chúng tôi yêu cầu tiếng nền tự nhiên yên tĩnh và không viết lời thoại; H3 đã viết, thực hiện và khớp môi một bản đọc đầy đủ, bao gồm cả những khẳng định về sản phẩm mà không ai soạn thảo. Việc bỏ trống các trường âm thanh không giống với yêu cầu im lặng. Hãy viết yêu cầu phủ định thành chỉ dẫn riêng và điều phối không gian âm thanh mọi lúc. Đối với khách hàng hoặc danh mục cần kiểm soát, hãy coi đây là một bước thẩm định thay vì một tùy chọn.
Yêu cầu 768p trả về cạnh ngắn 768 pixel. Yêu cầu 720p cũng trả về tương tự. Yêu cầu 1080p được đẩy lên 2K — 1440 pixel ở cạnh ngắn — đây là giá trị duy nhất không trả về đúng như yêu cầu. Cấp độ nhỏ xử lý nhanh hơn khoảng 40% với dung lượng chỉ bằng một phần ba. Đổi lại, các chữ nhỏ sẽ bị ảnh hưởng: logo lớn có thể tồn tại ở 768p, nhưng dòng chữ nhỏ thứ hai bên dưới thường sẽ không rõ nét.
Chỉ khi bạn không đính kèm hình ảnh tham chiếu. Chuyển văn bản thành video (Text-to-video) tuân thủ tỷ lệ đã nêu. Đính kèm bất kỳ tham chiếu nào và tỷ lệ phải được đặt thành adaptive (thích ứng) — và adaptive không có tính chất cố định, nó không chỉ đơn giản là sao chép tham chiếu. Một tham chiếu 3:4 đã trả về 9:16 trong một thử nghiệm của chúng tôi. Hãy dựa vào tệp kết quả thay vì yêu cầu ban đầu.
Danh tính thì có, bố cục thì kém ổn định hơn. Hình ảnh tham chiếu khóa danh tính và trang phục rất tốt, kể cả qua các cảnh cắt trong một lần quay đa cảnh. Các chỉ dẫn về bố cục được tuân thủ kém hơn so với Seedance 2.0 trên cùng một bản tóm tắt — sản phẩm của chúng tôi bị trôi nhỏ dần trong khung hình. Hãy nhắc lại kích thước cảnh quay và tên nhân vật ở mỗi cảnh cắt, đó là điều mà hướng dẫn viết prompt của chính MiniMax khuyên dùng.
Cùng một mô hình dưới hai cái tên. MiniMax phát hành nó là MiniMax H3; một số nền tảng dán nhãn là Hailuo 3.0 — trên trình chọn mô hình của Popcraft, nó xuất hiện dưới tên Hailuo 3. Trang này sử dụng tên MiniMax H3 xuyên suốt.
H3 tính phí theo giây kết quả. Để biết giá hiện tại theo giây, hãy xem trang bảng giá. Một điều đáng lưu ý trước khi bạn tạo: cấp độ 768p tiêu tốn khoảng một phần ba dung lượng của 2K và nhanh hơn khoảng 40%, nếu sự đánh đổi đó phù hợp với công việc của bạn.
Tạo clip đã có sẵn âm thanh
H3 đã sẵn sàng trên Popcraft, cùng với các mô hình video khác trong danh mục.
Tiếp tục khám phá
Mô hình liên quan
Seedance 2.5 tạo video dài tới 30 giây trong một tác vụ duy nhất, hỗ trợ tới 50 tài nguyên tham chiếu, chỉnh sửa video có thể kiểm soát, mở rộng thời gian với độ trung thực cao, mọi tỷ lệ khung hình từ 0,4 đến 2,5 và tạo câu lệnh gốc bằng hơn 10 ngôn ngữ. Đã có trên Popcraft.
Tạo video điện ảnh 4K từ văn bản, hình ảnh hoặc clip với Seedance 2.0 trên Popcraft. Âm thanh đồng bộ native, chuỗi đa cảnh quay và chi tiết sắc nét đến từng chân tơ ở mức lên đến 4K (2160p).

Seedance 2.0 Mini là gói video tinh gọn nhất của ByteDance — rẻ hơn tới 50% so với Seedance 2.0 tiêu chuẩn và nhanh hơn ~2× so với Fast, hỗ trợ câu lệnh văn bản, hình ảnh, video và âm thanh. Đã có trên Popcraft.

Biến hình ảnh và câu lệnh thành video điện ảnh với Seedance 2.0 trên Popcraft. Tham chiếu thành video, khung hình đầu/cuối và đầu ra đa tỷ lệ lên đến 4K.