NEWQuảng cáo UGC gây bão tiếp theo chỉ cách một cú nhấp chuột. Khám phá Studio.Tạo quảng cáo
PopcraftPopcraft
Mô hình mới

MiniMax H3

Video đi kèm âm thanh riêng

MiniMax H3 tạo hình ảnh 2K và âm thanh stereo đồng bộ trong cùng một tác vụ — hiệu ứng, tiếng nền và lời thoại cùng lúc. Đã có trên Popcraft.

2K tại 24 fpsStereo âm thanh tự tạo5–15s bước nhảy 1 giây6 tỷ lệ khung hìnhĐa cảnh trong một lần quay
Hội thoại
Chuỗi tiêu đề
Phim thương hiệu
Giao diện game
Trailer
Hiệu ứng vẽ tay
Phim sản phẩm
Macro

Phim tạo bởi H3

Hội thoại, tiêu đề, trailer, phim thương hiệu và sản phẩm, thời trang, giao diện game, thiết kế poster, hiệu ứng, macro và khung hình anamorphic thực thụ. Video tự phát khi cuộn; nhấn vào loa để nghe.

Tạo lại
Hội thoại

Người nói chuyện thực thụ

Một nhà sáng tạo tại quán cà phê vỉa hè, đang nói chuyện trước camera. Lời nói, khớp môi và cảnh đường phố phía sau đều được tạo ra trong cùng một lần — đây chính là khả năng cốt lõi làm nên sức mạnh của mô hình.

Tạo lại
Thời trang, khổ dọc

Chiến dịch kính mắt

Quay gốc tỉ lệ 9:16 cho mạng xã hội. Tròng kính tráng gương, hình khối điêu khắc và bối cảnh studio tối giản — bản sắc thương hiệu được giữ vững qua mọi cảnh cắt.

Tạo lại
Tiêu đề và bao bì

MIDNIGHT LINE

Một chuỗi tiêu đề phim hình sự: màn hình chia nhỏ, các khối màu sắc nét và thẻ danh đề cắt theo nhịp trống, trên nền nhạc jazz kịch tính tự thân.

Tạo lại
Giao diện và trò chơi

Menu game hoạt động mượt mà

Chọn nhân vật, tùy chỉnh vũ khí, trạng thái nút bấm rõ ràng. Khả năng hiển thị UI dễ đọc là nơi hầu hết các mô hình video thất bại, và đó chính xác là lý do nó xuất hiện ở đây.

Tạo lại
Trailer

THE STARS WERE LISTENING

Teaser khoa học viễn tưởng độ tương phản cao. Một bóng người nhỏ bé trước một vòng nhẫn khổng lồ, tiêu đề hiện ra từ bóng tối cùng âm nhạc trỗi dậy đồng bộ.

Tạo lại
Thiết kế đồ họa

POPUP! Series 001

Thiết kế poster và vật phẩm sưu tầm, hiển thị phẳng và rõ nét: tiêu đề chính, số thứ tự series và nhân vật được kết xuất đủ sạch để in ấn.

Tạo lại
Phim thương hiệu

Lửa và da thuộc

Thời trang phong cách biên tập với độ tương phản tối đa — ngọn lửa phía sau, da bóng phía trước, và người mẫu giữ được sự nhất quán qua từng cảnh quay.

Tạo lại
Phim sản phẩm

LEATHER IN MOTION

Hoàng hôn, một chiếc xe và nghiên cứu về chất liệu. Chuyển động chậm, một nguồn sáng thực tế duy nhất và kiểu chữ được đặt sạch sẽ trên hình ảnh.

Tạo lại
Hiệu ứng

Vẽ đè lên thế giới thực

Hoạt ảnh đường nét phát sáng vẽ tay chạy trên thước phim thực tế của một chuyến xe điện, biến đổi hình dạng liên tục khi di chuyển dọc toa xe.

Tạo lại
Macro

Cận cảnh đến từng lớp vảy

Một con tắc kè mào trong cảnh siêu cận cảnh (macro), lưỡi lướt qua mắt. Kết cấu da, độ bóng và các chuyển động vi mô được giữ vững ở độ phân giải 2K.

Tạo lại
Góc siêu rộng

MINIMAX, 2.35:1

Một tác phẩm thương hiệu ở độ phân giải 2944 by 1248 — khung hình anamorphic thực thụ thay vì cắt từ 16:9, với logo được đặt lặp lại và rõ nét dọc theo lan can.

Prompt đã tạo nên tác phẩm

Bản tóm tắt, các bảng tham chiếu được cung cấp và bộ phim nhận về — bao gồm cả âm nhạc, các cảnh cắt và chữ trên màn hình, tất cả trong một lần tạo duy nhất.

Prompt — cuộn

Một chuỗi tiêu đề 15 giây tỷ lệ 16:9 cho phim hình sự kịch tính nhẹ. Ngôn ngữ thị giác: tiêu đề anime Nhật Bản cổ điển, hình bóng sắc nét, cắt dán comic, màn hình chia nhỏ bất đối xứng, các khối màu hình học mạnh mẽ, danh đề tiếng Anh, một ít katakana, cảm giác jazz hình sự. Tâm trạng 60% kịch tính, 40% jazz — bí ẩn, ngầu, đô thị; không kinh dị, không nặng nề, không phải video jazz vui vẻ.

Chuyển động theo phong cách collage đồ họa: các khung đường nét vẽ trên nền đen, ranh giới chia tách bật ra, các khối màu và bảng panel dán vào từng khối một; hình bóng, cận cảnh đạo cụ và danh đề trượt, hiện và lộ diện qua mặt nạ theo nhịp trống.

Danh đề tiếng Anh phải sạch và dễ đọc, có thể chuyển động: một khung mỏng hiện ra, tên trượt vào, các chữ cái xuất hiện từng chữ một, một khối màu che phủ rồi hiện ra, sau đó giữ nguyên. Không thêm chữ Trung Quốc, không ký tự lạ, không sai chính tả. Mỗi danh đề và vai trò xuất hiện một lần — không lặp lại vai trò, không lặp lại tên, không ai giữ hai vai trò.

Chuyển cảnh: mặt nạ vinyl tròn, hiệu ứng gạt cửa xe dọc, bóng dài quét qua khung hình, cắt đường kẻ đỏ, mặt nạ chữ cái khổng lồ, lắp ráp khung hình chia tách, cắt khối màu sắc nét. Tất cả theo nhịp điệu. Không hòa tan mềm, không biến đổi mượt.

Âm nhạc: một đoạn nhạc tiêu đề 15 giây nguyên bản, 60% kịch tính và 40% jazz — bass ngân dài, dây pizzicato căng thẳng, nhịp synth lạnh, kick, chổi trống thưa thớt, một đoạn walking-bass, cụm từ sax thấp và kèn đồng đâm ngắn. Âm trầm và hats tăng dần trong 2 giây, kick ở 3 giây, jazz bass ở 6 giây, riff sax/đồng ngắn ở 10 giây, và một hợp âm căng thẳng với trống để dừng lại ở 2 giây cuối. Không bắt chước bất kỳ giai điệu hiện có nào.

Tham chiếu
Style reference board 1 for the MIDNIGHT LINE title sequenceStyle reference board 2 for the MIDNIGHT LINE title sequenceStyle reference board 3 for the MIDNIGHT LINE title sequenceStyle reference board 4 for the MIDNIGHT LINE title sequenceStyle reference board 5 for the MIDNIGHT LINE title sequenceStyle reference board 6 for the MIDNIGHT LINE title sequence

Sáu bảng tham chiếu mà bản tóm tắt hướng tới — "tham chiếu ngôn ngữ thị giác của những hình ảnh này".

Kết quả

Một lần tạo. Các thẻ danh đề, màn hình chia nhỏ, hiệu ứng chuyển cảnh vinyl-mask và nhạc jazz kịch tính đều xuất hiện cùng nhau — không có gì được chèn nhạc, viết chữ hay cắt ghép sau đó.

Mọi người sẽ sử dụng nó để làm gì

Những công việc mà âm thanh tự tạo và các cảnh cắt trong một lần quay sẽ thay đổi hoàn toàn quy trình.

Marketing

Quảng cáo dọc xem được ngay từ bản đầu tiên

Một bản cắt 9:16 đi kèm với tiếng nền, tiếng động thực tế và lời thoại đã có sẵn, giúp khách hàng thấy ngay bản dựng hoàn chỉnh thay vì một bản vẽ tĩnh không âm thanh.

Thương mại điện tử

Hình ảnh sản phẩm chuyển động

Giới hạn một ảnh tĩnh sản phẩm bằng khung hình đầu và cuối, mô hình sẽ lấp đầy quá trình chuyển động giữa chúng — cùng một chiếc hũ, cùng một nguồn sáng, nhưng được mở ra.

Nhà sáng tạo

Một gương mặt cho cả series

Hình ảnh tham chiếu giúp giữ vững danh tính và trang phục qua nhiều cảnh quay và các cảnh cắt trong cùng một lần quay, đáp ứng nhu cầu về một nhân vật xuất hiện xuyên suốt.

Phim và tiền kỳ

Animatics với chuyển động camera được chỉ định

Các chuyển động được viết thành câu từ một bộ quy tắc có sẵn, giúp cú máy push-in đúng nghĩa là push-in thay vì để mô hình tự ý thực hiện.

Mạng xã hội

Cắt ghép không cần hậu kỳ

Các cảnh cắt được viết vào prompt sẽ trả về nhiều cảnh quay trong cùng một clip, với âm thanh môi trường chạy liên tục xuyên suốt các cảnh đó.

Điều thực sự tạo nên sự khác biệt

Ba điều — và chỉ điều đầu tiên là thực sự hiếm có.

Điều hiếm có

Âm thanh được tạo cùng hình ảnh

Hiệu ứng, tiếng nền và hội thoại khớp môi trong cùng một tệp. Chúng tôi đã chép lại âm thanh bốn lần; các câu thoại khớp chính xác từng từ và đúng nhịp mọi lần.

Điều hữu ích

Cắt cảnh trong một lần tạo

Ba cảnh quay và hai lần cắt sắc nét, được đặt đúng vị trí prompt yêu cầu, không có lỗi ghép nối ngoài ý muốn trên tệp thành phẩm — và tiếng nền vẫn chạy xuyên suốt.

Điều thực tế

Tùy chọn độ dài từ 5 đến 15 giây

Thời lượng được tuân thủ chính xác đến từng khung hình trong chế độ tham chiếu. Một bản cắt 11 giây được yêu cầu sẽ là 11 giây, không bị làm tròn lên 15.

H3 so với Seedance 2.0

Thử nghiệm của chúng tôi: cùng một prompt và cùng hình ảnh tham chiếu, với mô hình là biến số duy nhất. Một prompt đơn lẻ, không phải bài kiểm tra tiêu chuẩn. Một trường thông tin phải thay đổi theo mô hình: H3 từ chối tỷ lệ khung hình cố định khi có ảnh tham chiếu, nên nó đã tự chọn tỷ lệ cho mình.

Thông sốMiniMax H3Seedance 2.0
Hình ảnh trả về1440 × 2560 · 24 fps1248 × 1664 · 24 fps
Lời thoại, được chép lạinguyên văn và khớp nhịp, 4 trên 4bị xáo trộn, lệch nhịp
Thời lượng yêu cầu → thực tế8 s → 8.000 s8 s → 8.08 s
Tuân thủ hướng dẫn bố cụckhông — chiếc hũ bị trôi nhỏ lại
Logo rõ nét, qua từng khung hình134 trên 192159 trên 193

Hình ảnh tương đồng, âm thanh vượt trội rõ rệt, nhưng kém hơn ở việc tuân thủ chỉ dẫn. Cả hai prompt đều không viết một lời thoại nào và đều yêu cầu tiếng nền yên tĩnh — đó là cách chúng tôi biết H3 tự viết thoại nếu bạn để nó tự do.

Cách viết prompt

Gồm ba phần. Nêu rõ mục đích của từng tệp đính kèm, viết một câu về ý tưởng sáng tạo cốt lõi, sau đó mô tả clip theo từng cảnh — mỗi cảnh bao gồm thời điểm cắt, bố cục, chuyển động camera, hội thoại và âm thanh của hành động.

Quy tắc quan trọng nhất

Nói rõ những gì bạn không muốn

Một yêu cầu phủ định phải là một chỉ dẫn riêng biệt. Để giữ im lặng, hãy đặt trường âm nhạc phi diegetic thành N/A — viết là "non_diegetic_music": N/A. Việc bỏ trống trường này không có giá trị tương đương.

Điều này là bắt buộc. Một prompt của chúng tôi yêu cầu tiếng nền yên tĩnh và không viết lời thoại đã trả về một bản đọc đầy đủ, khớp môi, đưa ra các khẳng định về sản phẩm mà không ai soạn thảo.

Âm thanh

Không gian âm thanh có trường riêng

Âm thanh môi trường và hành động không nằm trong phần mô tả cảnh quay. Chúng nằm trong overall_soundscape, từ một đến bốn câu cho toàn bộ clip. Nhạc nền mà nhân vật không nghe thấy nằm trong non_diegetic_music. Hội thoại vẫn nằm trong cảnh quay.

Kỹ thuật

Trích dẫn văn bản và khớp thoại với cảnh

Các từ ngữ dự định xuất hiện trên màn hình phải được đưa vào prompt chính xác như cách chúng nên hiển thị, trong dấu ngoặc kép. Một câu thoại phải khớp với số giây của cảnh đó; nó có thể kéo dài qua một cảnh cắt nếu bạn nêu tên các cảnh mà nó bao phủ.

Một prompt mẫu hoàn chỉnh

ba phần, theo định dạng trường mà mô hình đọc
integrated_multimodal_description: [Shot 1] A barista sets a mug on the marble counter shown in <Picture 1>, keeping the counter, the light and the mug's position. The camera pushes in with small amplitude at slow speed. The barista with a warm, low voice (S1) says:
<d>[English] Yours.</d>
[Shot 2] At 00:05.000, the shot cuts to an overhead close-up of steam rising from the mug while her last word carries over.

overall_soundscape: Ceramic meets stone with one soft knock and low room tone continues underneath. An espresso machine hisses two rooms away.

non_diegetic_music: N/A

Sử dụng trên Popcraft

H3 nằm trong danh sách mô hình video bên cạnh Seedance. Ba bước, và bước thứ ba là bước mọi người thường bỏ qua.

01

Chọn MiniMax H3

Sau đó đặt thời lượng — bất kỳ giây nguyên nào từ 5 đến 15 — và cấp độ hình ảnh.

02

Đính kèm tham chiếu và nêu rõ mục đích

MiniMax coi một tệp đính kèm không nhãn là lỗi đầu tiên. Một hình ảnh là khung hình đầu hoặc cuối và bạn phải nêu rõ; hai hình ảnh sẽ giới hạn cảnh quay.

03

Điều phối âm thanh, bao gồm cả sự im lặng

Viết không gian âm thanh (soundscape) và viết những gì bạn không muốn thành một chỉ dẫn riêng. Nếu để trống, H3 sẽ tự viết và thực hiện hội thoại của riêng nó.

Câu hỏi thường gặp

Một clip trả về đã có sẵn hiệu ứng, tiếng nền và hội thoại, vì vậy giai đoạn âm thanh trở thành việc chỉnh sửa thay vì xây dựng từ con số không. Tuy nhiên, đây không phải là một bản mix hoàn chỉnh. Mức âm lượng thay đổi giữa các lần quay, vì vậy hãy lập kế hoạch xử lý âm lượng (loudness pass) trước khi xuất bản.

Có, trừ khi bạn bảo nó không làm vậy. Đây là điều quan trọng nhất cần biết về H3. Một prompt của chúng tôi yêu cầu tiếng nền tự nhiên yên tĩnh và không viết lời thoại; H3 đã viết, thực hiện và khớp môi một bản đọc đầy đủ, bao gồm cả những khẳng định về sản phẩm mà không ai soạn thảo. Việc bỏ trống các trường âm thanh không giống với yêu cầu im lặng. Hãy viết yêu cầu phủ định thành chỉ dẫn riêng và điều phối không gian âm thanh mọi lúc. Đối với khách hàng hoặc danh mục cần kiểm soát, hãy coi đây là một bước thẩm định thay vì một tùy chọn.

Yêu cầu 768p trả về cạnh ngắn 768 pixel. Yêu cầu 720p cũng trả về tương tự. Yêu cầu 1080p được đẩy lên 2K — 1440 pixel ở cạnh ngắn — đây là giá trị duy nhất không trả về đúng như yêu cầu. Cấp độ nhỏ xử lý nhanh hơn khoảng 40% với dung lượng chỉ bằng một phần ba. Đổi lại, các chữ nhỏ sẽ bị ảnh hưởng: logo lớn có thể tồn tại ở 768p, nhưng dòng chữ nhỏ thứ hai bên dưới thường sẽ không rõ nét.

Chỉ khi bạn không đính kèm hình ảnh tham chiếu. Chuyển văn bản thành video (Text-to-video) tuân thủ tỷ lệ đã nêu. Đính kèm bất kỳ tham chiếu nào và tỷ lệ phải được đặt thành adaptive (thích ứng) — và adaptive không có tính chất cố định, nó không chỉ đơn giản là sao chép tham chiếu. Một tham chiếu 3:4 đã trả về 9:16 trong một thử nghiệm của chúng tôi. Hãy dựa vào tệp kết quả thay vì yêu cầu ban đầu.

Danh tính thì có, bố cục thì kém ổn định hơn. Hình ảnh tham chiếu khóa danh tính và trang phục rất tốt, kể cả qua các cảnh cắt trong một lần quay đa cảnh. Các chỉ dẫn về bố cục được tuân thủ kém hơn so với Seedance 2.0 trên cùng một bản tóm tắt — sản phẩm của chúng tôi bị trôi nhỏ dần trong khung hình. Hãy nhắc lại kích thước cảnh quay và tên nhân vật ở mỗi cảnh cắt, đó là điều mà hướng dẫn viết prompt của chính MiniMax khuyên dùng.

Cùng một mô hình dưới hai cái tên. MiniMax phát hành nó là MiniMax H3; một số nền tảng dán nhãn là Hailuo 3.0 — trên trình chọn mô hình của Popcraft, nó xuất hiện dưới tên Hailuo 3. Trang này sử dụng tên MiniMax H3 xuyên suốt.

H3 tính phí theo giây kết quả. Để biết giá hiện tại theo giây, hãy xem trang bảng giá. Một điều đáng lưu ý trước khi bạn tạo: cấp độ 768p tiêu tốn khoảng một phần ba dung lượng của 2K và nhanh hơn khoảng 40%, nếu sự đánh đổi đó phù hợp với công việc của bạn.

Tạo clip đã có sẵn âm thanh

H3 đã sẵn sàng trên Popcraft, cùng với các mô hình video khác trong danh mục.

Tiếp tục khám phá

Mô hình liên quan