NEWIklan UGC viral Anda berikutnya hanya sejauh satu klik. Sambutlah Studio.Buat iklan
PopcraftPopcraft
Model baru

MiniMax H3

Video yang hadir dengan suaranya sendiri

MiniMax H3 menghasilkan gambar 2K dan trek stereo tersinkronisasi dalam satu proses — efek, nada ruangan, dan dialog lisan, sekaligus. Hadir di Popcraft.

2K pada 24 fpsStereo audio, hasil generatif5–15s dalam kelipatan 1 dtk6 rasio aspekMulti-shot dalam satu take
Dialog
Sekuens judul
Film merek
Antarmuka game
Trailer
Efek gambar tangan
Film produk
Makro

Film yang dibuat dengan H3

Dialog, judul, trailer, film merek dan produk, mode, antarmuka game, desain poster, efek, makro, dan bingkai anamorfik asli. Video diputar saat Anda scroll; ketuk speaker untuk mendengar suara.

Dialog

Seseorang yang benar-benar berbicara

Seorang kreator di kafe trotoar, berbicara ke kamera. Kata-kata, sinkronisasi bibir, dan suasana jalanan di belakangnya berasal dari satu proses generatif yang sama — inilah kemampuan inti dari model ini.

Mode, vertikal

Kampanye kacamata

Shot asli 9:16 untuk media sosial. Lensa cermin, siluet terpahat, dan studio yang bersih — identitas tetap terjaga di setiap potongan adegan.

Judul dan kemasan

MIDNIGHT LINE

Sekuens judul film kriminal: layar terpisah, blok warna kontras, dan kartu pemeran yang berganti mengikuti ketukan drum, dengan skor musik jazz-suspens buatan sendiri.

Antarmuka dan game

Menu game yang fungsional

Pemilihan karakter, kustomisasi senjata, status tombol yang terbaca. Merender UI yang jelas adalah kelemahan sebagian besar model video, itulah sebabnya kami menampilkannya di sini.

Trailer

THE STARS WERE LISTENING

Teaser fiksi ilmiah dengan kontras tinggi. Sosok kecil di depan cincin raksasa, judul muncul dari kegelapan, dan musik yang mengiringi perkembangannya.

Desain grafis

POPUP! Series 001

Desain poster dan koleksi, datar dan terbaca: tipografi judul, nomor seri, dan karakter yang dirender cukup bersih untuk dicetak.

Film merek

Api dan kulit

Mode editorial dengan kontras penuh — api di latar belakang, kulit paten di depan, dan model yang konsisten dari shot ke shot.

Film produk

LEATHER IN MOTION

Senja, sebuah mobil, dan studi tekstur. Pergerakan lambat, satu sumber cahaya praktis, dan tipografi yang terpasang bersih di atas gambar.

Efek

Gambar di atas dunia nyata

Animasi garis cahaya yang digambar tangan di atas rekaman trem live-action, bertransformasi dari satu bentuk ke bentuk lain saat melewati gerbong.

Makro

Cukup dekat untuk menghitung sisik

Gecko berjambul dalam makro ekstrem, lidah menjilat mata. Tekstur kulit, pantulan cahaya basah, dan pergerakan mikro terjaga pada 2K.

Sangat lebar

MINIMAX, 2.35:1

Karya bermerek yang disajikan pada 2944 by 1248 — bingkai anamorfik asli alih-alih pemotongan 16:9, dengan logo yang terpasang berulang dan bersih di sepanjang langkan.

Prompt yang membuatnya

Brief, papan referensi yang diberikan, dan film yang dihasilkan — termasuk musik, potongan adegan, dan teks di layar, dalam satu proses generatif.

Prompt — gulir

Sekuens judul 16:9 berdurasi lima belas detik untuk film kriminal suspens ringan. Bahasa visual: judul anime Jepang retro, siluet bertepi tajam, kolase komik, layar terpisah asimetris, blok warna geometris yang kuat, kredit bahasa Inggris, sedikit katakana, nuansa jazz-kriminal. Suasana 60% suspens, 40% jazz — misterius, keren, urban; bukan horor, tidak berat, dan bukan video jazz yang ceria.

Gerakan harus terbaca sebagai kolase grafis gerak: bingkai garis muncul di atas hitam, batas layar terpisah terbuka cepat, blok warna dan panel menempel satu per satu; siluet, close-up properti, dan kredit bergeser, muncul, serta terungkap lewat masker sesuai ketukan drum.

Kredit bahasa Inggris harus bersih dan terbaca, serta boleh dianimasikan: bingkai tipis muncul, nama bergeser masuk, huruf muncul satu per satu, blok warna menutupi pengungkapan, lalu tertahan. Tanpa tambahan bahasa Mandarin, tanpa simbol yang kacau, tanpa salah eja. Setiap kredit dan peran muncul sekali — tidak ada peran yang berulang, tidak ada nama yang berulang, tidak ada orang yang memegang dua tugas.

Transisi: masker vinil melingkar, sapuan vertikal pintu mobil, bayangan panjang menyapu bingkai, potongan garis merah, masker bentuk huruf raksasa, penyatuan kembali bingkai terpisah, potongan blok warna yang tajam. Semuanya sesuai tempo. Tanpa dissolve lembut, tanpa morphing cair.

Musik: isyarat judul orisinal 15 detik, 60% suspens dan 40% jazz — bass yang tertahan, senar pizzicato tegang, denyut synth dingin, kick drum, sapuan kuas perkusi yang jarang, fragmen walking-bass, frasa saksofon rendah, dan tiupan brass pendek. Bagian rendah dan hi-hat meningkat selama 2 detik, kick drum pada 3 detik, jazz bass pada 6 detik, riff saksofon/brass pendek pada 10 detik, dan akord tegang dengan drum untuk membekukan adegan di 2 detik terakhir. Jangan meniru melodi yang sudah ada.

Referensi
Style reference board 1 for the MIDNIGHT LINE title sequenceStyle reference board 2 for the MIDNIGHT LINE title sequenceStyle reference board 3 for the MIDNIGHT LINE title sequenceStyle reference board 4 for the MIDNIGHT LINE title sequenceStyle reference board 5 for the MIDNIGHT LINE title sequenceStyle reference board 6 for the MIDNIGHT LINE title sequence

Enam papan referensi yang ditunjuk oleh brief — "gunakan bahasa visual dari gambar-gambar ini".

Hasil

Satu kali proses generatif. Kartu pemeran, layar terpisah, transisi masker vinil, dan isyarat jazz-suspens semuanya dihasilkan sekaligus — tidak ada yang ditambahkan musiknya, diberi teks, atau dipotong setelahnya.

Kegunaan bagi pengguna

Pekerjaan di mana audio hasil generatif dan potongan adegan dalam satu proses mengubah cara kerja itu sendiri.

Pemasaran

Iklan vertikal yang layak tonton sejak draf pertama

Potongan 9:16 hadir dengan suara ruangan, foley, dan dialog lisan yang sudah terpasang, sehingga versi pertama yang dilihat pemangku kepentingan bukanlah animatik bisu.

E-commerce

Foto produk yang bergerak

Batasi foto produk dengan bingkai pertama dan terakhir, dan model akan mengisi pergerakan di antaranya — stoples yang sama, pencahayaan yang sama, terbuka.

Kreator

Satu wajah di seluruh seri

Gambar referensi menjaga identitas dan pakaian di berbagai take serta potongan di dalam satu take, hal yang sangat dibutuhkan untuk persona berulang di depan kamera.

Film dan previs

Animatik dengan pergerakan kamera yang terprogram

Pergerakan ditulis sebagai kalimat dari set yang ditentukan, sehingga push-in tetap menjadi push-in, bukan pergerakan acak model.

Sosial

Potongan tanpa pengeditan

Potongan adegan yang ditulis dalam prompt dikembalikan sebagai beberapa shot di dalam satu klip, dengan ambien yang berjalan tanpa putus di antaranya.

Apa yang membedakannya

Tiga hal — dan hanya yang pertama yang benar-benar langka.

Yang langka

Suara dihasilkan bersama gambar

Efek, ambien, dan dialog tersinkronisasi bibir dalam file yang sama. Kami mentranskripsi ulang audionya empat kali; baris naskah muncul kata demi kata dan tersinkronisasi setiap saat.

Yang berguna

Potongan adegan dalam satu proses generatif

Tiga shot dan dua potongan tajam, ditempatkan sesuai prompt, dengan nol sambungan yang tidak diinginkan pada file hasil — dan ambien tetap mengalir di antaranya.

Yang praktis

Detik utuh apa pun, 5 hingga 15

Durasi dipatuhi hingga ke bingkainya dalam mode referensi. Potongan sebelas detik diminta sebagai sebelas, bukan dibulatkan ke lima belas.

H3 bersanding dengan Seedance 2.0

Uji coba kami sendiri: prompt dan gambar referensi yang sama, dengan model sebagai satu-satunya variabel yang disengaja. Satu prompt, bukan tolok ukur menyeluruh. Satu bidang harus diubah sesuai model: H3 menolak rasio aspek yang ditentukan saat gambar referensi dilampirkan, sehingga model memilih rasionya sendiri.

PengukuranMiniMax H3Seedance 2.0
Gambar yang dihasilkan1440 × 2560 · 24 fps1248 × 1664 · 24 fps
Dialog lisan, ditranskripsi ulangkata demi kata dan sinkron, 4 of 4kacau, tidak sinkron
Durasi diminta → dihasilkan8 s → 8.000 s8 s → 8.08 s
Instruksi pembingkaian dipatuhitidak — stoples bergeser mengecilya
Logo terbaca, bingkai demi bingkai134 of 192159 of 193

Setara pada gambar, jelas lebih baik pada suara, kurang baik dalam mengikuti instruksi. Kedua prompt tidak menulis satu kata pun dialog dan keduanya meminta suara ruangan yang tenang saja — begitulah kami mengetahui bahwa H3 menulis dialognya sendiri jika Anda membiarkannya.

Cara membuat prompt

Tiga bagian. Jelaskan kegunaan setiap lampiran, tulis satu kalimat inti kreatif, lalu jelaskan klip tersebut shot demi shot — setiap shot menyertakan waktu potong, pembingkaian, gerakan kamera, dialog, dan suara dari aksi tersebut.

Aturan yang paling penting

Sebutkan apa yang tidak Anda inginkan, secara lisan

Instruksi negatif harus menjadi instruksi tersendiri. Untuk keheningan, atur bidang musik non-diegetik ke N/A — ditulis "non_diegetic_music": N/A. Mengosongkan bidang tersebut bukanlah permintaan yang sama.

Ini tidak opsional. Prompt kami yang meminta suara ruangan tenang dan tanpa dialog justru menghasilkan dialog lengkap, sinkron bibir, yang menyebutkan klaim produk yang tidak pernah diketik oleh siapa pun.

Suara

Lansekap suara memiliki bidangnya sendiri

Ambien dan suara aksi tidak dimasukkan dalam deskripsi shot. Mereka masuk ke dalam overall_soundscape, satu hingga empat kalimat untuk seluruh klip. Musik yang tidak bisa didengar karakter masuk ke dalam non_diegetic_music. Dialog tetap ada di dalam deskripsi shot.

Keahlian

Gunakan tanda kutip pada teks, sesuaikan dialog dengan shot

Kata-kata yang ingin dimunculkan di layar harus dimasukkan ke dalam prompt persis seperti tampilannya, dalam tanda kutip. Dialog lisan harus sesuai dengan durasi detik shot yang diberikan; dialog tersebut dapat berlanjut melewati potongan jika Anda menyebutkan nama shot yang dicakupnya.

Contoh prompt yang terisi

tiga bagian, dalam format bidang yang dibaca model
integrated_multimodal_description: [Shot 1] A barista sets a mug on the marble counter shown in <Picture 1>, keeping the counter, the light and the mug's position. The camera pushes in with small amplitude at slow speed. The barista with a warm, low voice (S1) says:
<d>[English] Yours.</d>
[Shot 2] At 00:05.000, the shot cuts to an overhead close-up of steam rising from the mug while her last word carries over.

overall_soundscape: Ceramic meets stone with one soft knock and low room tone continues underneath. An espresso machine hisses two rooms away.

non_diegetic_music: N/A

Menggunakannya di Popcraft

H3 berada di daftar model video di samping Seedance. Tiga langkah, dan yang ketiga adalah yang sering dilewatkan orang.

01

Pilih MiniMax H3

Lalu atur durasi — detik utuh apa pun dari lima hingga lima belas — dan tingkatan gambar.

02

Lampirkan referensi, jelaskan kegunaan masing-masing

MiniMax mencatat lampiran tanpa label sebagai pemicu utama kegagalan proses. Satu gambar adalah bingkai pertama atau terakhir dan Anda tentukan yang mana; dua gambar membatasi shot tersebut.

03

Arahkan suara, termasuk keheningan

Tuliskan lansekap suara, dan tuliskan apa yang tidak Anda inginkan sebagai instruksi tersendiri. Jika dibiarkan kosong, H3 akan menulis dan membawakan dialognya sendiri.

Pertanyaan

Klip hadir dengan efek, ambien, dan dialog yang sudah terpasang, sehingga tahap pengerjaan suara menjadi pengeditan alih-alih membangun dari nol. Namun, ini bukanlah hasil akhir mixing yang matang. Tingkat volume bervariasi dari satu take ke take lainnya, jadi rencanakan proses penyesuaian kenyaringan (loudness pass) sebelum dipublikasikan.

Ya, kecuali Anda melarangnya. Ini adalah hal terpenting yang perlu diketahui tentang H3. Prompt kami meminta suara ruangan alami yang tenang dan tidak menulis dialog sama sekali; H3 menulis, membawakan, dan menyinkronkan bibir untuk dialog lengkap, termasuk klaim produk yang tidak diketik siapa pun. Mengosongkan bidang suara bukanlah permintaan yang sama dengan meminta keheningan. Tuliskan negatif tersebut sebagai instruksi tersendiri dan arahkan lansekap suara setiap saat. Untuk klien atau kategori yang diatur ketat, anggap ini sebagai langkah peninjauan wajib, bukan sekadar preferensi.

Permintaan 768p mengembalikan tepi pendek 768 piksel. Permintaan 720p mengembalikan hal yang sama. Permintaan 1080p didorong ke 2K — 1440 piksel pada tepi pendek — yang merupakan satu-satunya nilai yang tidak dikembalikan sesuai permintaan. Tingkatan kecil selesai sekitar 40% lebih cepat dengan ukuran file sepertiga lebih kecil. Risikonya adalah teks kecil: logo bertahan di 768, tetapi baris kedua yang jauh lebih kecil di bawahnya sebagian besar tidak bertahan.

Hanya jika Anda tidak melampirkan gambar referensi. Teks-ke-video mematuhi rasio yang dinyatakan. Lampirkan referensi apa pun dan rasio harus diatur ke adaptif — dan adaptif tidak bersifat deterministik, ia tidak sekadar menyalin referensi. Referensi 3:4 pernah dikembalikan sebagai 9:16 pada salah satu pekerjaan kami. Perhatikan file yang dihasilkan alih-alih permintaannya.

Identitas ya, pembingkaian kurang konsisten. Gambar referensi mengunci identitas dan pakaian dengan baik, termasuk pada potongan di dalam take multi-shot. Instruksi pembingkaian dipatuhi kurang kuat dibandingkan Seedance 2.0 pada brief yang sama — produk kami bergeser mengecil dalam bingkai. Nyatakan kembali ukuran shot dan sebutkan nama karakter pada setiap potongan, yang merupakan saran dari panduan prompt MiniMax sendiri.

Model yang sama dengan dua nama. MiniMax menerbitkannya sebagai MiniMax H3; beberapa penyedia melabelinya Hailuo 3.0 — di pemilih model Popcraft ia muncul sebagai Hailuo 3. Halaman ini menggunakan MiniMax H3 di seluruh bagian.

H3 mengenakan biaya per detik hasil video. Untuk harga per detik saat ini, lihat halaman harga. Satu hal yang layak diketahui sebelum Anda melakukan proses generatif: tingkatan 768p selesai dengan ukuran file sekitar sepertiga dari 2K, dan sekitar 40% lebih cepat, jika pertukaran tersebut sesuai dengan kebutuhan pekerjaan Anda.

Hasilkan klip yang sudah memiliki suara

H3 sudah hadir di Popcraft, bersama jajaran model video lainnya.

Terus jelajahi

Model terkait