MiniMax H3
Video yang hadir dengan suaranya sendiri
MiniMax H3 menghasilkan gambar 2K dan trek stereo tersinkronisasi dalam satu proses — efek, nada ruangan, dan dialog lisan, sekaligus. Hadir di Popcraft.
Film yang dibuat dengan H3
Dialog, judul, trailer, film merek dan produk, mode, antarmuka game, desain poster, efek, makro, dan bingkai anamorfik asli. Video diputar saat Anda scroll; ketuk speaker untuk mendengar suara.
Seseorang yang benar-benar berbicara
Seorang kreator di kafe trotoar, berbicara ke kamera. Kata-kata, sinkronisasi bibir, dan suasana jalanan di belakangnya berasal dari satu proses generatif yang sama — inilah kemampuan inti dari model ini.
Kampanye kacamata
Shot asli 9:16 untuk media sosial. Lensa cermin, siluet terpahat, dan studio yang bersih — identitas tetap terjaga di setiap potongan adegan.
MIDNIGHT LINE
Sekuens judul film kriminal: layar terpisah, blok warna kontras, dan kartu pemeran yang berganti mengikuti ketukan drum, dengan skor musik jazz-suspens buatan sendiri.
Menu game yang fungsional
Pemilihan karakter, kustomisasi senjata, status tombol yang terbaca. Merender UI yang jelas adalah kelemahan sebagian besar model video, itulah sebabnya kami menampilkannya di sini.
THE STARS WERE LISTENING
Teaser fiksi ilmiah dengan kontras tinggi. Sosok kecil di depan cincin raksasa, judul muncul dari kegelapan, dan musik yang mengiringi perkembangannya.
POPUP! Series 001
Desain poster dan koleksi, datar dan terbaca: tipografi judul, nomor seri, dan karakter yang dirender cukup bersih untuk dicetak.
Api dan kulit
Mode editorial dengan kontras penuh — api di latar belakang, kulit paten di depan, dan model yang konsisten dari shot ke shot.
LEATHER IN MOTION
Senja, sebuah mobil, dan studi tekstur. Pergerakan lambat, satu sumber cahaya praktis, dan tipografi yang terpasang bersih di atas gambar.
Gambar di atas dunia nyata
Animasi garis cahaya yang digambar tangan di atas rekaman trem live-action, bertransformasi dari satu bentuk ke bentuk lain saat melewati gerbong.
Cukup dekat untuk menghitung sisik
Gecko berjambul dalam makro ekstrem, lidah menjilat mata. Tekstur kulit, pantulan cahaya basah, dan pergerakan mikro terjaga pada 2K.
MINIMAX, 2.35:1
Karya bermerek yang disajikan pada 2944 by 1248 — bingkai anamorfik asli alih-alih pemotongan 16:9, dengan logo yang terpasang berulang dan bersih di sepanjang langkan.
Prompt yang membuatnya
Brief, papan referensi yang diberikan, dan film yang dihasilkan — termasuk musik, potongan adegan, dan teks di layar, dalam satu proses generatif.
Sekuens judul 16:9 berdurasi lima belas detik untuk film kriminal suspens ringan. Bahasa visual: judul anime Jepang retro, siluet bertepi tajam, kolase komik, layar terpisah asimetris, blok warna geometris yang kuat, kredit bahasa Inggris, sedikit katakana, nuansa jazz-kriminal. Suasana 60% suspens, 40% jazz — misterius, keren, urban; bukan horor, tidak berat, dan bukan video jazz yang ceria.
Gerakan harus terbaca sebagai kolase grafis gerak: bingkai garis muncul di atas hitam, batas layar terpisah terbuka cepat, blok warna dan panel menempel satu per satu; siluet, close-up properti, dan kredit bergeser, muncul, serta terungkap lewat masker sesuai ketukan drum.
Kredit bahasa Inggris harus bersih dan terbaca, serta boleh dianimasikan: bingkai tipis muncul, nama bergeser masuk, huruf muncul satu per satu, blok warna menutupi pengungkapan, lalu tertahan. Tanpa tambahan bahasa Mandarin, tanpa simbol yang kacau, tanpa salah eja. Setiap kredit dan peran muncul sekali — tidak ada peran yang berulang, tidak ada nama yang berulang, tidak ada orang yang memegang dua tugas.
Transisi: masker vinil melingkar, sapuan vertikal pintu mobil, bayangan panjang menyapu bingkai, potongan garis merah, masker bentuk huruf raksasa, penyatuan kembali bingkai terpisah, potongan blok warna yang tajam. Semuanya sesuai tempo. Tanpa dissolve lembut, tanpa morphing cair.
Musik: isyarat judul orisinal 15 detik, 60% suspens dan 40% jazz — bass yang tertahan, senar pizzicato tegang, denyut synth dingin, kick drum, sapuan kuas perkusi yang jarang, fragmen walking-bass, frasa saksofon rendah, dan tiupan brass pendek. Bagian rendah dan hi-hat meningkat selama 2 detik, kick drum pada 3 detik, jazz bass pada 6 detik, riff saksofon/brass pendek pada 10 detik, dan akord tegang dengan drum untuk membekukan adegan di 2 detik terakhir. Jangan meniru melodi yang sudah ada.






Enam papan referensi yang ditunjuk oleh brief — "gunakan bahasa visual dari gambar-gambar ini".
Satu kali proses generatif. Kartu pemeran, layar terpisah, transisi masker vinil, dan isyarat jazz-suspens semuanya dihasilkan sekaligus — tidak ada yang ditambahkan musiknya, diberi teks, atau dipotong setelahnya.
Kegunaan bagi pengguna
Pekerjaan di mana audio hasil generatif dan potongan adegan dalam satu proses mengubah cara kerja itu sendiri.
Iklan vertikal yang layak tonton sejak draf pertama
Potongan 9:16 hadir dengan suara ruangan, foley, dan dialog lisan yang sudah terpasang, sehingga versi pertama yang dilihat pemangku kepentingan bukanlah animatik bisu.
Foto produk yang bergerak
Batasi foto produk dengan bingkai pertama dan terakhir, dan model akan mengisi pergerakan di antaranya — stoples yang sama, pencahayaan yang sama, terbuka.
Satu wajah di seluruh seri
Gambar referensi menjaga identitas dan pakaian di berbagai take serta potongan di dalam satu take, hal yang sangat dibutuhkan untuk persona berulang di depan kamera.
Animatik dengan pergerakan kamera yang terprogram
Pergerakan ditulis sebagai kalimat dari set yang ditentukan, sehingga push-in tetap menjadi push-in, bukan pergerakan acak model.
Potongan tanpa pengeditan
Potongan adegan yang ditulis dalam prompt dikembalikan sebagai beberapa shot di dalam satu klip, dengan ambien yang berjalan tanpa putus di antaranya.
Apa yang membedakannya
Tiga hal — dan hanya yang pertama yang benar-benar langka.
Suara dihasilkan bersama gambar
Efek, ambien, dan dialog tersinkronisasi bibir dalam file yang sama. Kami mentranskripsi ulang audionya empat kali; baris naskah muncul kata demi kata dan tersinkronisasi setiap saat.
Potongan adegan dalam satu proses generatif
Tiga shot dan dua potongan tajam, ditempatkan sesuai prompt, dengan nol sambungan yang tidak diinginkan pada file hasil — dan ambien tetap mengalir di antaranya.
Detik utuh apa pun, 5 hingga 15
Durasi dipatuhi hingga ke bingkainya dalam mode referensi. Potongan sebelas detik diminta sebagai sebelas, bukan dibulatkan ke lima belas.
H3 bersanding dengan Seedance 2.0
Uji coba kami sendiri: prompt dan gambar referensi yang sama, dengan model sebagai satu-satunya variabel yang disengaja. Satu prompt, bukan tolok ukur menyeluruh. Satu bidang harus diubah sesuai model: H3 menolak rasio aspek yang ditentukan saat gambar referensi dilampirkan, sehingga model memilih rasionya sendiri.
| Pengukuran | MiniMax H3 | Seedance 2.0 |
|---|---|---|
| Gambar yang dihasilkan | 1440 × 2560 · 24 fps | 1248 × 1664 · 24 fps |
| Dialog lisan, ditranskripsi ulang | kata demi kata dan sinkron, 4 of 4 | kacau, tidak sinkron |
| Durasi diminta → dihasilkan | 8 s → 8.000 s | 8 s → 8.08 s |
| Instruksi pembingkaian dipatuhi | tidak — stoples bergeser mengecil | ya |
| Logo terbaca, bingkai demi bingkai | 134 of 192 | 159 of 193 |
Setara pada gambar, jelas lebih baik pada suara, kurang baik dalam mengikuti instruksi. Kedua prompt tidak menulis satu kata pun dialog dan keduanya meminta suara ruangan yang tenang saja — begitulah kami mengetahui bahwa H3 menulis dialognya sendiri jika Anda membiarkannya.
Cara membuat prompt
Tiga bagian. Jelaskan kegunaan setiap lampiran, tulis satu kalimat inti kreatif, lalu jelaskan klip tersebut shot demi shot — setiap shot menyertakan waktu potong, pembingkaian, gerakan kamera, dialog, dan suara dari aksi tersebut.
Sebutkan apa yang tidak Anda inginkan, secara lisan
Instruksi negatif harus menjadi instruksi tersendiri. Untuk keheningan, atur bidang musik non-diegetik ke N/A — ditulis "non_diegetic_music": N/A. Mengosongkan bidang tersebut bukanlah permintaan yang sama.
Ini tidak opsional. Prompt kami yang meminta suara ruangan tenang dan tanpa dialog justru menghasilkan dialog lengkap, sinkron bibir, yang menyebutkan klaim produk yang tidak pernah diketik oleh siapa pun.
Lansekap suara memiliki bidangnya sendiri
Ambien dan suara aksi tidak dimasukkan dalam deskripsi shot. Mereka masuk ke dalam overall_soundscape, satu hingga empat kalimat untuk seluruh klip. Musik yang tidak bisa didengar karakter masuk ke dalam non_diegetic_music. Dialog tetap ada di dalam deskripsi shot.
Gunakan tanda kutip pada teks, sesuaikan dialog dengan shot
Kata-kata yang ingin dimunculkan di layar harus dimasukkan ke dalam prompt persis seperti tampilannya, dalam tanda kutip. Dialog lisan harus sesuai dengan durasi detik shot yang diberikan; dialog tersebut dapat berlanjut melewati potongan jika Anda menyebutkan nama shot yang dicakupnya.
Contoh prompt yang terisi
tiga bagian, dalam format bidang yang dibaca modelintegrated_multimodal_description: [Shot 1] A barista sets a mug on the marble counter shown in <Picture 1>, keeping the counter, the light and the mug's position. The camera pushes in with small amplitude at slow speed. The barista with a warm, low voice (S1) says: <d>[English] Yours.</d> [Shot 2] At 00:05.000, the shot cuts to an overhead close-up of steam rising from the mug while her last word carries over. overall_soundscape: Ceramic meets stone with one soft knock and low room tone continues underneath. An espresso machine hisses two rooms away. non_diegetic_music: N/A
Menggunakannya di Popcraft
H3 berada di daftar model video di samping Seedance. Tiga langkah, dan yang ketiga adalah yang sering dilewatkan orang.
Pilih MiniMax H3
Lalu atur durasi — detik utuh apa pun dari lima hingga lima belas — dan tingkatan gambar.
Lampirkan referensi, jelaskan kegunaan masing-masing
MiniMax mencatat lampiran tanpa label sebagai pemicu utama kegagalan proses. Satu gambar adalah bingkai pertama atau terakhir dan Anda tentukan yang mana; dua gambar membatasi shot tersebut.
Arahkan suara, termasuk keheningan
Tuliskan lansekap suara, dan tuliskan apa yang tidak Anda inginkan sebagai instruksi tersendiri. Jika dibiarkan kosong, H3 akan menulis dan membawakan dialognya sendiri.
Pertanyaan
Klip hadir dengan efek, ambien, dan dialog yang sudah terpasang, sehingga tahap pengerjaan suara menjadi pengeditan alih-alih membangun dari nol. Namun, ini bukanlah hasil akhir mixing yang matang. Tingkat volume bervariasi dari satu take ke take lainnya, jadi rencanakan proses penyesuaian kenyaringan (loudness pass) sebelum dipublikasikan.
Ya, kecuali Anda melarangnya. Ini adalah hal terpenting yang perlu diketahui tentang H3. Prompt kami meminta suara ruangan alami yang tenang dan tidak menulis dialog sama sekali; H3 menulis, membawakan, dan menyinkronkan bibir untuk dialog lengkap, termasuk klaim produk yang tidak diketik siapa pun. Mengosongkan bidang suara bukanlah permintaan yang sama dengan meminta keheningan. Tuliskan negatif tersebut sebagai instruksi tersendiri dan arahkan lansekap suara setiap saat. Untuk klien atau kategori yang diatur ketat, anggap ini sebagai langkah peninjauan wajib, bukan sekadar preferensi.
Permintaan 768p mengembalikan tepi pendek 768 piksel. Permintaan 720p mengembalikan hal yang sama. Permintaan 1080p didorong ke 2K — 1440 piksel pada tepi pendek — yang merupakan satu-satunya nilai yang tidak dikembalikan sesuai permintaan. Tingkatan kecil selesai sekitar 40% lebih cepat dengan ukuran file sepertiga lebih kecil. Risikonya adalah teks kecil: logo bertahan di 768, tetapi baris kedua yang jauh lebih kecil di bawahnya sebagian besar tidak bertahan.
Hanya jika Anda tidak melampirkan gambar referensi. Teks-ke-video mematuhi rasio yang dinyatakan. Lampirkan referensi apa pun dan rasio harus diatur ke adaptif — dan adaptif tidak bersifat deterministik, ia tidak sekadar menyalin referensi. Referensi 3:4 pernah dikembalikan sebagai 9:16 pada salah satu pekerjaan kami. Perhatikan file yang dihasilkan alih-alih permintaannya.
Identitas ya, pembingkaian kurang konsisten. Gambar referensi mengunci identitas dan pakaian dengan baik, termasuk pada potongan di dalam take multi-shot. Instruksi pembingkaian dipatuhi kurang kuat dibandingkan Seedance 2.0 pada brief yang sama — produk kami bergeser mengecil dalam bingkai. Nyatakan kembali ukuran shot dan sebutkan nama karakter pada setiap potongan, yang merupakan saran dari panduan prompt MiniMax sendiri.
Model yang sama dengan dua nama. MiniMax menerbitkannya sebagai MiniMax H3; beberapa penyedia melabelinya Hailuo 3.0 — di pemilih model Popcraft ia muncul sebagai Hailuo 3. Halaman ini menggunakan MiniMax H3 di seluruh bagian.
H3 mengenakan biaya per detik hasil video. Untuk harga per detik saat ini, lihat halaman harga. Satu hal yang layak diketahui sebelum Anda melakukan proses generatif: tingkatan 768p selesai dengan ukuran file sekitar sepertiga dari 2K, dan sekitar 40% lebih cepat, jika pertukaran tersebut sesuai dengan kebutuhan pekerjaan Anda.
Hasilkan klip yang sudah memiliki suara
H3 sudah hadir di Popcraft, bersama jajaran model video lainnya.
Terus jelajahi
Model terkait
Seedance 2.5 menghasilkan video hingga 30 detik dalam satu proses, dengan hingga 50 aset referensi, pengeditan video yang dapat dikontrol, perpanjangan temporal fidelitas tinggi, rasio aspek apa pun dari 0,4 hingga 2,5, dan prompting native dalam 10+ bahasa. Tersedia di Popcraft.
Hasilkan video sinematik 4K dari teks, gambar, atau klip dengan Seedance 2.0 di Popcraft. Audio tersinkronisasi native, sekuens multi-shot, dan detail setajam silet hingga 4K (2160p).

Seedance 2.0 Mini adalah tier video paling ringan dari ByteDance — hingga 50% lebih murah dari Seedance 2.0 standar dan ~2× lebih cepat dari Fast, dengan prompt teks, gambar, video, dan audio. Tersedia di Popcraft.

Ubah gambar dan prompt menjadi video sinematik dengan Seedance 2.0 di Popcraft. Referensi-ke-video, bingkai pertama/terakhir, dan output multi-aspek hingga 4K.