NEWIklan UGC tular anda yang seterusnya hanya satu klik sahaja. Kenali Studio.Buat iklan
PopcraftPopcraft
Model baharu

MiniMax H3

Video yang hadir bersama bunyinya sendiri

MiniMax H3 menjana imej 2K dan trek stereo segerak dalam satu tugasan — kesan, nada bilik dan dialog pertuturan, bersama-sama. Kini di Popcraft.

2K pada 24 fpsStereo audio, dijana5–15s dalam langkah 1s6 nisbah aspekMulti-shot dalam satu ambilan
Dialog
Urutan tajuk
Filem jenama
Antara muka permainan
Treler
Kesan lukisan
Filem produk
Makro

Filem yang dihasilkan dengan H3

Dialog, tajuk, treler, filem jenama dan produk, fesyen, antara muka permainan, reka bentuk poster, kesan, makro dan bingkai anamorfik sebenar. Ia dimainkan semasa anda menatal; ketik pembesar suara untuk mendengar.

Dialog

Seseorang yang benar-benar bercakap

Seorang pencipta di kafe tepi jalan, bercakap ke kamera. Kata-kata, gerak bibir dan suasana jalanan di belakangnya semuanya dihasilkan dalam penjanaan yang sama — inilah keupayaan teras model ini dibina.

Fesyen, menegak

Kempen cermin mata

Dirakam asli 9:16 untuk media sosial. Lensa cermin, siluet arca dan sapuan studio yang bersih — identiti kekal merentasi setiap potongan.

Tajuk dan pembungkusan

MIDNIGHT LINE

Urutan tajuk jenayah: skrin terbahagi, blok warna tajam dan kad pelakon dipotong mengikut rentak dram, diiringi skor muzik jaz suspen tersendiri.

Antara muka dan permainan

Menu permainan yang berfungsi

Pemilihan watak, penyesuaian kelengkapan, status butang yang boleh dibaca. Merender UI yang jelas adalah cabaran utama kebanyakan model video, dan itulah sebabnya ia dipaparkan di sini.

Treler

THE STARS WERE LISTENING

Teaser fiksyen sains kontras tinggi. Satu susuk kecil berlatarkan cincin gergasi, tajuk muncul dari kegelapan, dan skor muzik yang memuncak bersamanya.

Reka bentuk grafik

POPUP! Series 001

Reka bentuk poster dan barangan koleksi, kekal rata dan jelas: tipografi tajuk, penomboran siri, dan watak yang dirender cukup bersih untuk dicetak.

Filem jenama

Api dan kulit

Fesyen editorial pada kontras penuh — api di belakang, kulit paten di depan, dan model yang konsisten dari syot ke syot.

Filem produk

LEATHER IN MOTION

Senja, kereta, dan kajian tekstur. Pergerakan perlahan, sumber cahaya praktikal tunggal, dan tipografi yang disusun bersih di atas imej.

Kesan

Lukisan di atas dunia nyata

Animasi garisan bercahaya lukisan tangan di atas rakaman trem aksi nyata, berubah bentuk demi bentuk semasa melalui gerabak.

Makro

Cukup dekat untuk mengira sisik

Seekor cicak krested dalam makro ekstrem, lidah menjilat mata. Tekstur kulit, kilauan basah dan pergerakan mikro kekal pada resolusi 2K.

Ultra-lebar

MINIMAX, 2.35:1

Karya berjenama yang dihasilkan pada 2944 by 1248 — bingkai anamorfik tulen dan bukannya keratan 16:9, dengan tanda kata disusun berulang kali dan bersih di sepanjang langkan.

Gesaan yang menghasilkannya

Ringkasan, papan rujukan yang diberikan, dan filem yang dihasilkan — termasuk skor muzik, potongan dan tipografi pada skrin, dalam satu penjanaan sahaja.

Gesaan — tatal

Urutan tajuk 16:9 berdurasi lima belas saat untuk filem jenayah suspen ringan. Bahasa visual: tajuk anime Jepun retro, siluet bertepi tajam, kolaj komik, skrin terbahagi asimetri, blok warna geometri yang kuat, kredit bahasa Inggeris, sedikit katakana, rasa jaz-jenayah. Mood 60% suspen, 40% jaz — misteri, tenang, urban; bukan seram, tidak berat, dan bukan video jaz yang ceria.

Pergerakan harus kelihatan seperti kolaj grafik gerakan: bingkai garisan dilukis pada latar hitam, sempadan terbahagi muncul tiba-tiba, blok warna dan panel ditampal blok demi blok; siluet, syot dekat prop dan kredit meluncur, muncul dan terdedah melalui topeng mengikut rentak dram.

Kredit bahasa Inggeris mestilah bersih dan mudah dibaca, dan boleh dianimasikan: bingkai nipis dilukis, nama meluncur masuk, huruf muncul satu demi satu, blok warna menutup pendedahan, kemudian ia kekal. Tiada penambahan bahasa Cina, tiada glif yang mengelirukan, tiada kesalahan ejaan. Setiap kredit dan peranan muncul sekali sahaja — tiada peranan berulang, tiada nama berulang, tiada sesiapa memegang dua tugas.

Transisi: topeng vinil bulat, sapuan pintu kereta menegak, bayang panjang menyapu bingkai, potongan garis merah, topeng bentuk huruf gergasi, pemasangan semula bingkai terbahagi, potongan blok warna tajam. Semuanya mengikut bit. Tiada kesan dissolve lembut, tiada morph bendalir.

Muzik: klu tajuk asal 15 saat, 60% suspen dan 40% jaz — bes berpanjangan, tali pizzicato tegang, denyutan sint sejuk, sepakan dram, berus jarang, serpihan walking-bass, frasa saksofon rendah dan tusukan bras pendek. Nada rendah dan hat berkembang selama 2s, sepakan pada 3s, jaz bes pada 6s, rif saksofon/bras pendek pada 10s, dan kord tegang dengan dram untuk membekukan 2s terakhir. Jangan tiru mana-mana melodi sedia ada.

Rujukan
Style reference board 1 for the MIDNIGHT LINE title sequenceStyle reference board 2 for the MIDNIGHT LINE title sequenceStyle reference board 3 for the MIDNIGHT LINE title sequenceStyle reference board 4 for the MIDNIGHT LINE title sequenceStyle reference board 5 for the MIDNIGHT LINE title sequenceStyle reference board 6 for the MIDNIGHT LINE title sequence

Enam papan yang dirujuk oleh ringkasan — "rujuk bahasa visual imej-imej ini".

Hasil

Satu penjanaan. Kad pelakon, skrin terbahagi, transisi topeng vinil dan klu jaz suspen semuanya dihasilkan bersama — tiada apa-apa di sini yang ditambah skor, huruf atau dipotong kemudian.

Kegunaan untuk pengguna

Karya di mana bunyi yang dijana dan potongan dalam satu ambilan mengubah proses kerja itu sendiri.

Pemasaran

Iklan menegak yang menarik sejak tontonan pertama

Potongan 9:16 hadir dengan nada bilik, foley dan baris dialog yang sudah sedia ada, jadi versi pertama yang dilihat oleh pihak berkepentingan bukanlah animatik bisu.

E-dagang

Gambar produk yang bergerak

Apit pegun produk dengan bingkai pertama dan terakhir, dan model akan mengisi pergerakan antaranya — balang yang sama, cahaya yang sama, dibuka.

Pencipta

Satu wajah merentasi seluruh siri

Imej rujukan mengekalkan identiti dan pakaian merentasi ambilan dan potongan dalam satu ambilan, yang sangat diperlukan untuk persona kamera yang berulang.

Filem dan pra-visualisasi

Animatik dengan arahan kamera bertulis

Pergerakan ditulis sebagai ayat daripada set yang dinamakan, jadi push-in adalah benar-benar push-in, bukannya apa sahaja yang dirasakan oleh model.

Sosial

Suntingan ringkas tanpa penyuntingan

Potongan yang ditulis ke dalam gesaan dihasilkan sebagai beberapa syot dalam satu klip, dengan ambien yang berjalan tanpa henti merentasinya.

Keunikan sebenar

Tiga perkara — dan hanya yang pertama benar-benar jarang ditemui.

Yang jarang ditemui

Bunyi dijana bersama imej

Kesan, ambien dan dialog segerak bibir dalam fail yang sama. Kami mentranskripsi semula audio sebanyak empat kali; baris skrip dihasilkan secara verbatim dan segerak setiap kali.

Yang berguna

Potongan dalam satu penjanaan

Tiga syot dan dua potongan tajam, diletakkan tepat mengikut gesaan, dengan sifar sambungan yang tidak diingini pada fail yang dihasilkan — serta ambien yang mengiringi semuanya.

Yang praktikal

Mana-mana saat penuh, 5 hingga 15

Tempoh dipatuhi mengikut bingkai dalam mod rujukan. Potongan sebelas saat dihasilkan tepat sebelas saat, bukannya dibundarkan ke lima belas.

MiniMax H3 berbanding Seedance 2.0

Percubaan kami sendiri: gesaan yang sama dan imej rujukan yang sama, dengan model sebagai satu-satunya pemboleh ubah yang disengajakan. Satu gesaan, bukan penanda aras. Satu medan perlu diubah mengikut model: H3 menolak nisbah aspek yang dinyatakan apabila imej rujukan disertakan, jadi ia memilih nisbahnya sendiri.

UkuranMiniMax H3Seedance 2.0
Imej yang dihasilkan1440 × 2560 · 24 fps1248 × 1664 · 24 fps
Baris pertuturan, ditranskripsi semulaverbatim dan segerak, 4 of 4bercelaru, tidak segerak
Tempoh diminta → dihasilkan8 s → 8.000 s8 s → 8.08 s
Arahan pembingkaian dipatuhitidak — balang kelihatan mengecilya
Tanda kata jelas, bingkai demi bingkai134 of 192159 of 193

Setanding dari segi imej, jelas lebih baik pada bunyi, kurang mahir mengikut arahan. Tiada gesaan yang menulis dialog dan kedua-duanya meminta nada bilik yang senyap sahaja — begitulah cara kami mengetahui bahawa H3 menulis dialognya sendiri jika dibiarkan.

Cara menggesanya

Tiga bahagian. Nyatakan kegunaan setiap lampiran, tulis satu ayat untuk kreatif teras, kemudian perincikan klip syot demi syot — setiap syot membawa masa potongan, pembingkaian, pergerakan kamera, dialog dan bunyi aksi tersebut.

Peraturan paling penting

Nyatakan perkara yang anda tidak mahu dengan jelas

Negatif mestilah menjadi arahannya sendiri. Untuk kesunyian, tetapkan medan muzik bukan diegetik kepada N/A — ditulis sebagai "non_diegetic_music": N/A. Mengabaikan medan tersebut bukanlah permintaan yang sama.

Ini bukan pilihan. Gesaan kami yang meminta nada bilik yang senyap dan tidak menulis dialog telah menghasilkan bacaan lisan penuh, segerak bibir, menyatakan dakwaan produk yang tidak ditaip oleh sesiapa pun.

Bunyi

Landskap bunyi mempunyai medannya sendiri

Bunyi ambien dan aksi tidak dimasukkan dalam huraian syot. Ia dimasukkan dalam overall_soundscape, satu hingga empat ayat untuk keseluruhan klip. Skor muzik yang tidak didengar oleh watak dimasukkan dalam non_diegetic_music. Dialog kekal dalam syot.

Kemahiran

Petik teks, dan sesuaikan baris dengan syot

Perkataan yang dimaksudkan untuk muncul di skrin dimasukkan ke dalam gesaan tepat seperti yang sepatutnya dibaca, dalam tanda petik. Baris pertuturan mestilah sesuai dengan durasi saat syot yang diberikan; ia boleh merentasi potongan jika anda menamakan syot yang terlibat.

Gesaan yang lengkap

tiga bahagian, dalam format medan yang dibaca oleh model
integrated_multimodal_description: [Shot 1] A barista sets a mug on the marble counter shown in <Picture 1>, keeping the counter, the light and the mug's position. The camera pushes in with small amplitude at slow speed. The barista with a warm, low voice (S1) says:
<d>[English] Yours.</d>
[Shot 2] At 00:05.000, the shot cuts to an overhead close-up of steam rising from the mug while her last word carries over.

overall_soundscape: Ceramic meets stone with one soft knock and low room tone continues underneath. An espresso machine hisses two rooms away.

non_diegetic_music: N/A

Menggunakannya di Popcraft

H3 berada dalam senarai model video bersebelahan Seedance. Tiga langkah, dan yang ketiga adalah langkah yang sering diabaikan.

01

Pilih MiniMax H3

Kemudian tetapkan tempoh — mana-mana saat penuh dari lima hingga lima belas — dan tahap imej.

02

Sertakan rujukan, dan nyatakan kegunaan setiap satu

MiniMax menganggap lampiran tanpa label sebagai perkara utama yang menyebabkan ralat. Satu imej adalah bingkai pertama atau terakhir dan anda nyatakan yang mana satu; dua imej mengapit syot tersebut.

03

Arahan bunyi, termasuk kesunyian

Tulis landskap bunyi, dan tulis perkara yang anda tidak mahu sebagai arahan tersendiri. Jika tidak ditulis, H3 akan menulis dan melakukan dialognya sendiri.

Soalan

Klip yang dihasilkan sudah mempunyai kesan, nada bilik dan dialog, jadi peringkat bunyi menjadi proses penyuntingan dan bukannya membina dari sifar. Walau bagaimanapun, ia bukanlah adunan akhir. Tahap kelantangan berbeza-beza dari satu ambilan ke ambilan yang lain, jadi rancang untuk proses penyelarasan kelantangan sebelum diterbitkan.

Ya, melainkan anda mengarahkannya untuk tidak berbuat demikian. Ini adalah perkara paling penting untuk diketahui tentang H3. Gesaan kami meminta nada bilik semula jadi yang senyap dan tidak menulis dialog langsung; H3 menulis, melakonkan dan menyegerakkan bibir bacaan lisan penuh, termasuk dakwaan produk yang tidak ditaip oleh sesiapa pun. Mengabaikan medan bunyi bukanlah permintaan yang sama seperti meminta kesunyian. Tulis arahan negatif secara berasingan dan arahkan landskap bunyi setiap kali. Bagi klien atau kategori terkawal, anggap ini sebagai langkah semakan dan bukannya pilihan.

Permintaan 768p memberikan tepi pendek 768 piksel. Permintaan 720p memberikan hasil yang sama. Permintaan 1080p ditingkatkan kepada 2K — 1440 piksel pada tepi pendek — yang merupakan satu-satunya nilai yang tidak dihasilkan mengikut permintaan. Tahap kecil dihasilkan kira-kira 40% lebih cepat dalam sekitar satu pertiga saiz bait. Kekurangannya adalah pada tulisan kecil: tanda kata dapat bertahan pada 768, tetapi baris kedua yang lebih kecil di bawahnya kebanyakannya tidak jelas.

Hanya apabila anda tidak melampirkan imej rujukan. Teks-ke-video mematuhi nisbah yang dinyatakan. Lampirkan sebarang rujukan dan nisbah mestilah ditetapkan kepada adaptif — dan adaptif tidak bersifat deterministik, ia tidak sekadar menyalin rujukan. Rujukan 3:4 dihasilkan sebagai 9:16 dalam salah satu tugasan kami. Lihat pada fail yang dihasilkan dan bukannya pada permintaan.

Identiti ya, pembingkaian kurang konsisten. Imej rujukan mengunci identiti dan pakaian dengan baik, termasuk merentasi potongan dalam ambilan berbilang syot. Arahan pembingkaian kurang dipatuhi berbanding Seedance 2.0 pada tugasan yang sama — produk kami kelihatan mengecil dalam bingkai. Nyatakan semula saiz syot dan namakan watak pada setiap potongan, seperti yang disarankan oleh panduan gesaan MiniMax sendiri.

Model yang sama dengan dua nama. MiniMax menerbitkannya sebagai MiniMax H3; sesetengah hos melabelkannya sebagai Hailuo 3.0 — pada pemilih model Popcraft ia muncul sebagai Hailuo 3. Laman ini menggunakan MiniMax H3 di seluruh teks.

H3 mengenakan caj mengikut saat hasil kerja. Untuk harga semasa setiap saat, lihat halaman harga. Satu perkara yang perlu diketahui sebelum anda menjana: tahap 768p dihasilkan dalam kira-kira satu pertiga saiz bait 2K, dan kira-kira 40% lebih cepat, jika perbezaan tersebut sesuai dengan tugasan anda.

Jana klip yang sudah mempunyai bunyi

H3 kini tersedia di Popcraft, bersama-sama dengan rangkaian model video yang lain.

Teruskan meneroka

Model berkaitan