MiniMax H3
사운드가 포함된 영상의 시작
MiniMax H3는 2K 화질과 동기화된 스테레오 트랙(효과음, 배경 소음, 대사 포함)을 동시에 생성합니다. Popcraft에서 이용 가능.
H3로 제작된 영상
대사, 타이틀, 트레일러, 브랜드 및 제품 영상, 패션, 게임 인터페이스, 포스터 디자인, 효과음, 매크로 및 트루 아나모픽 프레임. 스크롤하면 재생됩니다. 스피커를 탭해 사운드를 확인하세요.
실제로 말하는 모습
노천 카페의 크리에이터가 카메라를 향해 말합니다. 대사, 립싱크, 배경의 거리가 모두 한 번의 생성으로 구현되었습니다. 이것이 이 모델의 핵심 역량입니다.
아이웨어 캠페인
소셜 미디어용 9:16 기본 촬영. 미러 렌즈, 조각 같은 실루엣, 깔끔한 스튜디오 전경 등 모든 컷에서 아이덴티티가 유지됩니다.
MIDNIGHT LINE
범죄물 타이틀 시퀀스: 분할 화면, 강렬한 컬러 블록, 드럼 비트에 맞춘 캐스트 카드 컷이 서스펜스 재즈 스코어와 함께 펼쳐집니다.
실제로 작동하는 게임 메뉴
캐릭터 선택, 무기 커스텀, 가독성 있는 버튼 상태. 읽기 쉬운 UI 렌더링은 대부분의 영상 모델이 실패하는 부분이며, 이것이 바로 이 예시를 보여주는 이유입니다.
THE STARS WERE LISTENING
고대비 SF 티저. 거대한 고리 앞의 작은 인물, 어둠 속에서 나타나는 타이틀, 그리고 고조되는 스코어가 조화를 이룹니다.
POPUP! Series 001
가독성 높은 포스터 및 수집품 디자인: 헤드라인 타이포그래피, 시리즈 번호, 인쇄 가능할 정도로 깔끔하게 렌더링된 캐릭터.
불과 가죽
강렬한 대비의 에디토리얼 패션 — 배경의 불꽃, 전면의 에나멜 가죽, 그리고 샷마다 일정하게 유지되는 모델의 모습.
LEATHER IN MOTION
황혼, 자동차, 질감 탐구. 느린 움직임, 단일 조명, 그리고 영상 위에 깔끔하게 배치된 타이포그래피.
현실 위에 그려진 드로잉
실사 트램 영상 위에 얹힌 수작업 발광 라인 애니메이션이 칸을 이동하며 형태를 바꿉니다.
비늘을 셀 수 있을 만큼 가까운
초근접 매크로 촬영된 크레스티드 게코가 눈을 핥는 모습. 피부 질감, 젖은 광택, 미세한 움직임이 2K 화질로 유지됩니다.
MINIMAX, 2.35:1
2944 by 1248 해상도의 브랜드 영상 — 16:9 크롭이 아닌 실제 아나모픽 프레임이며, 난간을 따라 워드마크가 깔끔하게 반복 배치되었습니다.
제작에 사용된 프롬프트
브리프, 제공된 보드, 그리고 결과물 영상 — 스코어, 컷 전환, 화면 텍스트까지 단 한 번의 생성으로 완성되었습니다.
가벼운 서스펜스 범죄 영화를 위한 15초 분량의 16:9 타이틀 시퀀스. 시각적 언어: 레트로 일본 애니메이션 타이틀, 날카로운 실루엣, 코믹 콜라주, 비대칭 분할 화면, 강렬한 기하학적 컬러 블록, 영어 크레딧, 약간의 가타카나, 재즈 범죄 분위기. 분위기는 서스펜스 60%, 재즈 40% — 신비롭고 쿨하며 도시적인 느낌. 호러나 무거운 느낌, 혹은 밝은 재즈 영상은 아님.
움직임은 모션 그래픽 콜라주 느낌이어야 함: 검은 배경에 선 프레임이 그려지고, 분할 경계가 튀어나오며, 컬러 블록과 패널이 하나씩 배치됨. 실루엣, 소품 클로즈업, 크레딧이 드럼 비트에 맞춰 슬라이드, 팝, 마스크 효과로 나타남.
영어 크레딧은 깔끔하고 읽기 쉬워야 하며, 애니메이션 효과를 줄 수 있음: 얇은 프레임이 그려지고 이름이 슬라이드 인, 글자가 하나씩 나타나고 컬러 블록 마스크가 해제된 후 유지됨. 중국어 추가, 깨진 글자, 오타 금지. 모든 크레딧과 역할은 한 번씩만 등장함 — 역할이나 이름의 중복 없어야 하며 한 사람이 두 역할을 맡지 않음.
전환 효과: 원형 바이닐 마스크, 수직 자동차 문 와이프, 프레임을 가로지르는 긴 그림자, 레드 라인 컷, 거대 글자 형태 마스크, 분할 프레임 재조합, 강렬한 컬러 블록 컷. 모두 박자에 맞출 것. 부드러운 디졸브나 유동적인 모핑 금지.
Music: 오리지널 15초 타이틀 큐, 서스펜스 60%, 재즈 40% — 지속되는 베이스, 긴박한 피치카토 현악기, 차가운 신스 펄스, 킥, 절제된 브러쉬 소리, 워킹 베이스 파편, 낮은 섹소폰 문구와 짧은 금관악기 타격음. 저음과 하이햇은 2초간 빌드업, 3초에 킥, 6초에 재즈 베이스, 10초에 짧은 섹소폰/금관 리프, 마지막 2초는 드럼과 긴장감 있는 화음으로 정지. 기존 멜로디를 모방하지 말 것.






브리프가 지시하는 6개의 보드 — "이 이미지들의 시각적 언어를 참조하십시오".
단 한 번의 생성. 캐스트 카드, 분할 화면, 바이닐 마스크 전환, 서스펜스 재즈 큐가 모두 함께 생성되었습니다. 사후에 음악을 넣거나 텍스트를 입히거나 편집하지 않았습니다.
주요 활용 사례
생성된 사운드와 단일 테이크 컷 전환이 작업 방식 자체를 바꾸는 사례들입니다.
첫 검토부터 완성도 높은 세로형 광고
9:16 컷에 배경 소음, 폴리 효과음, 대사가 이미 포함되어 있어, 이해관계자가 처음 보는 버전이 소리 없는 애니매틱스가 아닙니다.
움직이는 제품 사진
제품 스틸 컷을 첫 프레임과 끝 프레임으로 설정하면 모델이 그 사이의 과정을 채워줍니다. 동일한 용기, 동일한 조명 아래서 뚜껑이 열리는 식입니다.
시리즈 전체에서 유지되는 얼굴
참조 이미지를 통해 여러 테이크와 한 테이크 안의 컷들 사이에서도 정체성과 의상이 유지됩니다. 이는 반복 등장하는 캐릭터에 필수적입니다.
카메라 워킹이 텍스트로 지정된 애니매틱스
지정된 세트의 문장으로 움직임을 작성하므로, 모델이 임의로 생성하는 것이 아니라 정확한 '푸시인'을 구현할 수 있습니다.
편집 없이 만드는 컷다운
프롬프트에 작성된 컷들이 한 클립 내의 여러 샷으로 생성되며, 그 사이의 환경음은 끊김 없이 이어집니다.
차별화된 핵심 기능
세 가지 특징 — 특히 첫 번째는 매우 드문 기능입니다.
영상과 함께 생성되는 사운드
효과음, 환경음, 립싱크 대사가 한 파일에 담깁니다. 오디오를 네 번 받아쓰기 해본 결과, 스크립트 대사가 매번 정확하게 동기화되어 일치했습니다.
한 번의 생성으로 구현되는 컷 전환
프롬프트가 지정한 위치에 3개의 샷과 2개의 하드 컷이 배치되며, 불필요한 이어붙이기 없이 환경음이 매끄럽게 흐릅니다.
5~15초 사이 정수 단위 선택
참조 모드에서 프레임 단위로 재생 시간이 준수됩니다. 11초 컷을 요청하면 15초로 반올림되지 않고 정확히 11초로 생성됩니다.
H3와 Seedance 2.0 비교
직접 테스트 결과: 동일한 프롬프트와 참조 이미지를 사용하고 모델만 변수로 두었습니다. 벤치마크가 아닌 단일 프롬프트 결과입니다. 모델 특성에 따라 한 가지 설정을 변경했습니다. H3는 참조 이미지 첨부 시 지정된 가로세로비를 거부하므로 직접 선택하도록 했습니다.
| 측정 항목 | MiniMax H3 | Seedance 2.0 |
|---|---|---|
| 생성 화질 | 1440 × 2560 · 24 fps | 1248 × 1664 · 24 fps |
| 대사 일치 여부(받아쓰기 확인) | 정확히 일치 및 동기화됨, 4 of 4 | 뭉개짐, 동기화 안 됨 |
| 요청 시간 → 생성 시간 | 8 s → 8.000 s | 8 s → 8.08 s |
| 프레이밍 지시 준수 여부 | 아니요 — 용기가 점점 작아짐 | 예 |
| 프레임별 워드마크 가독성 | 134 of 192 | 159 of 193 |
화질은 비슷하고 사운드는 훨씬 우수하지만, 지시 준수 능력은 다소 떨어집니다. 두 모델 모두 대사를 작성하지 않았고 조용한 배경음만 요청했습니다. 이를 통해 H3는 별도 지시가 없으면 스스로 대사를 생성한다는 점을 알 수 있었습니다.
프롬프트 작성 가이드
세 부분으로 나뉩니다. 각 첨부 파일의 용도를 밝히고, 핵심 창의적 아이디어를 한 문장으로 쓴 뒤, 클립을 샷별로 묘사하세요. 각 샷에는 전환 시간, 프레이밍, 카메라 워킹, 대사 및 동작에 따른 효과음을 포함합니다.
원하지 않는 것을 명확히 기재하세요
부정 명령어는 별도의 지시여야 합니다. 무음을 원한다면 non_diegetic_music 필드를 N/A로 설정하세요 — "non_diegetic_music": N/A라고 입력합니다. 필드를 비워두는 것은 같은 요청이 아닙니다.
이는 필수 사항입니다. 조용한 배경음을 요청하고 대사를 쓰지 않았던 저희 프롬프트의 경우, 입력하지도 않은 제품 홍보 멘트를 립싱크 대사로 생성해 냈습니다.
사운드스케이프 전용 필드 활용
환경음과 동작음은 샷 묘사에 넣지 않습니다. 전체 클립에 대해 1~4문장으로 overall_soundscape에 입력하세요. 캐릭터가 들을 수 없는 스코어는 non_diegetic_music에 넣습니다. 대사는 샷 묘사에 둡니다.
텍스트는 따옴표로, 대사는 샷 길이에 맞춰
화면에 표시될 단어는 따옴표 안에 정확하게 입력하세요. 대사는 지정된 샷의 길이에 맞아야 합니다. 대사가 이어지는 샷들을 명시하면 컷을 넘나들며 대사가 지속될 수 있습니다.
작성된 프롬프트 예시
모델이 읽는 필드 형식의 세 부분integrated_multimodal_description: [Shot 1] A barista sets a mug on the marble counter shown in <Picture 1>, keeping the counter, the light and the mug's position. The camera pushes in with small amplitude at slow speed. The barista with a warm, low voice (S1) says: <d>[English] Yours.</d> [Shot 2] At 00:05.000, the shot cuts to an overhead close-up of steam rising from the mug while her last word carries over. overall_soundscape: Ceramic meets stone with one soft knock and low room tone continues underneath. An espresso machine hisses two rooms away. non_diegetic_music: N/A
Popcraft에서 사용하기
H3는 영상 모델 목록에서 Seedance 옆에 있습니다. 세 단계를 따르세요. 특히 세 번째 단계는 자주 간과됩니다.
MiniMax H3 선택
길이를 설정(5~15초 사이 정수 단위)하고 화질 등급을 선택하세요.
참조 파일 첨부 및 용도 설명
MiniMax는 라벨이 없는 첨부 파일을 오류의 첫 번째 원인으로 꼽습니다. 이미지가 첫 프레임인지 마지막 프레임인지 명시하세요. 두 장을 사용하여 샷의 범위를 지정할 수도 있습니다.
무음을 포함한 사운드 지시
사운드스케이프를 작성하고, 원하지 않는 것은 별도의 지시로 작성하세요. 작성하지 않으면 H3가 임의로 대사를 쓰고 말하게 됩니다.
자주 묻는 질문
클립에 효과음, 환경음, 대사가 이미 포함되어 있어 사운드 작업이 무에서 유를 만드는 과정이 아닌 편집 과정이 됩니다. 하지만 완성된 믹스는 아닙니다. 테이크마다 레벨이 다를 수 있으므로 공개 전 오디오 음량 보정 과정을 거치는 것이 좋습니다.
네, 그러지 말라고 지시하지 않는 한 작성합니다. H3에 대해 알아야 할 가장 중요한 점입니다. 조용한 환경음을 요청하고 대사를 입력하지 않았을 때, H3는 입력되지 않은 홍보성 대사를 작성하고 립싱크까지 수행했습니다. 사운드 필드를 비워두는 것과 무음을 요청하는 것은 다릅니다. 부정 명령을 별도 지시로 작성하고 매번 사운드스케이프를 제어하세요. 클라이언트 작업이나 규제 대상 카테고리의 경우, 이를 선호도가 아닌 필수 검토 단계로 간주해야 합니다.
768p 요청 시 단변이 768픽셀인 영상을 반환하며, 720p 요청 시에도 동일합니다. 1080p 요청은 2K(단변 1440픽셀)로 상향 조정되는데, 이는 요청과 다르게 반환되는 유일한 값입니다. 낮은 화질 등급은 약 3분의 1 용량으로 약 40% 빠르게 생성됩니다. 대신 작은 텍스트의 가독성이 떨어집니다. 768p에서 워드마크는 살아남지만, 그 아래 훨씬 작은 두 번째 줄은 대부분 뭉개집니다.
참조 이미지를 첨부하지 않는 경우에만 가능합니다. 텍스트 투 비디오 방식은 지정된 비율을 준수합니다. 참조 이미지를 첨부하면 비율을 '적응형'으로 설정해야 하며, 이는 확정적이지 않습니다. 즉, 참조 이미지를 단순히 복사하지 않습니다. 3:4 참조 이미지가 한 작업에서는 9:16으로 반환되기도 했습니다. 요청 값보다 실제 생성된 파일을 확인하세요.
정체성은 그렇지만 프레이밍은 덜 확실합니다. 참조 이미지는 멀티샷 테이크의 컷 사이에서도 정체성과 의상을 잘 고정해 줍니다. 하지만 프레이밍 지시는 동일 브리프에서 Seedance 2.0보다 약했습니다. 저희 테스트에서 제품이 점점 작아졌습니다. MiniMax의 가이드대로 모든 컷마다 샷 크기를 다시 명시하고 캐릭터 이름을 부르세요.
두 이름은 같은 모델을 가리킵니다. MiniMax는 MiniMax H3로 발표했으며, 일부 호스트는 Hailuo 3.0으로 표기합니다. Popcraft 모델 선택기에는 Hailuo 3로 나타납니다. 이 페이지에서는 MiniMax H3로 통일하여 사용합니다.
H3는 결과물의 초당 비용을 청구합니다. 현재 초당 가격은 요금제 페이지를 확인하세요. 생성 전 유용한 팁: 768p 등급은 2K 대비 용량은 3분의 1 수준이며 생성 속도는 약 40% 더 빠릅니다. 작업 목적에 맞춰 선택하세요.
계속 둘러보기
관련 모델
Seedance 2.5는 한 번의 작업으로 최대 30초 영상을 생성합니다. 최대 50개의 참조 에셋 지원, 제어 가능한 영상 편집, 고충실도 시간 확장, 0.4~2.5 범위의 모든 화면 비율, 10개 이상 언어의 네이티브 프롬프트 입력을 지원합니다. Popcraft에서 이용 가능합니다.
Popcraft에서 Seedance 2.0으로 텍스트, 이미지 또는 클립으로부터 시네마틱 4K 영상을 생성하세요. 네이티브 동기화 오디오, 멀티샷 시퀀스, 그리고 최대 4K (2160p)의 선명한 디테일.

Seedance 2.0 Mini는 바이트댄스에서 출시한 가장 경량화된 영상 생성 등급입니다. 일반 Seedance 2.0 대비 최대 50% 저렴하고 Fast 모드 대비 약 2배 빠르며, 텍스트, 이미지, 영상, 오디오 프롬프트를 모두 지원합니다. Popcraft에서 지금 이용하세요.

Popcraft의 Seedance 2.0으로 이미지와 프롬프트를 시네마틱 영상으로 변환하세요. 참조 이미지 기반 영상 생성, 시작/종료 프레임 지정, 다중 화면비 출력을 최대 4K 해상도로 지원합니다.