시작하기

MiniMax H3란 무엇인가: 모두가 써보고 있는 옴니모달 비디오 모델

네이티브 오디오, 혼합 레퍼런스, 2K 출력, 오픈 웨이트 — 새로 나온 Max 티어까지 포함한 H3 패밀리 전체를 한 번에 정리합니다.

지금 만들어보기
MiniMax H3란 무엇인가: 모두가 써보고 있는 옴니모달 비디오 모델

integrated_multimodal_description: Create a 15-second 16:9 audiovisual game promo in pure 2D Japanese cel animation fused with flat editorial motion graphics. Use only deep red, scarlet, wine red, pure white, and black. Every character, prop, effect, title, and transition must remain a flat illustrated layer with clean line art, solid color fills,

모델
MiniMax H3
길이
15초
화면 비율
16:9
해상도
2k

8월부터 타임라인을 장악한 모델의 정체

몇 달에 한 번씩, 모든 크리에이터의 타임라인이 테스트하는 모델이 하나씩 등장합니다. 8월부터 그 주인공은 MiniMax H3입니다 — 이전 이름인 Hailuo 3.0으로도 알려져 있죠. 이유는 클립만 봐도 알 수 있습니다. 소리가 그림과 함께 생성되기 때문에 액션에 정확히 맞아떨어지고, 15초짜리 멀티샷 테이크 안에서도 캐릭터 디자인이 흔들리지 않으며, 2K 출력은 전체 화면으로 봐도 무너지지 않습니다.

데모 영상 아래에는 진짜로 다른 설계가 있습니다. 이미지, 비디오 클립, 오디오를 하나의 대화처럼 다루는 옴니모달 모델이라는 점, 그리고 오픈 웨이트로 공개돼 이번 시즌 가장 많이 연구된 비디오 모델이 됐다는 점입니다. 그리고 8월 말부터는 두 가지 버전이 존재합니다 — 오리지널 H3와, 반복 작업의 감각 자체를 바꿔놓은 근실시간 티어 H3 Max입니다.

이 글은 쉬운 말로 정리한 소개입니다. H3가 무엇인지, 각 티어가 무엇을 하는지, 무엇을 만들 수 있는지, 그리고 크레딧을 낭비하지 않고 쓰는 법까지 다룹니다.

H3의 설계 원리: '모든 것이 레퍼런스'란 무슨 뜻인가

H3는 하나의 아이디어를 중심으로 만들어진 비디오 생성 모델입니다: 모든 것이 레퍼런스가 될 수 있다는 것이죠. 대부분의 모델이 프롬프트와 이미지 한 장 정도만 받는 것과 달리, H3는 하나의 작업 세트를 통째로 받습니다 —

  • 피사체, 의상, 스타일을 위한 레퍼런스 이미지 최대 9장
  • 동작과 리듬을 위한 레퍼런스 비디오 클립 최대 3개
  • 사운드와 리듬을 조절하는 오디오 클립 최대 3개(각각 영상 하나에 연결됨)

— 그리고 무드보드로 애니메이터에게 브리핑하듯, 프롬프트 안에서 순서대로 이 레퍼런스들을 지정합니다. 모델은 참조한 동작을 따라가고 고정한 피사체를 유지하면서 4초에서 15초 길이의 클립을 만들고, 그림과 함께 생성된 네이티브 32kHz 스테레오 오디오를 함께 돌려줍니다. 앰비언스, 폴리 사운드, 립싱크된 대사까지 한 번의 패스에서 이미 싱크가 맞은 채로 나옵니다 — 별도로 더빙 일정을 잡거나 비용을 낼 필요가 없습니다.

해상도는 두 단계로 나뉩니다. 베이스 모델은 768p로 렌더링하고, 호스팅된 재생성 단계가 최종 결과물을 **2K(2560×1440)**까지 끌어올립니다. 이 구분이 중요한 실질적인 이유가 있습니다. MiniMax가 베이스 웨이트를 오픈소스로 공개해서 연구자와 툴 개발자들이 H3 위에 무언가를 만들 수 있지만, 2K 마무리 단계는 계속 호스팅 상태로 남아 있습니다. 직접 호스팅하는 것도 실제로 가능하지만, 768p가 한계입니다.

핵심 생성 기능 주변에는 정밀한 비디오 편집오디오-비디오 컨티뉴에이션(기존 클립을 그림과 소리를 함께 이어서 확장하는 기능)도 포함돼 있습니다. 덕분에 단순 반복 루프가 아니라 시퀀스 작업에도 쓸 수 있습니다.

H3 Max: 원본 모델을 뛰어넘은 속도 티어

8월 27일, 두 번째 티어가 등장했습니다. H3 Max는 fal이 MiniMax와 협업해 H3의 오픈 웨이트 위에 추가 학습을 진행한 버전으로, 프롬프트 반영도와 미감, 순수 처리 속도에 맞춰 튜닝됐습니다.

가장 눈에 띄는 건 작업 리듬 자체를 바꿔놓는 속도입니다. 공식 수치로는 5초짜리 클립이 3초 안에 나오고, 실사용에서는 10초짜리 클립이 재생 시간과 비슷한 시간 안에 돌아옵니다. 가격은 480p 기준 초당 약 $0.05, 768p 기준 약 $0.08 선이고, 출시 며칠 만에 이 티어도 베이스 모델과 동일한 혼합 레퍼런스 생성(이미지, 클립, 오디오)을 지원하게 됐으며, 종량제 요금에서 레퍼런스 이미지 몇 장은 무료로 제공됩니다.

놀라운 점은, 빠른 티어라고 해서 거친 티어는 아니라는 것입니다. 공개된 image-to-video 리더보드에서 H3 Max는 현재 1위를 차지하고 있습니다 — 학습의 기반이 된 베이스 H3보다도 위입니다. 진짜 한계는 딱 하나, 해상도입니다. 2K 단계는 오픈 웨이트로 물려받을 수 없는 부분이라 Max는 구조적으로 768p가 상한선입니다.

이 패밀리를 한눈에 정리하면 이렇습니다:

MiniMax H3H3 Max
가장 잘하는 것완성 shot반복 속도
해상도호스팅 최대 2K480p / 768p
레퍼런스이미지 9장 / 클립 3개 / 오디오 3개동일(출시 며칠 뒤 추가됨)
네이티브 오디오지원지원
작업 리듬큐에 넣고 검토이미지 재생성에 가까움

두 티어에 초안과 최종본을 나눠 작업하는 워크플로 로직을 더 깊이 알고 싶다면 H3 Max 워크플로 가이드를 참고하세요.

크리에이터들이 실제로 만들고 있는 것

데모 릴들은 H3의 설계가 강점을 보이는 작업 위주로 모입니다:

애니메이션 PV와 음악 중심 오프닝. 그림과 함께 생성되는 네이티브 오디오 덕분에 편집자의 손을 거치지 않고도 비트에 맞는 컷을 만들 수 있습니다 — 트랙의 에너지를 설명하고 오디오 클립을 레퍼런스로 걸면, 강조점이 동작에 정확히 맞아떨어집니다. 애니메이션 크리에이터들 사이에서 H3가 처음 화제가 된 것도 바로 이 용도였습니다.

멀티샷 캐릭터 작품. 15초짜리 생성 한 번으로 장소를 오가며 컷을 바꿔도 한 캐릭터의 얼굴, 의상, 비율이 그대로 유지됩니다 — 애니메이션 스토리텔링에서 가장 어려운 문제가, 레퍼런스만 좋다면 요청 한 번으로 해결되는 셈입니다.

대사 클립. 룸톤과 앰비언스까지 포함한 립싱크 대사를 한 번의 패스로, 여러 언어로 만들 수 있습니다. 예전에는 툴 세 개가 필요했던 짧은 캐릭터 장면이 이제 프롬프트 하나로 끝납니다.

스타일이 고정된 시퀀스. 팔레트, 선화, 시대적 질감 같은 비주얼 언어를 지정해주면 클립 안의 모든 컷에서 그 룩을 그대로 유지합니다. H3 쇼케이스에 스타일화된 작업과 레트로 작업이 유독 많이 등장하는 이유이기도 합니다.

크레딧을 낭비하지 않고 H3 쓰는 법

H3는 ArcLoop 안에서 생성 모델로 제공됩니다 — 모드와 설정은 모델 페이지에서 확인할 수 있습니다 — 그리고 데모 릴 같은 결과와 답답한 결과의 차이는 거의 언제나 프롬프트 문구가 아니라 레퍼런스를 다루는 방식에서 갈립니다.

세 가지 습관이 결과의 대부분을 좌우합니다:

안정적인 레퍼런스를 넣으세요. 이미지 슬롯 9개는 일관성을 위한 기회이자, 그 9장이 서로 다른 캐릭터를 말하고 있다면 함정이 되기도 합니다. 캐릭터를 자산으로 만들고 기준이 되는 레퍼런스를 여기에 묶어둔 다음, 모든 생성에서 이 하나의 소스만 가져다 쓰세요. shot 설명에서 @로 자산을 참조하는 편이 매번 캐릭터를 다시 설명하는 것보다 훨씬 안정적입니다 — 열 번째 H3 클립도 첫 번째 클립과 같은 정체성을 쓰게 된다는 뜻이죠.

클립 하나에 명확한 액션 하나. H3의 15초는 시작, 비트, 끝이 있는 shot 브리핑에 좋은 결과로 보답합니다 — 같은 프레임 안에서 아이디어 다섯 개가 경쟁하는 구성이 아니라요. 카메라 움직임, 액션, 원하는 사운드를 순서대로 적으세요.

프롬프트 창이 아니라 storyboard에서 생성하세요. ArcLoop에서는 Episode를 열고 Generate Shots를 눌러 shot card 단위로 쪼갠 다음, 자산을 붙이고 카드별로 생성을 실행하면 됩니다 — 또는 AI Chat Panel에서 "Shot 1, 2, 3의 영상을 생성해줘" 같은 평범한 지시로 한 번에 처리할 수도 있습니다. 생성된 H3 클립은 모두 해당 shot에 붙어서 저장되므로, 테이크를 비교하고 편집을 다시 구성하는 작업이 다운로드 폴더에 흩어지지 않고 정리된 채로 유지됩니다.

저렴하게 반복하고, 마무리는 한 번에. 타이밍과 블로킹은 Max 티어나 낮은 설정에서 탐색하고, 2K 패스는 이미 컷에 자리를 확정한 shot에만 쓰세요 — 티어가 나뉘어 있는 모든 모델 패밀리에 똑같이 적용되는 비용 관리 로직입니다. H3와 같은 급의 다른 마무리용 엔진을 놓고 고민 중이라면, H3 vs Seedance 2.0 비교에서 그 판단을 제대로 짚어줍니다.

자주 묻는 질문

MiniMax H3와 Hailuo 3.0은 같은 건가요?

네 — H3는 이전에 Hailuo로 불리던 모델 라인의 국제 명칭입니다. 일부 리더보드에서는 Max 티어를 MiniMax H3 Turbo라는 내부 명칭으로 표기하기도 합니다.

MiniMax H3는 무료로 쓸 수 있나요?

베이스 모델의 웨이트는 오픈돼 있고, 호스팅 이용은 사용한 만큼 과금되는 방식입니다. Max 티어는 현재 호스팅 툴 페이지에서 하루에 소량의 무료 생성을 제공합니다. ArcLoop 안에서 프로젝트 작업을 할 때는 H3가 ArcLoop 크레딧으로 작동하며, 설정은 생성 모드에 따라 달라집니다.

H3와 H3 Max의 차이는 무엇인가요?

Max는 추가 학습을 거친 속도 티어입니다. 최대 768p로 근실시간 생성이 가능하고, 현재 image-to-video 리더보드 1위이며, 레퍼런스 모드와 네이티브 오디오는 동일합니다. 베이스 H3는 호스팅되는 2K 출력 단계를 그대로 유지합니다. 대부분의 워크플로가 정착하는 방식은 Max로 초안을 만들고 H3로 마무리하는 것입니다.

H3가 정말로 비디오와 함께 오디오를 생성하나요?

네 — 오디오는 나중에 덧붙이는 게 아니라 그림과 함께 예측되기 때문에, 효과음이 타격 순간에 정확히 맞고 대사도 별도의 편집 없이 싱크가 맞습니다. shot과 같은 프롬프트 안에서 사운드스케이프를 함께 설명할 수 있습니다.

H3 영상은 최대 몇 초까지 만들 수 있나요?

한 번 생성에 4초에서 15초이며, 오디오-비디오 컨티뉴에이션으로 기존 클립을 이어서 늘릴 수 있습니다. 더 긴 작품은 shot 단위로 쌓아 올려야 합니다 — 지속되는 캐릭터 자산과 함께 storyboard로 작업하는 방식이 클립을 하나씩 프롬프트로 만드는 것보다 나은 지점이 바로 여기입니다.

모델은 새로워도, 원칙은 그대로입니다

H3는 지금의 주목을 받을 자격이 있습니다. 혼합 레퍼런스, 네이티브 오디오, 오픈 웨이트, 그리고 이제는 생각하는 속도로 따라올 만큼 빠른 Max 티어까지. 하지만 이 목록의 모든 기능은 입력이 얼마나 안정적인가에 비례해서 값을 합니다 — 그리고 그 부분은 모델이 아니라 워크플로의 몫입니다. 캐릭터는 자산으로 만들고, shot은 감독처럼 브리핑하고, 저렴한 티어에서 반복하고, 관객이 실제로 볼 곳에만 2K를 쓰세요. 프로젝트를 열고 첫 캐릭터를 고정한 다음, H3가 알아볼 가치가 있는 무언가를 건네주세요.

H3가 알아볼 수 있는 캐릭터를 지정하세요

H3는 ArcLoop 안에서 작동합니다. 캐릭터를 자산으로 만들고, shot 설명에서 참조한 다음, 안정된 정체성을 바탕으로 모델의 레퍼런스 모드가 작동하게 하세요.

지금 만들기

더 알아보기

생성된 영상을 후반 작업하는 방법

생성된 영상을 후반 작업하는 방법

스타일이 캐릭터를 잡아먹을 때 대처법

스타일이 캐릭터를 잡아먹을 때 대처법

한 컷에 동작 세 개를 넣으면 왜 항상 무너질까

한 컷에 동작 세 개를 넣으면 왜 항상 무너질까

AI 만화 드라마 도구 능력 체크리스트: 어디에서 막혔는지 먼저 보기

AI 만화 드라마 도구 능력 체크리스트: 어디에서 막혔는지 먼저 보기