結論から
「どちらが良いか」という問いの中には、二つの問いが隠れています。動画制作が訊いているのは、どちらがより広い余地をくれるか——解像度、リファレンス上限、制御力。ショートドラマ制作が訊いているのは、もっと狭く、ずっと難しいこと:十二カットのあいだ同じ顔を保てるのはどちらか。この二つは答えが違うので、本記事では分けて扱います。
二枚のスペック表はほぼ同一です。だから選択を決めるのは、どちらのデータシートが長いかではなく、あなたの働き方です。
- エピソードを出し続けている個人・小規模スタジオ → すでにワークフローに組み込まれている方。モデル周辺の統合のほうが、この二つの差より価値があります。
- エンジニアがいて、秒単価が会議の議題になる規模の制作ライン → MiniMax H3、オープンウェイトのため。ただし先に確認すべき点がひとつ:自前ホスティングは 768p が上限で、品質を左右する工程は依然として MiniMax の API を呼びます。
- 素早い探索・提案・アイデア検証 → Seedance 2.0。自動尺モードが、生成のたびに判断をひとつ減らします。
- 一度の生成でマルチショットの叙述を組みたい → Seedance 2.0。1.0 の頃からマルチショットをネイティブ機能として扱ってきた系譜です。
- 4K 納品が要件 → モデルではなくプラットフォームを確認してください。解像度の上限は、どこで回すかで決まります。
AI ショートドラマに限れば、どちらのデータシートも決め手になりません。決めるのはカット間の一貫性で、それは自分のキャラクターの上でしか測れません。そのためのテスト七本を末尾に置いています。
以下の比較は丁寧に読む価値があります。比較というものが普通たどる決着の付き方を、これはしないからです。競合する二社、独立した二つのロードマップ——それでいてスペック表はほぼ行単位で一致する。この一致こそがこのページで最も情報量の多い事実であり、同時にデータシートを決着の道具として使えなくしているものです。
スペック並列:MiniMax H3 vs Seedance 2.0
二枚のスペック表を並べれば勝負が見えるはずが、返ってくるのは鏡です。
| MiniMax H3(Hailuo 3.0) | Seedance 2.0 | |
|---|---|---|
| 尺 | 4〜15 秒 | 4〜15 秒、または -1 でモデルに委ねる |
| リファレンス画像 | 最大 9 枚 | 最大 9 枚 |
| リファレンス動画 | 最大 3 本、1本 2〜15 秒、合計 15 秒 | 最大 3 本 |
| リファレンス音声 | 最大 3 本、映像に伴うことが必須 | 最大 3 本、映像に伴うことが必須 |
| ファイル総数 | 12 | 9 + 3 + 3 |
| 画角 | 21:9、16:9、4:3、1:1、3:4、9:16、自動 | 同じ六種類、加えてアダプティブ |
| ネイティブ音声 | あり、32 kHz ステレオ | あり、画と同時生成、オフにも可 |
| 編集 | 精密な動画編集 | 動画から動画へ:物体の置換、背景変更、スタイル変更 |
| 延長 | 音声付き映像の継続 | 既存動画の延長 |
| 解像度 | 2K(2560×1440)は API 経由。自前ホスティングでは 768p | プラットフォーム依存——一部 API では 480p/720p、ArcLoop では 4K まで |
| ウェイト | オープン —— H3-Base と VAE。Context-IR と 2K 再生成はホスト側のまま | クローズド |
画像九枚。動画三本。単独では出せない音声三本。四〜十五秒。同じ六種類の画角。音は後付けではなく画と一緒に生成。
これは家族的類似ではなく、示し合わせていない二社が同じ答えに二度たどり着いたということです。競合がここまで正確に収束したとき、これらの数字は差別化要因ではなく参加条件になります。
そして比較の矛盾はここから始まります。三重に。
表は同一だと言い、系譜はそう言っていない。 同じリファレンス上限、同じ尺——しかし一方は 1.0 からマルチショット叙述をネイティブに扱い、もう一方は単一カットを軸に構成されています。入力は同一、作業単位は別物です。
「オープン」なほうは完全にオープンではない。 H3 はウェイトを公開しており、表の中で最大の優位に見えます——モデルカードが、著者自身が「最終出力の品質に決定的」と呼ぶモジュールは公開していないと告げ、自前ホスティングは 768p が上限だと告げるまでは。決定的に見える行が、いちばん但し書きの多い行でした。
ダウンロードできるほうが、できないほうより低い解像度で回る。 H3 のウェイトは持ち帰って自前ホスティングできます——768p で。Seedance 2.0 のウェイトは持ち帰れませんが、ArcLoop 上では 4K まで出ます。持ち帰れるモデルのほうが絵が少なく、借りるしかないモデルのほうが上限が高い。
この三つはいずれも、表を下に読み進めても解決しません。以下の四つの能力こそ、それらが実際に姿を現す場所です。
指示追従と動きの質
どちらも長く構造化されたプロンプトを受け取ります。H3 は 7000 文字まで、Seedance 2.0 は ArcLoop 上では 1,500 語以内が推奨。どちらの枠でも、ビートのタイミング、カメラの挙動、衣装の細部、ネガティブ制約、音までを一度に書き切れます。つまり、曖昧に書く言い訳はどちらにもありません。一行プロンプトを書いているなら、ボトルネックはモデルではなく、カメラ言語を明示していないことです。
動きの質は、公開スペックがいちばん役に立たない領域です。どちらも指標を公表しておらず、同じキャストでこの二つを並べて回した第三者もいません。そして「自然に見える」は数値ではありません。複雑な動き、手、布、肌は最後に、そしてもっとも目立つ形で壊れる部分です——だからこそ、読む行ではなく自分で回すテストに属します。
スペック表が教えてくれるのは、動きを記述するための枠のほうです。7000 文字または 1,500 語あれば、ビートのタイミング、カメラの挙動、ネガティブ制約を同じプロンプトに収められます。具体性を出した分だけ、モデルはおおむね返してきます。
リファレンスがどこまで「守られる」かにも実際の差があります。ArcLoop の Seedance 2.0 の説明には、リファレンス動画はコマ単位で再現されるのではなく解釈される場合があると書かれています。H3 の資料は、動画リファレンスをそのまま引き渡せるカメラ運動として記述しています。「雰囲気をくれ」と「このレールに乗れ」は別の仕事です。どちらが要るかは、探索中なのか、承認済みの絵コンテを執行しているのかで決まります。
リファレンスとキャラクター制御
上限が同じである以上、腕の差は役割の割り当て方だけに出ます。
どちらも報いるのは同じ規律です。動作をひとつも書く前に、各素材が何を担当するかを明言すること。画像二〜三枚でキャラクターの同一性、画像一枚で世界のパレットと質感、動画一本で動きか編集リズム、音声一本で音色。そのうえで「画像2 はキャラクター同一性のリファレンス、動画1 はカメラ運動のリファレンス、画像2 の衣装は変更しない」と書きます。
記法は少し違います。ArcLoop 上の Seedance 2.0 は @ でアップロード済み素材を指し、H3 は位置で参照します。表面的な違いで、要求は同一です。曖昧な複数リファレンスのプロンプトは平均化された結果しか返しません。九枚のうちどれが顔の決定権を持つかを、モデルが推測しなければならないからです。
シリーズ制作で致命的なのは同一性のドリフトで、それは一枚のキービジュアルには現れません。振り返りに、ライティングの変化に、第二話に現れます。キャラクターの一貫性を素材のレイヤーで一度解いておく理由も、2Dアニメーションと3Dアニメーションのテンプレートが固定のアンカーを前提に組まれている理由も同じです。
実務に落とすと、これがキャストをエンジンより上に置く理由になります。ArcLoop ではストーリーとキャラクターでキャラクターを一度作り、そのシートを一話のすべてのカットで再利用します。アンカーは保存された資産であって、毎回打ち直して少しずつ崩れていく文章ではありません。どのモデルに向けても、同一性リファレンスは同じファイルです。
マルチショット叙述
二つの系譜が本当に分岐する場所であり、この表の中で最も明確な優位です。
Seedance は 1.0 の時点からマルチショット叙述をネイティブ機能として扱ってきました——一度の生成で複数の連続したカットを作り、切り替えを越えて主体とスタイルを保つ。2.0 はそれを継承し、2.5 は長尺へ押し進めました。単発 30 秒の中に論理的につながった複数カット、さらに多段の延長。
H3 の公開資料は単一カットを軸に構成されています。4 から 15 秒、そして継続機能でシーンを先へ運ぶ形です。
シリーズにとって、この差は作業単位を変えます。単一カットのモデルは順序の問題を丸ごとあなたに残す——絵コンテが荷重を受け持ち、編集はあなたの仕事です。マルチショットのモデルはその一部を引き受けます。代わりに、切れ目がどこに落ちるかの制御を少し手放します。
抽象的にどちらが優れているという話ではありません。カット表まで固まった承認済み絵コンテがあるなら、単一カットの強い制御のほうが指揮しやすい。量を出したい、一本のプロンプトで筋の通った 30 秒を得たいなら、マルチショットが前に出ます。
ただしどちらでも、順序を決めるのはモデルではなくあなたです。それが絵コンテツールと絵コンテからカットを生成する工程の役目です。ArcLoop では絵コンテが一話をつなぎ止める文書になります。何がどの順で起きるかを固定し、各カードがそのまま生成可能なカットになる。マルチショットのエンジンは一度に埋まるカードが増えるだけで、「どのカードが必要だったか」は決めてくれません。
音声と編集
どちらも音を後付けではなくネイティブに生成します。どちらも音声リファレンスに映像を伴わせることを要求します——声はキャラクターの属性であって独立素材ではない、というフォーマット側からの言明です。Seedance 2.0 には H3 の資料にない選択肢がひとつあります。音声をオフにして無音出力にできます。
出力に必ず音が付く以上、「静けさ」は明示的に選ぶものになります。環境音、その空間を成立させる具体音を二〜三個、そしてビートの落ち所を書く。音を書かないカットにも音は付きます。ただしあなたが選んだ音ではありません。キャラクターボイスに関しては、キャラクターごとのボイスカードのほうが毎回描写し直すより安定します。吹き替えが主眼なら、Seed Audio と ElevenLabs の比較がどちらの動画モデルのドキュメントより深く扱っています。
編集では、どちらもリロールではなく既存クリップの変更を許します。Seedance 2.0 は動画から動画へ:物体の置換、背景変更、スタイル変更。H3 は精密な動画編集と記述します。機能はどちらにもあり、実際に差がつくのは巻き込み被害です。ジャケットを替えるとき、顔がそのままでいてくれるか。
これは聞こえより重要です。カットが九割方できているとき、リロールはその九割を賭けて一割を直す行為で、うまくいっていたテイクを失うことも多い。編集はそれを守ります。一話百カットに広げれば、これはクレジットの話ではなくスケジュールの話です。
ワークスペースはまさにこの習慣のために作られています。キャンバスでの作業は、通ったテイクとリファレンスと修正版を並べて置くので、「一箇所だけ変える」が賭け直しではなく比較になります。生成したカットもキャラクターシートも音声も同じライブラリに入る——素材の管理こそが、二話目が一話目より安くなる理由です。
AI ショートドラマにはどちらが良いか
ショートドラマは解像度では失敗しません。一貫性で失敗します。視聴者は 720p だから離れるのではなく、7 カット目でイヤリングをしていた人物が 8 カット目でしていないから離れます。
なので、このフォーマットが実際に要求する五項目で判断してください。
1. キャラクターと衣装はカットをまたいで保たれるか。 最も厳しいテストはキービジュアルのアップではなく、感情の段階が上がっていく十二カットの口論の中で同じ二つの顔を保つことです。どちらのモデルも、毎回のプロンプトで繰り返す同一性アンカーに依存します。どちらがより持つかはデータシートではなく、テスト 1 が答えます。
2. 多人数の絡みと複雑な動きは自然か。 これはどちらか一方の弱点ではなく、この分野全体の既知の難所として扱ってください——群衆の配置、重なる手足、手の接触は、生成映像がいまだに最初に壊れる場所です。六人の食卓シーンを計画する前に三人芝居で試し、物語を担うカットではキャストを小さく保つこと。
3. 連続した出来事とカット順を理解できるか。 ここは Seedance のマルチショット系譜が優位です。あなたのシーンが因果でつながったビートの連なりなら、連続したマルチショット出力のために設計されたモデルは、単一 15 秒を軸に設計されたモデルに対して構造的な先行を持ちます。
4. 画像・動画・音声のリファレンスは扱いやすいか。 上限は同じなので、差は「役割の割り当てを守るか、素材を平均するか」と「リファレンス動画は追従されるのか、解釈されるだけなのか」に落ちます。ここもテスト 1、加えて前述の解釈に関する注記。
5. 失敗カットはリロールせずに直せるか。 一話が予定どおり出るかを左右する最大の変数です。どちらにも編集はあります。測るのは、指示していない箇所をどれだけ乱すかです。
この上に載るワークフローが必要なら、AIショートドラマ制作ハブと脚本から完成尺までがエンジンより長生きする部分を扱い、シネマティック動画テンプレートにトーンの合うものがあります。
結局どちらを選ぶか
| あなたが… | 寄せるべき方 |
|---|---|
| エピソードを出し続ける個人・小規模スタジオ | すでにワークフローにある方——統合が二者の差に勝る |
| エンジニアがいて秒単価が大きい制作ライン | H3 —— ただしライセンスと 768p という自前ホスティングの上限を先に読むこと |
| 探索・提案・素早い検証 | Seedance 2.0——自動尺で毎回の判断がひとつ減る |
| 一度の生成でマルチショット叙述を組む | Seedance 2.0——1.0 からのネイティブ・マルチショット |
| 承認済み絵コンテをカット単位で執行 | どちらでも可。単一カットの強い制御のほうが指揮しやすい |
| 4K 納品が要件 | モデルではなくプラットフォームを確認 |
| 固定キャストの縦型ショートドラマ | データシートでは決まりません。テストを回してください。 |
オープンウェイトについて
表の中で最も大きい行であり、最も過大に語られる行でもあり、モデルカードを自分で開く価値がある行でもあります。
MiniMax が公開したもの:H3-Base(33B omni-transformer)、エンコーダ、ビジュアルとオーディオの VAE、そして二つのタスク別チェックポイント。ライセンスは MiniMax H3 Community License——非商用は無償、一定の売上規模を下回る企業の商用も無償、表示義務あり。
公開しなかったもののほうが重要です。H3-Context-IR はホストされたサービスのままで、MiniMax 自身のモデルカードがそれを「最終出力の品質にとって決定的」と書いています。H3-Regenerate-2K も同様に未公開です。 自前ホスティングで生成できるのは 768p。上の表にある 2K は API の数字であって、ローカルの数字ではありません。
つまり「自分で回せる」の正直な言い換えはこうなります:コアモデルは自分で回せる、解像度は低い、そして仕上がりの良し悪しを決める工程では依然として MiniMax を呼ぶ。これは本物の選択肢です——ただし独立ではありません。
誰が気にすべきかも変わります。自分のキャラクターライブラリで微調整したく、フォーマット的に 768p で足りるなら、このウェイトは本当に有用です。ベンダーから抜け出すためにオープンウェイトへ手を伸ばしたのなら、先にモデルカードを読んでください。品質の要となる経路は、依然として他人のサーバーを通ります。そしてどちらにせよ本物の請求書でもあります——GPU、それを回し続けるエンジニア、そして自分抜きで良くなり続けるホスト版に置いていかれないための継続的な仕事。
自分で測る:七本、半日
ベンチマーク表はこの分野でもっとも当てにならない代物です。厳選した一本のプロンプト、十回の試行、最良の結果をグラフに。
さらに根深い問題が転移性です。どの評価も、測っているのは他人のキャラクター、他人のワールド、他人の絵コンテです。大きな運動と豪快な運びの時代劇で圧巻のモデルが、あなたの乙女ゲーム調の切り返しでは崩れることがあります。他人の素材の上で出た結論は、あなたの題材へ移した途端に成立しなくなります。
ですから、もう一枚の表を渡すより、判断の方法をお渡しします。テストカット七本。それぞれに数えられるディテールが仕込んであり、合否は好みの問題になりません。
- リファレンスの役割 —— 質感リファレンスに通行人を仕込む。出力に現れたら、役割ではなく素材の平均を取ったということ。加えて振り返りで、同一性アンカーが越えられるかを見る。
- ビートのタイミング —— タイムコード五区間、最後に看板がきっちり二回明滅すること。数える。
- サウンドデザイン —— 冒頭三秒は雨音のみと指定。それでも音楽が乗るかを見る。リスト中いちばん多い失敗。
- 複合編集 —— 一度の依頼で無関係な四箇所を変更し、触れと言っていない顔だけを見る。
- 音色の転写 —— 感情の転換はダッシュで起きること。平坦な読みは、言葉は聞いたが演出は聞いていないという意味。
- 画面内の文字 —— 寄りの最中もタイトルを保持し、コマ送りで確認。多くの動画モデルが正体を現す場所。
- 延長の接続 —— 既存クリップを延長し、継ぎ目をコマ送りする。アンカーは越えたか。雨音は続いているか、鳴り直しているか。
七本を自分のキャラクター一体で回し、どれが通ったかを書き留めてください。そのリストがあなたの基準線であり、インターネット上のどの比較表よりも——冒頭の表を含めて——価値があります。実際に世に出すものの上で測られているからです。
どれも自分のキャストに合わせて書き換えてください。数えられるディテールこそが設計の核心です。書き換えるときも必ず残すこと。残さなければ、また好みで判断する状態に戻ります。同じ規律はAIっぽさを避ける方法と脚本から完成尺までのカット設計にも通っています。
この話の中で ArcLoop が置かれている場所
ArcLoop はモデルではありません。モデルの上に載る制作レイヤーであり、単発のクリップではなくキャラクター主導の連続シリーズを作る人のために組まれています。
ループは四段階。下のエンジンが何であっても同じです。
- ワールドを作る —— パレット、ルール、質感。バラバラのカットが、無関係な七つの実験ではなくひとつのシリーズとして読まれるように。
- ストーリーとキャラクター —— キャストを再利用可能なシートとして保存。本記事のすべてのプロンプトが依存する同一性アンカーがこれです。
- エピソードを組む と 絵コンテツール —— 脚本を、実際に生成にかけられるカット表へ。
- カットを生成する、そしてキャンバスでレビュー —— テイクごと引き直すのではなく、弱いレイヤーだけを直す。
その周辺に、AIショートドラマ制作ハブ(縦型ショートドラマのワークフロー)、キャラクターボイスカード(6 話目のキャラクターが 1 話目と同じ声に聞こえるように)、そして白紙から始めたくないときのプロンプトテンプレート——2Dアニメーション、3Dアニメーション、シネマティック動画。初めてなら最初のエピソードを作るがループを一周させてくれます。
現在ここで動いているエンジンは Seedance 2.0——単発最長 15 秒、最高 4K、画像・動画・音声のリファレンス対応、@ メンションで各ファイルに役割を割り当て。変わるかどうか、いくらかかるかはモデル一覧に。あのページはどんな比較記事よりも信頼できます。この記事も含めて。
よくある質問
MiniMax H3 は Seedance 2.0 より優れていますか。 スペック表の上では違います。リファレンス上限、尺、画角、ネイティブ音声はほぼ行単位で一致します。残る差は部分的なオープンウェイト(H3——コアモデルのみ、自前ホスティングでは 768p)、自動尺とネイティブ・マルチショット叙述(Seedance 2.0)、そしてモデルではなくホスティング環境が決める解像度上限です。
AI ショートドラマにはどちらが良いですか。 ショートドラマはカット間の一貫性で決まり、これらの表のどの行でも決まりません。連続したビートの処理では Seedance のマルチショット系譜が助けになります。それ以外は、一話分の計画を委ねる前に、固定キャストで両方を試してください——振り返り時の顔の安定、編集の精度、声の一貫性。
オープンウェイトは小規模の制作者に重要ですか。 めったに重要ではありません。エンジニア、GPU 予算、自前ホスティングを正当化できる規模の秒単価が揃ったときに重要になります。それ以外の人にとっては、ウェイトのライセンスよりモデル周辺のワークフローのほうが重要です。
どちらかは 15 秒を超えて生成できますか。 どちらも既存クリップの延長であり、単発でより長く生成するわけではありません。作業単位はカットのままで、絵コンテはどちらにせよ荷重を受け持ち続けます。
本当にどちらも音を出しますか。 はい。音は別工程の吹き替えではなく画と同時に生成され、どちらも音声リファレンスに映像を伴わせることを要求します。Seedance 2.0 は加えて音声をオフにできます。
H3 はオープンウェイトなら、全部を自分で回せますか。 全部ではありません。MiniMax が公開したのは H3-Base、エンコーダ、VAE で、H3-Context-IR(自社のモデルカードが出力品質にとって決定的と記述)と 2K 再生成モジュールはホストされたサービスのままです。自前ホスティングでの生成は 768p で、仕上がりに最も効く工程では依然として API を呼びます。
多キャラクターの同フレームはどちらが得意ですか。 双方に共通する既知の難所として扱ってください。バイトダンスは極めて多数の主体が絡むシーンの安定性を改善中と公言しており、MiniMax は同種の自己評価を出していません。仮定せず、測ってください。
二つのモデルより長生きするもの
どちらのエンジンがテストに勝っても、いずれ置き換わります。おそらく同じ四半期のうちに。この比較を書いている最中に Seedance 2.5 が出ました。
置き換わらないのは、その上にあなたが積んだ層です。ワールドのルール、キャラクターシート、カットカード、七本のテスト基準線。これらは資産で、しかも複利で効きます——6 話目が 1 話目より安いのは、書き直しているのではなく再利用しているからです。モデルの乗り換えにかかるのはテストの半日であって、作り直しではないはずです。
ですから実際の順序は昔から同じです。ワールドを作り、キャストを固め、エピソードの絵コンテを引く。そのうえでエンジン同士は下で戦わせておけばいい。ワールドとキャストから始める。





