Claude Opus 5.5でAI MV作成!プロ級MVを自動生成する手順やツール、実践結果を解説

- AIを使ったMVの作り方は、Opus 5.5を監督役に作曲・映像・文字PVのツールを束ねる形
- 2分55秒・18カットのMVが、MiniMaxの実費13.23ドルと約3時間で完成
- キャラのブレや指示の読み違いは残るため、採用カットの判断は人が担う
2026年9月22日に公開されたClaude Opus 5.5を監督役に据えると、Sunoの曲を使ったMV制作の大半を生成AIに任せられます。筆者は2分55秒の曲に18カットの映像と文字PVを付け、MiniMaxの実費13.23ドル・約3時間で仕上げました。

とはいえ「曲はあってもMVまでは手が回らない」方も多いはず。この記事では、MiniMaxとJIZURAを使った手順・費用・品質を、完成動画つきで解説します。ぜひ最後までご覧ください。
\生成AIを活用して業務プロセスを自動化/
Opus 5.5×AIツールでMV制作はどこまで自動化できる?

結論からいうと、MV制作のうち「考える作業」と「つなぐ作業」の大部分はOpus 5.5に任せられます。作詞・世界観の設計・絵コンテ・動画生成用のプロンプト・生成と合成のスクリプトまで、今回はすべてOpus 5.5が書きました。
一方で、映像や音楽を作るのはOpus 5.5ではなく各サービスです。曲はSuno、映像はMiniMaxの動画生成AI、歌詞の文字演出はJIZURAが担当しました。どのカットを採用するかの最終判断は人が行っています。
ここではまず、完成したMVと各ツールの役割を整理します。
今回作るMVの完成形
今回完成したのは、オリジナル曲「夜明けのログアウト」のアニメ調MV(2分55秒・1920×1080)です。深夜2時のオフィスで働く女性が、始発の時間に朝日を迎えるまでを18カットで描きました。
映像の上には、歌に合わせて歌詞が動く文字PVを重ねています。主人公を隠さないよう、歌詞は画面の左右に振り分けました。
曲・映像・歌詞の演出はいずれも生成AIとブラウザツールによるもので、人が手で描いたカットはありません。
使用するツールと役割分担
今回使ったサービスは4つ(MiniMaxは2モデル)で、Opus 5.5だけが映像や音を「生成しない」立場です。
| ツール | 担当 | 2026年9月時点の情報 |
|---|---|---|
| Suno | 作曲・歌唱 | 最新モデルはv6(2026年9月9日公開)。v6はPro・Premier限定 |
| Claude Opus 5.5 | 作詞・コンセプト設計・絵コンテ・プロンプト作成・スクリプトの作成と実行 | Claude Code上で動かす。入力はテキストと画像、出力はテキスト |
| MiniMax H3 | カットごとの映像生成 | 1カット4〜15秒、768Pと2Kに対応 |
| MiniMax image-01 | 参照画像の生成 | 1枚0.0035ドル |
| JIZURA | 歌詞の文字PV | ブラウザで動く無料ツール。最新版はv0.10.0(2026年9月29日) |
Sunoのv6については公式の発表、H3の仕様はMiniMaxのAPIリファレンス、JIZURAは公式のREADMEで確認しました。
MiniMaxはWebアプリ(Hailuo AI)ではなくAPIを使いました。Opus 5.5がスクリプトを書き、Claude Code上でそのまま実行するので、カットが18本あっても人がボタンを押し続ける必要はありません。
Opus 5.5に任せる範囲と人が判断する範囲
最初に押さえておきたいのは、Opus 5.5は画像も音声も生成できず、音声を聴くこともできないという点です。公式の仕様では入力がテキストと画像、出力はテキストのみで、ドキュメントでも画像生成は明確に否定されています。
そのため今回は、Opus 5.5を「監督」と位置づけました。曲を聴けない点は、Claude Code上で文字起こしツールのWhisperを動かして補っています。Opus 5.5は、その文字起こしの結果を読んで歌詞の秒数を把握しました。
| 担当 | 作業 |
|---|---|
| Opus 5.5 | 作詞・世界観の設計・絵コンテ・プロンプト・スクリプト・静止画での品質チェック |
| 各生成AI | 作曲(Suno)・画像(image-01)・映像(H3) |
| 人 | テイクの選定・聞き取りの確認・参照画像の選定・作り直しの判断・JIZURAの操作 |
Opus 5.5の性能や料金を詳しく知りたい方は、下記の記事をあわせてご確認ください。

MV自動化ワークフローの全体像
今回のワークフローは、曲・参照画像・絵コンテ・映像・文字PVの5ステップで進みます。前のステップの成果物が次のステップの入力になるため、順番を入れ替えないのがポイントです。
作業時間は深夜と朝の2回に分けて、合計で約3時間でした。この時間には、生成を待つ時間や人が判断した時間も含まれています。
曲作りから文字PV合成までの5ステップ

流れはシンプルです。Sunoで曲を作り、Opus 5.5が歌詞から世界観を決め、主人公と背景の参照画像を作ります。
次に歌詞の秒数に合わせてカットを割り、H3で全カットの映像を一括生成します。最後にJIZURAで作った歌詞の素材を映像に重ね、曲を付けて完成です。合成にはffmpegという無料の動画処理ツールを使い、これもOpus 5.5が書いたスクリプトで実行しました。
歌詞とStyles(曲調の指定)はOpus 5.5が書き、Sunoのv6で曲を生成します。
歌詞から世界観を決め、主人公1枚と背景4枚の参照画像をimage-01で作ります。
Whisperで取った歌詞の秒数をもとに、カット割りと動画生成用のプロンプトを書き出します。
参照画像を渡しながら、H3で全カットの映像を一括生成します。
JIZURAで作った歌詞の素材を映像に重ね、ffmpegで曲と合成します。
必要なアカウント・APIキーと費用の目安
必要なのはSuno・Claude・MiniMaxの3つのアカウントで、APIキーが要るのはMiniMaxだけです。JIZURA・Whisper・ffmpegは無料で使えます。
| サービス | 必要なもの | 料金(2026年9月時点) |
|---|---|---|
| Suno | Proプラン以上(商用利用とv6に必要) | Proは月10ドル(約1,500円)、年払いなら月8ドル相当 |
| Claude | Claude Codeが使えるプラン | Proは月20ドル(約3,000円)、Maxは月100ドル・月200ドル |
| MiniMax | 従量課金のAPIキー | H3 768Pは1秒0.08ドル(約12円)、2Kは0.13ドル(約20円) |
料金はSunoの料金ページ・Claudeの料金ページ・MiniMaxの従量課金ページで確認しました。なおClaude CodeでOpus 5.5を使うには、v2.1.280以降が必要です。
MV1本を3分・20カットと仮定すると、H3の映像費は768Pで14.40ドル(約2,160円)、2Kで23.40ドル(約3,510円)です。H3は参照画像が5枚まで無料のため、1カットに2枚渡す程度なら画像代はかかりません。
ただし作り直した分は費用が上乗せされます。今回の実費は検証パートで紹介します。
【ステップ1】Sunoで楽曲を作る

MVの土台になる曲は、Sunoの最新モデルv6で作りました。歌詞とStyles(曲調の指定)はOpus 5.5に書かせ、人はSunoの画面に貼り付けて生成ボタンを押しただけです。
生成は筆者の体感で1分ほど。1回の生成で2テイクが出てくるので、聴き比べて使うほうを選びます。
MV向きの曲を作るコツ

コツは、歌詞の段階で「映像にしやすい言葉」を入れておくことです。Opus 5.5には「フロアの灯り」「青いモニター」「冷めたコーヒー」「付箋」といった名詞を歌詞に入れさせ、あとの絵コンテでそのままカットにできるようにしました。
1行を短くしておくのも効きます。文字PVのJIZURAは1行を1フレーズとして扱うため、短い行ならそのまま流し込めます。
実際にStylesへ入れた指定は以下のとおりです。
emotional J-pop rock, anime-style female vocal, clear and airy high tone, 150 BPM, piano arpeggio intro, driving drums, bright distorted guitars, cinematic build-up, anthemic chorus, bittersweet to hopeful, city night to sunrise
More OptionsのExclude styles(入れたくない要素)には「rap, screaming, spoken word」を指定しています。

出てきたのは3分04秒と2分55秒の2テイクで、今回は短いほうの2分55秒を使いました。当初の目標だった2分〜2分30秒よりは長くなっています。
生成後の歌詞テキストは必ず保存しておいてください。Sunoは入力にない繰り返しを足すことがあり、今回も1番のサビ末尾「この手で 朝を連れてくる」が2回に増えていました。あとで歌詞の秒数を取るときに、このずれを突き合わせます。
MVで使うときの商用利用の注意点
MVを公開・販売するなら、Sunoは有料プランでダウンロードした曲だけが商用利用の対象です。料金ページのFAQにも、ProかPremierなら曲を商用利用できると書かれています。
無料プランで作った曲は非商用に限られます。後から有料プランに加入しても、既定では過去の曲に商用の権利はさかのぼりません(Sunoヘルプ)。
さらに2026年9月3日からはダウンロード数に上限が設けられました。それ以前に作った曲にも適用されます。
| プラン | 月額(月払い) | ダウンロード上限 | 商用利用 |
|---|---|---|---|
| Free | 0ドル | 試用ダウンロードが生涯7曲 | ❌️ |
| Pro | 10ドル(約1,500円) | 月20曲 | ⭕️ |
| Premier | 30ドル(約4,500円) | 月60曲 | ⭕️ |
上限があるため、候補のテイクはブラウザ上で聴き比べ、MVに使う曲を決めてからダウンロードするのがおすすめです。
Sunoの基本的な使い方や機能を知りたい方は、以下の記事もあわせてご覧ください。

【ステップ2】Opus 5.5にMVのコンセプトと参照画像を決めてもらう
曲ができたら、Opus 5.5にMV全体の世界観と、全カットで使い回す参照画像の設計を任せます。ここで決めた主人公の見た目や色の変化が、あとのすべてのカットの基準です。
動画生成AIは1カットずつ別々に生成するため、何も決めずに進めると、カットごとに主人公の顔や服が変わってしまいます。この工程は、そのブレを防ぐための土台づくりです。
歌詞からコンセプトを作らせるプロンプト
コンセプトづくりでは、「何を決めてほしいか」と「動画生成AIの制約」をプロンプトに書き込むのがポイントです。実際に使ったプロンプトを載せておきます。
あなたはミュージックビデオの監督です。
以下の歌詞と曲情報から、MVのコンセプトを設計してください。
# 曲情報
- タイトル:夜明けのログアウト
- ジャンル:エモ系J-POPロック/女性ボーカル/BPM150前後/2分55秒
- 各パートの秒数:(Whisperで取得した歌詞と秒数の表を貼る)
# 歌詞
(歌詞全文を貼る)
# 出力してほしいもの
1. MV全体のテーマを1文で
2. 世界観(時代・場所・時間帯)
3. 主人公の外見(全カットで固定する要素を具体的に)
4. 舞台(登場する場所を3〜5か所)
5. 色の設計(パートごとに色がどう変化するか)
6. 画風
7. 動画生成AIで破綻させないための撮影ルール
# 制約
- 映像は動画生成AI(MiniMax H3)で1カット4〜15秒ずつ作る
- 口の動きは曲と同期できないため、歌っているシーンは作らない
- カット間で主人公の見た目がぶれないよう、参照画像を使う前提で設計する
Opus 5.5からは、次のようなコンセプトが返ってきました。

出力のうち、あとの工程で効いたのは次の3点です。
| 項目 | Opus 5.5の出力(要約) |
|---|---|
| 主人公 | 黒髪のショートボブ、白いブラウスに紺のカーディガン、青いストラップの社員証。眼鏡とアクセサリーは形が崩れやすいので付けない |
| 色の設計 | 深い紺とモニターのシアンから始まり、サビで街のマゼンタ、最後は藍色からオレンジ、金色の朝日へ |
| 撮影ルール | 歌うカットは作らない。顔の正面アップは2割以下。画面に文字を描かせない |
眼鏡を外す判断や「画面に文字を描かせない」というルールは、動画生成AIの弱点を踏まえています。こちらから細かく指示しなくても、制約を伝えただけでここまで設計してくれました。
コンセプト画像を生成して参照画像にする

コンセプトが決まったら、主人公1枚と舞台ごとの背景4枚を画像生成AIで作り、参照画像にします。今回はMiniMaxのimage-01を使い、プロンプトと生成スクリプトはOpus 5.5が書きました。
主人公2案・実写調1案・背景4か所×2案の計11枚を生成し、かかった時間は94秒、費用は0.0385ドル(約6円)でした。そこから主人公1枚と背景4枚をOpus 5.5と人で選んでいます。
生成した画像には、次のような失敗も混ざっていました。
| 指示 | 起きたこと | 対処 |
|---|---|---|
| 「シネマティック」な画風 | 11枚中4枚で、画面の上下に黒帯が入った | 採用した2枚はffmpegで帯を切り落とした |
| 「人物はいない」背景 | 窓の背景に人影が入った | 人影のない別案を採用した |
| 実写調の主人公 | 社員証のストラップに読めない文字が描かれた | アニメ調の案を採用した |

この5枚から、カットごとに主人公と舞台の画像を選んでH3に渡し、見た目と雰囲気をそろえるのが狙いです。
【ステップ3】Opus 5.5に絵コンテを作ってもらう
絵コンテでは、歌詞の区切りに合わせてカットを割り、そのまま動画生成に使えるプロンプトまでOpus 5.5に書かせます。ここで問題になるのが、Opus 5.5は曲を聴けないため、どの歌詞が何秒から始まるかを自分では知りようがない点です。
そこでClaude Code上で文字起こしツールのwhisper.cppを動かし、歌詞と秒数の対応表を作りました。モデルはlarge-v3-turbo-q5_0で、ローカルで動くため費用はかかりません。処理は54秒で終わりました。
歌詞とカットを対応させた絵コンテ表の作り方

絵コンテ表は、カット番号・秒数・生成秒数・歌詞・映像内容・カメラワークを1行にまとめる形にしました。以下は冒頭6カットの抜粋です。
| カット | 秒数 | 生成 | 歌詞 | 映像内容 | カメラワーク |
|---|---|---|---|---|---|
| c01 | 3.0〜11.0 | 8秒 | (イントロ) | 深夜の夜景、明かりの残るフロアへ | 横移動しながら前進 |
| c02 | 11.0〜17.8 | 7秒 | 午前二時 フロアの灯りはひとつだけ | デスクに座る後ろ姿 | ゆっくりズームイン |
| c03 | 17.8〜24.3 | 7秒 | 青いモニターに 映るのは誰だろう | モニターの光に照らされた横顔 | 固定 |
| c04 | 24.3〜30.5 | 7秒 | 既読のつかないチャットを閉じて | マウスでウィンドウを閉じる手元 | 固定 |
| c05 | 30.5〜35.2 | 5秒 | 冷めたコーヒー 最後のひとくち | マグカップで飲み干す口元 | 固定 |
| c06 | 35.2〜47.9 | 13秒 | 窓の向こう 眠らない街が(ほか1行) | 窓の前に立つ後ろ姿 | 背中越しに前進 |
秒数は伴奏込みの音源から取っているため、±0.5〜1秒の誤差は見込んでおきます。文字起こしには誤認識もあり、5か所が歌詞と食い違っていました。
| 歌詞 | 文字起こし | 確信度 | 判断 |
|---|---|---|---|
| 付箋 | 伏線 | 0.191 | 同じ読みの誤変換 |
| キー | 木 | 0.305 | 同じ読みの誤変換 |
| 積み上げた | 澄み上げた | 0.085 | 人が聴いて確認 |
| 始発 | 自発 | 0.093 | 人が聴いて確認 |
| ラスサビの1行(1回だけ) | 同じ行を2回 | 0.03 | 人が聴いて確認 |
役に立ったのは、Whisperが語ごとに出す確信度です。人が聴かないと判断できなかった3か所は、いずれも確信度0.1未満でした。確信度の低い語だけ聴けば、確認は数分で済みます。
カットごとの動画プロンプトを一括で作らせる
絵コンテ表の各行は、Opus 5.5がそのまま動画生成用のプロンプトとして書き出します。今回は表と同じ内容をJSON形式のファイルにも出力させ、生成スクリプトがそれを読み込む仕組みにしました。
{
"id": "c02",
"start": 11.0,
"end": 17.8,
"gen": 7,
"refs": ["char", "office"],
"camera": "固定からゆっくりズームイン",
"scene": "参照画像2の暗いオープンオフィス。照明は中央のデスク1つ分だけ。{char}がそのデスクに座り、モニターに向かっている後ろ姿。カメラはフロアの入口側から、彼女の背中にゆっくり近づく。周囲の机は暗闇に沈んでいる。"
}
{char}の部分には、全カット共通の主人公の説明が自動で入ります。画風の指定や「画面に文字を描かない」「人物は口を開けて歌わない」といったルールも、共通の一文として全カットの末尾に付けました。
今回はClaude Code上でやり取りしながら作ったため、決まった1つの指示文はありません。同じ形の絵コンテを作らせたい場合は、次のように頼むと再現しやすくなります。
(歌詞と秒数の表、コンセプトを貼ったうえで)
この表をもとに、MVの絵コンテを作ってください。
- 歌詞の区切りに合わせてカットを割る。1カットは4〜15秒の整数秒にし、4秒未満の行は前後の行とまとめる
- 列は カット番号・開始秒・終了秒・生成秒数・歌詞・映像内容・カメラワーク・参照画像
- 映像内容はそのまま動画生成AIに渡すプロンプトとして書く。主人公は「参照画像1の女性」、背景は「参照画像2の〇〇」と番号で呼ぶ
- カメラワークは1カットにつき1種類
- 間奏やブレイクは、映像を作らない区間として別に一覧にする
- 最後に、同じ内容をJSONファイルでも出力する
カットの割り方で注意したいのは、H3の尺の制限です。H3は4〜15秒の整数秒でしか生成できないため、4秒を切る行は前の行とまとめて1カットにしています。逆に区間が4.7秒のc05は5秒で生成し、合成時に切り詰めました。
その結果、18カットで生成秒数は合計158秒になりました。冒頭・間奏・ブレイク・エンディングの計約23秒は映像を生成せず、黒画面や静止画のズーム、最後のカットの静止でつないで費用を抑えています。
【ステップ4】MiniMax APIで各カットの映像を生成する

映像の生成には、MiniMaxの動画生成モデルH3をAPI経由で使いました。Webアプリで1本ずつ作るのと違い、スクリプトから全カットをまとめて送れるのがAPIの利点です。
公式のレート制限は毎分300リクエスト・同時実行30タスクで、18カット程度なら一度に送れます。今回もまず2カットでテストし、問題がないことを確かめてから残り16カットを同時に送りました。
出力は1344×768・24fpsで、音声トラックも付いていました。ただし今回はSunoの曲を使うため、合成時に映像側の音声は外しました。
参照画像を使ってキャラや世界観のブレを抑える方法
H3で画像を使って動画を作る方法は2種類あり、「最初と最後のフレーム指定」と「参照画像」は同じリクエストで併用できません。公式のAPIリファレンスにも、両者は排他と明記されています。
| 方式 | 指定のしかた | 向いている使い方 |
|---|---|---|
| 最初と最後のフレーム指定 | 画像にfirst_frame・last_frameの役割を付ける | 用意した1枚の絵をそのまま動かしたいカット |
| 参照画像 | 画像にreference_imageの役割を付ける(最大9枚) | キャラクターや舞台の見た目を全カットでそろえたいとき |
今回選んだのは参照画像の方式です。主人公が出る16カットのうち14カットでは、主人公と舞台の背景を1枚ずつ、計2枚を渡しました。
プロンプトには「参照画像1の女性」「参照画像2のオフィス」と番号で書き分けています。日本語のまま書いても、どの画像が人物でどれが背景かをH3は区別できていました。
なお参照画像は1リクエスト5枚まで無料で、6枚目からは1枚0.04ドルかかります(従量課金の料金表)。
Claude Codeで全カットを一括生成する手順
一括生成のスクリプトも、Opus 5.5がClaude Code上で書いて実行しました。流れは「全カットを送信する→10秒ごとに状態を確認する→完了したものからダウンロードする」の3段階です。
# 参照画像を reference_image として content に並べる(APIキーは環境変数から読み込み、コードには書かない)
content = [{"type": "text", "text": prompt}]
for ref in cut["refs"]: # 例:["char", "office"]
content.append({"type": "image_url",
"image_url": {"url": data_uri(refs[ref])},
"role": "reference_image"})
payload = {"model": "MiniMax-H3", "content": content,
"resolution": "768P", "duration": cut["gen"], "ratio": "16:9"}
# 送信すると task_id が返る
task_id = requests.post(f"{API}/v2/video_generation",
headers=HEADERS, json=payload).json()["task_id"]
# 10秒ごとに状態を照会し、成功したら content.url からダウンロード
task = requests.get(f"{API}/v2/query/video_generation/{task_id}",
headers=HEADERS).json()["task"]
if task["status"] == "succeeded":
video = requests.get(task["content"]["url"]).content
実際のスクリプトには、送信前に見積もり額を表示するお試し実行の機能と、1カットごとの所要時間や費用を記録する処理も入っています。
スクリプトを書かせるときも、日本語で要件を伝えれば十分です。指示の例を載せておきます。
storyboard.json の全カットを MiniMax H3 で生成するPythonスクリプトを書いてください。
- APIキーは .env の MINIMAX_API_KEY から読み込む
- エンドポイントは /v2/video_generation。参照画像は role を reference_image にして渡す
- 解像度は768P、画面比は16:9、秒数は各カットの gen を使う
- 全カットを送信したあと10秒ごとに状態を照会し、成功したものからダウンロードする
- 送信前に費用の見積もりだけを表示するお試し実行モードを付ける
- 所要時間と費用を1カット1行でログに残す
H3は旧モデルとエンドポイントや指定方法が異なるため、公式のAPIリファレンスのURLもあわせて渡しておくと確実です。
実際の生成時間と費用は次のとおりで、動画生成の待ち時間は合計で約13分でした。本生成の16カットは同時に送り、すべて成功しています。
| 回 | カット数(生成秒数) | 待ち時間 | 費用 |
|---|---|---|---|
| テスト | 2カット(18秒) | 252秒 | 1.44ドル |
| 本生成 | 16カット(140秒) | 345秒(1カット142.4〜327.1秒) | 11.20ドル |
| 作り直し | 1カット(7秒) | 183秒 | 0.56ドル |
| 合計 | 19本(165秒) | 約13分 | 13.20ドル |
Claude Codeの導入方法や基本の使い方を知りたい方は、下記の記事をあわせてご確認ください。

失敗カットの見分け方と作り直し方

失敗カットは、各カットから5コマを抜き出し、Opus 5.5に静止画で確認させて洗い出しました。18カット中、作り直し候補になったのは2カットです。
1つめのc03では、冒頭の約3秒で瞳から青い光線が出ていました。「瞳にモニターの光が映り込む」という指示を、H3が大げさに解釈したとみられます。
そこでプロンプトを次のように直しました。
| 区分 | プロンプトの該当部分 |
|---|---|
| 修正前 | 瞳にモニターの光が小さく映り込んでいる |
| 修正後 | 目は光らせず、光線やエフェクトも出さず、普通のアニメの瞳として描く |
作り直しの生成時間は167.7秒(待ち時間は183秒)、費用は0.56ドルで、光線は消えました。ただしモニターの位置が背後に回り、歌詞の「青いモニター」の印象は弱まっています。直したい点を具体的に否定すると直る一方、別の要素が動くこともあると考えておきましょう。
2つめのc15は、後半で髪が茶色に変わるキャラクターのブレでした。こちらは人が判断して作り直さず、そのまま採用しています。手のアップは4カットありましたが、指の本数や形の崩れは目視では見つかりませんでした。
【ステップ5】歌詞のリリックモーションを付けて仕上げる
最後に、JIZURAで歌詞の文字PVを作り、H3の映像に重ねて1本のMVにします。JIZURAは歌詞から文字の動きを自動で組み立てる無料のブラウザアプリで、2026年9月に公開されたばかりのツールです。
歌詞や曲はブラウザの中で処理され、サーバーには送られません(README)。インストールも不要のため、社内のPCでも試しやすいでしょう。
ただし、ブラウザ版だけではMiniMaxの映像と合成できません。文字だけの素材を書き出し、別のツールで映像に重ねる必要があります。
歌詞を読み込んで文字PVを自動で組む手順

JIZURAでは、歌詞を1行ずつ貼るだけで文字の動きが組み上がります。今回は曲を読み込まず、Whisperで取った秒数をLRC形式のタイムスタンプとして歌詞に埋め込み、それだけで同期させました。
貼り付けた歌詞は次のような形です。
[00:11.00]午前二時/フロアの灯りはひとつだけ
[00:17.80]青いモニターに/映るのは誰だろう
[00:47.90]夜明けまで*ログアウト*しない!
[01:12.70][間奏]
/はカットの切れ目、*で囲んだ語は強調、行末の!はフラッシュの指定です。書き出した素材では最初の歌詞が11.1秒に出ており、Whisperで取った歌い出しの11.0秒との差は0.1秒でした。JIZURAの「文字を声より0.2秒先に出す」仕様を考えても、ずれは0.3秒以内で、ほぼ狙いどおりです。

なお曲を読み込むと、JIZURAがBPMと拍を自動で検出し、カットの切れ目を拍に寄せてくれます。今回はこの機能を使っていません。拍に合わせて文字を切り替えたい場合は、曲を読み込んでください。
あとはおまかせボタンで演出の案を出し、気に入ったものを書き出すだけです。最初の書き出しまでの操作は、筆者の体感で10〜15分でした。その後、曲名の入れ忘れと書き出し形式の選び間違いで、2回書き出し直しています。
映像と文字PVを合成して1本のMVにする

合成の方法は2通りで、どちらもJIZURAの外で映像と重ねる前提です。ブラウザ版には映像を読み込む機能がなく、文字だけの素材を書き出して使います。
| 方法 | JIZURAの書き出し | 重ねるツール |
|---|---|---|
| ブラウザ版+外部ツール | 透過PNG(ZIP)、またはグリーンバック・ブラックバックの素材 | Premiere・DaVinci Resolve・ffmpegなど |
| After Effects連携 | AE用の構成データ(JSON)、またはAE用のパネル | After Effects(CEP版は2022以降) |
AE連携については、作者のREADMEに「実機の AE ではまだ動かしていません」とあり、筆者も今回は試していません。
今回はブラウザ版から透過PNGを書き出し、Opus 5.5が書いたスクリプトでffmpegを動かして合成しました。書き出し時に「中央を空ける(キャラクター用)」をオンにすると、歌詞が左右に振り分けられ、中央の主人公が文字で隠れません。

合成スクリプトは22の区間をつないだ映像に文字素材とSunoの曲を重ね、仕上げの合成は128秒で終わりました。
なお文字素材は720pで書き出し、合成時に1080pへ拡大しました。文字をくっきりさせたいなら、JIZURA側で1080p以上を選びましょう。
ffmpegやRemotionを使ってClaude Codeに動画編集を任せる方法は、以下の記事もあわせてご覧ください。

【実践・検証】完成したMVの品質と制作時間・費用
ここからは、完成したMVの品質・時間・費用を実測値で検証します。結論として、MiniMaxの実費は13.23ドル、作業の総経過時間は約3時間でした。
品質面では、主人公の見た目がほぼ全カットでそろい、歌詞と映像の場面もずれていません。一方で、指示の読み違いや文字PVの細かな不具合には人の手当てが必要でした。
完成したMVとカットごとの解説
見どころの1つめは、c02とc12の2カットです。テストとして最初に生成したc02では、参照画像のオフィスがモニターの縁の付箋まで再現され、ゆっくり近づくカメラも指示どおりでした。
c12では、疲れた表情から最後に微笑むまでの変化が描かれています。ただし「ガラスへの映り込み」という指示は途中から外れ、実際の顔を正面から撮った画に変わっていました。演出としては成立しているため、そのまま採用しています。

2つめは、夜から朝への色の変化です。c11では窓の外の空が紺から藍・紫へ移り、c14ではビルを出て走る主人公の背後で空がオレンジに染まっていきます。Opus 5.5が最初に決めた色の設計が、カットをまたいでも崩れていません。
文字PVを重ねたあとに10か所を抜き出して確認したところ、いずれも歌詞と映像の場面が一致していました。
人の手で作る場合との比較
今回の実費と時間を、制作会社などが公開している料金と比べました。MiniMaxの実費だけで見ると、リリックビデオの最安プランの7分の1以下です。
| 項目 | 今回(生成AI) | リリックビデオ(小規模) | 実写MV(制作会社) |
|---|---|---|---|
| 費用 | 13.23ドル(約1,980円)+各サービスの月額 | 1.5万円〜(税込) | 30万円〜(税別)/40万円〜 |
| 期間 | 約3時間(2回に分けて作業) | 約1週間〜 | 最短4週間 |
リリックビデオはREGEKUL、実写MVはツムラオフィスとFILMOQの料金ページの値です。今回の費用にはSuno Pro(月10ドル)とClaudeのプラン代は含めていません。
ただし比べているものは同じではありません。実写MVは撮影や演出の専門家が関わり、リリックビデオも修正のやり取りが含まれます。生成AIで作ったMVは、あくまで「自分で判断して直す手間」と引き換えの安さです。
内訳はH3の映像生成が13.20ドル、image-01が0.0385ドルで、MiniMaxのコンソールで確認した残高の減り(13.23ドル)とほぼ一致しました。
プロ級に届いた点と届かなかった点
届いた点は、キャラクターの一貫性とカメラワークの再現度です。一方で、届かなかった点も3つあります。
| 区分 | 項目 | 実際の結果 |
|---|---|---|
| 届いた | キャラクターの一貫性 | 見た目が明確にブレたのは18カット中1カット(c15) |
| 届いた | カメラワーク・演技 | 本生成16カット中8カットが指示どおり。手の崩れも見当たらない |
| 届かなかった | 否定の指示 | 「湯気は立っていない」のc05で湯気が出た。c10では付箋の色が黄色から緑に変わった |
| 届かなかった | リップシンク・カットのつなぎ | 歌うカットは作らない設計にした。場面転換はすべて単純な切り替え |
| 届かなかった | 文字PVの細部 | おまかせで画面をグレーの板が覆うレイアウトが選ばれ、該当する220コマだけ背景の濃さを25%に下げた |
特に場面転換は、カット同士を最初と最後のフレームでつないでいないため、商業MVのような凝ったつなぎはできていません。
総合すると、社内向けの映像や個人の作品としては十分通用する仕上がりです。一方、商業MVとして出すなら、カットの選び直しと文字演出の調整に人の手を残しておく必要があるでしょう。
AIでMVを作るときの注意点
生成AIで作ったMVを公開・商用利用する前には、権利の確認と公開先のルールの確認の2つを済ませておきましょう。どちらも2026年9月時点で規約やヘルプページが更新されており、以前の情報のままだと判断を誤るおそれがあります。
制作工程での注意点も、あわせて整理しておきます。今回つまずいたのはJIZURAの書き出しでした。
| つまずいた点 | 対処 |
|---|---|
| 4GBを超えたZIPが開けなかった | 目次が壊れていたため、Opus 5.5に書かせたスクリプトで先頭から直接取り出した |
| 「連番PNG(ZIP)」の素材が不透明だった | 映像に重ねる場合は「透過PNG(ZIP・背景なし)」を選び直す |
| 曲名が「UNTITLED」と表示された | 曲名・アーティスト名の欄を埋めてから書き出す |
4GBを超えたZIPは、ZIP64という大容量向けの形式に対応していないためとみられます。書き出す尺や解像度を上げるときは注意してください。
楽曲・映像の権利と商用利用の確認
商用利用の条件は、ツールごとに書かれ方がまったく違います。公開前に、それぞれの規約を原文で確認してください。
| ツール | 商用利用 | 確認しておきたい点 |
|---|---|---|
| Suno | Pro・Premierでダウンロードした曲は可 | 商用の権利があっても著作権の保護は保証されない |
| MiniMax API | 生成物の所有権は利用者に残ると明記 | 「商用利用を許諾する」という明文はない。AI生成であることの表示義務あり |
| JIZURA | 出力物は商用・非商用を問わず自由に使える | 出力物へのクレジット表記の義務は記載なし。歌詞と曲の権利は各権利者に帰属 |
根拠はSunoの利用規約と有料プランの権利に関するヘルプ、MiniMaxの利用規約、JIZURAのREADMEです。
YouTubeなどで公開するときのAI生成コンテンツの表示
YouTubeで公開するなら、アップロード時の[属性]にある[AI の使用]で[はい]を選んでおくのが安全です。YouTubeのヘルプページ「生成 AI コンテンツの使用に関する開示」では、開示が必要な例に「AI 生成の音楽」が挙げられています。
一方、フルアニメーションのように現実と見間違えない映像は、開示が不要な例に入っています。ただし音楽がAI生成である以上、今回のようなMVは開示しておくのが無難です。
同じページには、開示しても視聴者の制限や収益化の資格には影響しないと書かれています。逆に開示を繰り返し怠ると、動画の削除やパートナープログラムの停止につながる可能性があります。
生成AIで作った動画をYouTubeで運用するときのルールや収益化の基準は、以下の記事もあわせてご覧ください。

Opus 5.5を監督役にAIでのMV作りを始めよう
Opus 5.5を司令塔にすれば、作詞から絵コンテ、映像の一括生成、合成までMV制作の大部分を自動化できます。今回はMiniMaxの実費13.23ドル・約3時間で、2分55秒のMVが完成しました。一方で、否定の指示の読み違いやカット間のつなぎなど、採用の判断と仕上げの調整は人が担う部分として残っています。
とはいえ、複数の生成AIをつないだ仕組みを業務で安定して回すには、品質のチェック体制や権利の確認といった別の課題が出てきます。
「生成AIで新しいプロダクトを作りたい」「もっと本格的に生成AIを業務に組み込みたい」とお考えの方は、ぜひ株式会社WEELにご相談ください。
開発実績として、
・新規事業室での「リサーチ」「分析」「事業計画検討」を70%自動化するAIエージェント
・社内お問い合わせの1次回答を自動化するRAG型のチャットボット
・過去事例や最新情報を加味して、10秒で記事のたたき台を作成できるAIプロダクト
・お客様からのメール対応の工数を80%削減したAIメール
・サーバーやAI PCを活用したオンプレでの生成AI活用
・生徒の感情や学習状況を踏まえ、勉強をアシストするAIアシスタント
などの開発実績がございます。
生成AIを活用したプロダクト開発の支援内容は、以下のページでも詳しくご覧いただけます。
➡︎株式会社WEELのサービスを詳しく見る。
アイデア段階でも構いません。まずは無料相談でお気軽にご相談ください。
➡︎生成AIを活用したプロダクト開発・業務効率化について相談する

「生成AIを社内で活用したい」「生成AIの事業をやっていきたい」という方に向けて、通勤時間に読めるメルマガを配信しています。
最新のAI情報を日本最速で受け取りたい方は、以下からご登録ください。
また、弊社紹介資料もご用意しておりますので、併せてご確認ください。

