Claude Opus 5.5でAI MV作成!プロ級MVを自動生成する手順やツール、実践結果を解説

Claude Opus 5.5 AI MV 作成 プロ級 MV 自動 生成 手順 ツール 実践結果 解説
押さえておきたいポイント
  • AIを使ったMVの作り方は、Opus 5.5を監督役に作曲・映像・文字PVのツールを束ねる形
  • 2分55秒・18カットのMVが、MiniMaxの実費13.23ドルと約3時間で完成
  • キャラのブレや指示の読み違いは残るため、採用カットの判断は人が担う

2026年9月22日に公開されたClaude Opus 5.5を監督役に据えると、Sunoの曲を使ったMV制作の大半を生成AIに任せられます。筆者は2分55秒の曲に18カットの映像と文字PVを付け、MiniMaxの実費13.23ドル・約3時間で仕上げました。

Claude Opus 5.5でAI MV作成!プロ級MVを自動生成する手順やツール、実践結果を解説

とはいえ「曲はあってもMVまでは手が回らない」方も多いはず。この記事では、MiniMaxとJIZURAを使った手順・費用・品質を、完成動画つきで解説します。ぜひ最後までご覧ください。

\生成AIを活用して業務プロセスを自動化/

tamura

【監修者】田村 洋樹

株式会社WEEL代表取締役 / 累計25社以上のAIアドバイザリーを担当 / 企業向けセミナー・大学講義でのべ10,000人超に登壇 / 日本HP・インテルなど、大手企業主催カンファレンスへの登壇実績多数。AI導入支援・生成AIを活用した業務改革のプロとして、アドバイザリー・PM・講演者など多面的な立場から企業を支援中。

目次

Opus 5.5×AIツールでMV制作はどこまで自動化できる?

Opus 5.5で制作したMVの場面カット

結論からいうと、MV制作のうち「考える作業」と「つなぐ作業」の大部分はOpus 5.5に任せられます。作詞・世界観の設計・絵コンテ・動画生成用のプロンプト・生成と合成のスクリプトまで、今回はすべてOpus 5.5が書きました。

一方で、映像や音楽を作るのはOpus 5.5ではなく各サービスです。曲はSuno、映像はMiniMaxの動画生成AI、歌詞の文字演出はJIZURAが担当しました。どのカットを採用するかの最終判断は人が行っています。

ここではまず、完成したMVと各ツールの役割を整理します。

今回作るMVの完成形

今回完成したのは、オリジナル曲「夜明けのログアウト」のアニメ調MV(2分55秒・1920×1080)です。深夜2時のオフィスで働く女性が、始発の時間に朝日を迎えるまでを18カットで描きました。

映像の上には、歌に合わせて歌詞が動く文字PVを重ねています。主人公を隠さないよう、歌詞は画面の左右に振り分けました。

曲・映像・歌詞の演出はいずれも生成AIとブラウザツールによるもので、人が手で描いたカットはありません。

使用するツールと役割分担

今回使ったサービスは4つ(MiniMaxは2モデル)で、Opus 5.5だけが映像や音を「生成しない」立場です。

スクロールできます
ツール担当2026年9月時点の情報
Suno作曲・歌唱最新モデルはv6(2026年9月9日公開)。v6はPro・Premier限定
Claude Opus 5.5作詞・コンセプト設計・絵コンテ・プロンプト作成・スクリプトの作成と実行Claude Code上で動かす。入力はテキストと画像、出力はテキスト
MiniMax H3カットごとの映像生成1カット4〜15秒、768Pと2Kに対応
MiniMax image-01参照画像の生成1枚0.0035ドル
JIZURA歌詞の文字PVブラウザで動く無料ツール。最新版はv0.10.0(2026年9月29日)
MV制作で使ったツールと役割の一覧(2026年9月時点)

Sunoのv6については公式の発表、H3の仕様はMiniMaxのAPIリファレンス、JIZURAは公式のREADMEで確認しました。

MiniMaxはWebアプリ(Hailuo AI)ではなくAPIを使いました。Opus 5.5がスクリプトを書き、Claude Code上でそのまま実行するので、カットが18本あっても人がボタンを押し続ける必要はありません。

Opus 5.5に任せる範囲と人が判断する範囲

最初に押さえておきたいのは、Opus 5.5は画像も音声も生成できず、音声を聴くこともできないという点です。公式の仕様では入力がテキストと画像、出力はテキストのみで、ドキュメントでも画像生成は明確に否定されています。

そのため今回は、Opus 5.5を「監督」と位置づけました。曲を聴けない点は、Claude Code上で文字起こしツールのWhisperを動かして補っています。Opus 5.5は、その文字起こしの結果を読んで歌詞の秒数を把握しました。

スクロールできます
担当作業
Opus 5.5作詞・世界観の設計・絵コンテ・プロンプト・スクリプト・静止画での品質チェック
各生成AI作曲(Suno)・画像(image-01)・映像(H3)
人テイクの選定・聞き取りの確認・参照画像の選定・作り直しの判断・JIZURAの操作
MV制作でのOpus 5.5と人の役割分担

Opus 5.5の性能や料金を詳しく知りたい方は、下記の記事をあわせてご確認ください。

MV自動化ワークフローの全体像

今回のワークフローは、曲・参照画像・絵コンテ・映像・文字PVの5ステップで進みます。前のステップの成果物が次のステップの入力になるため、順番を入れ替えないのがポイントです。

作業時間は深夜と朝の2回に分けて、合計で約3時間でした。この時間には、生成を待つ時間や人が判断した時間も含まれています。

曲作りから文字PV合成までの5ステップ

AI MV制作の5ステップ

流れはシンプルです。Sunoで曲を作り、Opus 5.5が歌詞から世界観を決め、主人公と背景の参照画像を作ります。

次に歌詞の秒数に合わせてカットを割り、H3で全カットの映像を一括生成します。最後にJIZURAで作った歌詞の素材を映像に重ね、曲を付けて完成です。合成にはffmpegという無料の動画処理ツールを使い、これもOpus 5.5が書いたスクリプトで実行しました。

STEP
Sunoで楽曲を作る

歌詞とStyles(曲調の指定)はOpus 5.5が書き、Sunoのv6で曲を生成します。

STEP
Opus 5.5にMVのコンセプトと参照画像を決めてもらう

歌詞から世界観を決め、主人公1枚と背景4枚の参照画像をimage-01で作ります。

STEP
Opus 5.5に絵コンテを作ってもらう

Whisperで取った歌詞の秒数をもとに、カット割りと動画生成用のプロンプトを書き出します。

STEP
MiniMax APIで各カットの映像を生成する

参照画像を渡しながら、H3で全カットの映像を一括生成します。

STEP
歌詞のリリックモーションを付けて仕上げる

JIZURAで作った歌詞の素材を映像に重ね、ffmpegで曲と合成します。

必要なアカウント・APIキーと費用の目安

必要なのはSuno・Claude・MiniMaxの3つのアカウントで、APIキーが要るのはMiniMaxだけです。JIZURA・Whisper・ffmpegは無料で使えます。

スクロールできます
サービス必要なもの料金(2026年9月時点)
SunoProプラン以上(商用利用とv6に必要)Proは月10ドル(約1,500円)、年払いなら月8ドル相当
ClaudeClaude Codeが使えるプランProは月20ドル(約3,000円)、Maxは月100ドル・月200ドル
MiniMax従量課金のAPIキーH3 768Pは1秒0.08ドル(約12円)、2Kは0.13ドル(約20円)
MVの制作に必要なアカウントと料金(2026年9月時点、1ドル150円換算)

料金はSunoの料金ページ・Claudeの料金ページ・MiniMaxの従量課金ページで確認しました。なおClaude CodeでOpus 5.5を使うには、v2.1.280以降が必要です。

MV1本を3分・20カットと仮定すると、H3の映像費は768Pで14.40ドル(約2,160円)、2Kで23.40ドル(約3,510円)です。H3は参照画像が5枚まで無料のため、1カットに2枚渡す程度なら画像代はかかりません。

ただし作り直した分は費用が上乗せされます。今回の実費は検証パートで紹介します。

【ステップ1】Sunoで楽曲を作る

SunoのAdvancedで歌詞とStylesを入力
参考:https://suno.com/create

MVの土台になる曲は、Sunoの最新モデルv6で作りました。歌詞とStyles(曲調の指定)はOpus 5.5に書かせ、人はSunoの画面に貼り付けて生成ボタンを押しただけです。

生成は筆者の体感で1分ほど。1回の生成で2テイクが出てくるので、聴き比べて使うほうを選びます。

MV向きの曲を作るコツ

SunoのMore Optionsの設定画面
参考:https://suno.com/create

コツは、歌詞の段階で「映像にしやすい言葉」を入れておくことです。Opus 5.5には「フロアの灯り」「青いモニター」「冷めたコーヒー」「付箋」といった名詞を歌詞に入れさせ、あとの絵コンテでそのままカットにできるようにしました。

1行を短くしておくのも効きます。文字PVのJIZURAは1行を1フレーズとして扱うため、短い行ならそのまま流し込めます。

実際にStylesへ入れた指定は以下のとおりです。

emotional J-pop rock, anime-style female vocal, clear and airy high tone, 150 BPM, piano arpeggio intro, driving drums, bright distorted guitars, cinematic build-up, anthemic chorus, bittersweet to hopeful, city night to sunrise

More OptionsのExclude styles(入れたくない要素)には「rap, screaming, spoken word」を指定しています。

Sunoで生成された2テイクの一覧
参考:https://suno.com/create

出てきたのは3分04秒と2分55秒の2テイクで、今回は短いほうの2分55秒を使いました。当初の目標だった2分〜2分30秒よりは長くなっています。

生成後の歌詞テキストは必ず保存しておいてください。Sunoは入力にない繰り返しを足すことがあり、今回も1番のサビ末尾「この手で 朝を連れてくる」が2回に増えていました。あとで歌詞の秒数を取るときに、このずれを突き合わせます。

MVで使うときの商用利用の注意点

MVを公開・販売するなら、Sunoは有料プランでダウンロードした曲だけが商用利用の対象です。料金ページのFAQにも、ProかPremierなら曲を商用利用できると書かれています。

無料プランで作った曲は非商用に限られます。後から有料プランに加入しても、既定では過去の曲に商用の権利はさかのぼりません(Sunoヘルプ)。

さらに2026年9月3日からはダウンロード数に上限が設けられました。それ以前に作った曲にも適用されます。

プラン月額(月払い)ダウンロード上限商用利用
Free0ドル試用ダウンロードが生涯7曲❌️
Pro10ドル(約1,500円)月20曲⭕️
Premier30ドル(約4,500円)月60曲⭕️
Sunoのプラン別ダウンロード上限と商用利用の可否(2026年9月時点、1ドル150円換算)

上限があるため、候補のテイクはブラウザ上で聴き比べ、MVに使う曲を決めてからダウンロードするのがおすすめです。

Sunoの基本的な使い方や機能を知りたい方は、以下の記事もあわせてご覧ください。

【ステップ2】Opus 5.5にMVのコンセプトと参照画像を決めてもらう

曲ができたら、Opus 5.5にMV全体の世界観と、全カットで使い回す参照画像の設計を任せます。ここで決めた主人公の見た目や色の変化が、あとのすべてのカットの基準です。

動画生成AIは1カットずつ別々に生成するため、何も決めずに進めると、カットごとに主人公の顔や服が変わってしまいます。この工程は、そのブレを防ぐための土台づくりです。

歌詞からコンセプトを作らせるプロンプト

コンセプトづくりでは、「何を決めてほしいか」と「動画生成AIの制約」をプロンプトに書き込むのがポイントです。実際に使ったプロンプトを載せておきます。

あなたはミュージックビデオの監督です。
以下の歌詞と曲情報から、MVのコンセプトを設計してください。

# 曲情報
- タイトル:夜明けのログアウト
- ジャンル:エモ系J-POPロック/女性ボーカル/BPM150前後/2分55秒
- 各パートの秒数:(Whisperで取得した歌詞と秒数の表を貼る)

# 歌詞
(歌詞全文を貼る)

# 出力してほしいもの
1. MV全体のテーマを1文で
2. 世界観(時代・場所・時間帯)
3. 主人公の外見(全カットで固定する要素を具体的に)
4. 舞台(登場する場所を3〜5か所)
5. 色の設計(パートごとに色がどう変化するか)
6. 画風
7. 動画生成AIで破綻させないための撮影ルール

# 制約
- 映像は動画生成AI(MiniMax H3)で1カット4〜15秒ずつ作る
- 口の動きは曲と同期できないため、歌っているシーンは作らない
- カット間で主人公の見た目がぶれないよう、参照画像を使う前提で設計する

Opus 5.5からは、次のようなコンセプトが返ってきました。

Opus 5.5が出力したMVのコンセプト

出力のうち、あとの工程で効いたのは次の3点です。

項目Opus 5.5の出力(要約)
主人公黒髪のショートボブ、白いブラウスに紺のカーディガン、青いストラップの社員証。眼鏡とアクセサリーは形が崩れやすいので付けない
色の設計深い紺とモニターのシアンから始まり、サビで街のマゼンタ、最後は藍色からオレンジ、金色の朝日へ
撮影ルール歌うカットは作らない。顔の正面アップは2割以下。画面に文字を描かせない
Opus 5.5が出力したMVコンセプトの要点

眼鏡を外す判断や「画面に文字を描かせない」というルールは、動画生成AIの弱点を踏まえています。こちらから細かく指示しなくても、制約を伝えただけでここまで設計してくれました。

コンセプト画像を生成して参照画像にする

主人公の参照画像

コンセプトが決まったら、主人公1枚と舞台ごとの背景4枚を画像生成AIで作り、参照画像にします。今回はMiniMaxのimage-01を使い、プロンプトと生成スクリプトはOpus 5.5が書きました。

主人公2案・実写調1案・背景4か所×2案の計11枚を生成し、かかった時間は94秒、費用は0.0385ドル(約6円)でした。そこから主人公1枚と背景4枚をOpus 5.5と人で選んでいます。

生成した画像には、次のような失敗も混ざっていました。

スクロールできます
指示起きたこと対処
「シネマティック」な画風11枚中4枚で、画面の上下に黒帯が入った採用した2枚はffmpegで帯を切り落とした
「人物はいない」背景窓の背景に人影が入った人影のない別案を採用した
実写調の主人公社員証のストラップに読めない文字が描かれたアニメ調の案を採用した
参照画像の生成で起きた失敗と対処(2026年9月29日・筆者計測)
上下に黒帯が入った背景画像

この5枚から、カットごとに主人公と舞台の画像を選んでH3に渡し、見た目と雰囲気をそろえるのが狙いです。

【ステップ3】Opus 5.5に絵コンテを作ってもらう

絵コンテでは、歌詞の区切りに合わせてカットを割り、そのまま動画生成に使えるプロンプトまでOpus 5.5に書かせます。ここで問題になるのが、Opus 5.5は曲を聴けないため、どの歌詞が何秒から始まるかを自分では知りようがない点です。

そこでClaude Code上で文字起こしツールのwhisper.cppを動かし、歌詞と秒数の対応表を作りました。モデルはlarge-v3-turbo-q5_0で、ローカルで動くため費用はかかりません。処理は54秒で終わりました。

歌詞とカットを対応させた絵コンテ表の作り方

絵コンテから生成したカットの例

絵コンテ表は、カット番号・秒数・生成秒数・歌詞・映像内容・カメラワークを1行にまとめる形にしました。以下は冒頭6カットの抜粋です。

スクロールできます
カット秒数生成歌詞映像内容カメラワーク
c013.0〜11.08秒(イントロ)深夜の夜景、明かりの残るフロアへ横移動しながら前進
c0211.0〜17.87秒午前二時 フロアの灯りはひとつだけデスクに座る後ろ姿ゆっくりズームイン
c0317.8〜24.37秒青いモニターに 映るのは誰だろうモニターの光に照らされた横顔固定
c0424.3〜30.57秒既読のつかないチャットを閉じてマウスでウィンドウを閉じる手元固定
c0530.5〜35.25秒冷めたコーヒー 最後のひとくちマグカップで飲み干す口元固定
c0635.2〜47.913秒窓の向こう 眠らない街が(ほか1行)窓の前に立つ後ろ姿背中越しに前進
Opus 5.5が作成した絵コンテ表(18カット中6カットを抜粋)

秒数は伴奏込みの音源から取っているため、±0.5〜1秒の誤差は見込んでおきます。文字起こしには誤認識もあり、5か所が歌詞と食い違っていました。

スクロールできます
歌詞文字起こし確信度判断
付箋伏線0.191同じ読みの誤変換
キー木0.305同じ読みの誤変換
積み上げた澄み上げた0.085人が聴いて確認
始発自発0.093人が聴いて確認
ラスサビの1行(1回だけ)同じ行を2回0.03人が聴いて確認
Whisperの誤認識と確信度(2026年9月29日・筆者計測)

役に立ったのは、Whisperが語ごとに出す確信度です。人が聴かないと判断できなかった3か所は、いずれも確信度0.1未満でした。確信度の低い語だけ聴けば、確認は数分で済みます。

カットごとの動画プロンプトを一括で作らせる

絵コンテ表の各行は、Opus 5.5がそのまま動画生成用のプロンプトとして書き出します。今回は表と同じ内容をJSON形式のファイルにも出力させ、生成スクリプトがそれを読み込む仕組みにしました。

{
  "id": "c02",
  "start": 11.0,
  "end": 17.8,
  "gen": 7,
  "refs": ["char", "office"],
  "camera": "固定からゆっくりズームイン",
  "scene": "参照画像2の暗いオープンオフィス。照明は中央のデスク1つ分だけ。{char}がそのデスクに座り、モニターに向かっている後ろ姿。カメラはフロアの入口側から、彼女の背中にゆっくり近づく。周囲の机は暗闇に沈んでいる。"
}

{char}の部分には、全カット共通の主人公の説明が自動で入ります。画風の指定や「画面に文字を描かない」「人物は口を開けて歌わない」といったルールも、共通の一文として全カットの末尾に付けました。

今回はClaude Code上でやり取りしながら作ったため、決まった1つの指示文はありません。同じ形の絵コンテを作らせたい場合は、次のように頼むと再現しやすくなります。

(歌詞と秒数の表、コンセプトを貼ったうえで)
この表をもとに、MVの絵コンテを作ってください。
- 歌詞の区切りに合わせてカットを割る。1カットは4〜15秒の整数秒にし、4秒未満の行は前後の行とまとめる
- 列は カット番号・開始秒・終了秒・生成秒数・歌詞・映像内容・カメラワーク・参照画像
- 映像内容はそのまま動画生成AIに渡すプロンプトとして書く。主人公は「参照画像1の女性」、背景は「参照画像2の〇〇」と番号で呼ぶ
- カメラワークは1カットにつき1種類
- 間奏やブレイクは、映像を作らない区間として別に一覧にする
- 最後に、同じ内容をJSONファイルでも出力する

カットの割り方で注意したいのは、H3の尺の制限です。H3は4〜15秒の整数秒でしか生成できないため、4秒を切る行は前の行とまとめて1カットにしています。逆に区間が4.7秒のc05は5秒で生成し、合成時に切り詰めました。

その結果、18カットで生成秒数は合計158秒になりました。冒頭・間奏・ブレイク・エンディングの計約23秒は映像を生成せず、黒画面や静止画のズーム、最後のカットの静止でつないで費用を抑えています。

【ステップ4】MiniMax APIで各カットの映像を生成する

MiniMax H3で生成したカット

映像の生成には、MiniMaxの動画生成モデルH3をAPI経由で使いました。Webアプリで1本ずつ作るのと違い、スクリプトから全カットをまとめて送れるのがAPIの利点です。

公式のレート制限は毎分300リクエスト・同時実行30タスクで、18カット程度なら一度に送れます。今回もまず2カットでテストし、問題がないことを確かめてから残り16カットを同時に送りました。

出力は1344×768・24fpsで、音声トラックも付いていました。ただし今回はSunoの曲を使うため、合成時に映像側の音声は外しました。

参照画像を使ってキャラや世界観のブレを抑える方法

H3で画像を使って動画を作る方法は2種類あり、「最初と最後のフレーム指定」と「参照画像」は同じリクエストで併用できません。公式のAPIリファレンスにも、両者は排他と明記されています。

スクロールできます
方式指定のしかた向いている使い方
最初と最後のフレーム指定画像にfirst_frame・last_frameの役割を付ける用意した1枚の絵をそのまま動かしたいカット
参照画像画像にreference_imageの役割を付ける(最大9枚)キャラクターや舞台の見た目を全カットでそろえたいとき
MiniMax H3の画像入力の方式の違い(2026年9月時点)

今回選んだのは参照画像の方式です。主人公が出る16カットのうち14カットでは、主人公と舞台の背景を1枚ずつ、計2枚を渡しました。

プロンプトには「参照画像1の女性」「参照画像2のオフィス」と番号で書き分けています。日本語のまま書いても、どの画像が人物でどれが背景かをH3は区別できていました。

なお参照画像は1リクエスト5枚まで無料で、6枚目からは1枚0.04ドルかかります(従量課金の料金表)。

Claude Codeで全カットを一括生成する手順

一括生成のスクリプトも、Opus 5.5がClaude Code上で書いて実行しました。流れは「全カットを送信する→10秒ごとに状態を確認する→完了したものからダウンロードする」の3段階です。

# 参照画像を reference_image として content に並べる(APIキーは環境変数から読み込み、コードには書かない)
content = [{"type": "text", "text": prompt}]
for ref in cut["refs"]:  # 例:["char", "office"]
    content.append({"type": "image_url",
                    "image_url": {"url": data_uri(refs[ref])},
                    "role": "reference_image"})
payload = {"model": "MiniMax-H3", "content": content,
           "resolution": "768P", "duration": cut["gen"], "ratio": "16:9"}

# 送信すると task_id が返る
task_id = requests.post(f"{API}/v2/video_generation",
                        headers=HEADERS, json=payload).json()["task_id"]

# 10秒ごとに状態を照会し、成功したら content.url からダウンロード
task = requests.get(f"{API}/v2/query/video_generation/{task_id}",
                    headers=HEADERS).json()["task"]
if task["status"] == "succeeded":
    video = requests.get(task["content"]["url"]).content

実際のスクリプトには、送信前に見積もり額を表示するお試し実行の機能と、1カットごとの所要時間や費用を記録する処理も入っています。

スクリプトを書かせるときも、日本語で要件を伝えれば十分です。指示の例を載せておきます。

storyboard.json の全カットを MiniMax H3 で生成するPythonスクリプトを書いてください。
- APIキーは .env の MINIMAX_API_KEY から読み込む
- エンドポイントは /v2/video_generation。参照画像は role を reference_image にして渡す
- 解像度は768P、画面比は16:9、秒数は各カットの gen を使う
- 全カットを送信したあと10秒ごとに状態を照会し、成功したものからダウンロードする
- 送信前に費用の見積もりだけを表示するお試し実行モードを付ける
- 所要時間と費用を1カット1行でログに残す

H3は旧モデルとエンドポイントや指定方法が異なるため、公式のAPIリファレンスのURLもあわせて渡しておくと確実です。

実際の生成時間と費用は次のとおりで、動画生成の待ち時間は合計で約13分でした。本生成の16カットは同時に送り、すべて成功しています。

スクロールできます
回カット数(生成秒数)待ち時間費用
テスト2カット(18秒)252秒1.44ドル
本生成16カット(140秒)345秒(1カット142.4〜327.1秒)11.20ドル
作り直し1カット(7秒)183秒0.56ドル
合計19本(165秒)約13分13.20ドル
MiniMax H3の生成時間と費用の実測(2026年9月29日・筆者計測)

Claude Codeの導入方法や基本の使い方を知りたい方は、下記の記事をあわせてご確認ください。

失敗カットの見分け方と作り直し方

作り直し前後のカットの比較

失敗カットは、各カットから5コマを抜き出し、Opus 5.5に静止画で確認させて洗い出しました。18カット中、作り直し候補になったのは2カットです。

1つめのc03では、冒頭の約3秒で瞳から青い光線が出ていました。「瞳にモニターの光が映り込む」という指示を、H3が大げさに解釈したとみられます。

そこでプロンプトを次のように直しました。

スクロールできます
区分プロンプトの該当部分
修正前瞳にモニターの光が小さく映り込んでいる
修正後目は光らせず、光線やエフェクトも出さず、普通のアニメの瞳として描く
c03の作り直しで変えたプロンプト

作り直しの生成時間は167.7秒(待ち時間は183秒)、費用は0.56ドルで、光線は消えました。ただしモニターの位置が背後に回り、歌詞の「青いモニター」の印象は弱まっています。直したい点を具体的に否定すると直る一方、別の要素が動くこともあると考えておきましょう。

2つめのc15は、後半で髪が茶色に変わるキャラクターのブレでした。こちらは人が判断して作り直さず、そのまま採用しています。手のアップは4カットありましたが、指の本数や形の崩れは目視では見つかりませんでした。

【ステップ5】歌詞のリリックモーションを付けて仕上げる

最後に、JIZURAで歌詞の文字PVを作り、H3の映像に重ねて1本のMVにします。JIZURAは歌詞から文字の動きを自動で組み立てる無料のブラウザアプリで、2026年9月に公開されたばかりのツールです。

歌詞や曲はブラウザの中で処理され、サーバーには送られません(README)。インストールも不要のため、社内のPCでも試しやすいでしょう。

ただし、ブラウザ版だけではMiniMaxの映像と合成できません。文字だけの素材を書き出し、別のツールで映像に重ねる必要があります。

歌詞を読み込んで文字PVを自動で組む手順

JIZURAにLRC付きの歌詞を貼った画面
参考:https://852wa.github.io/JIZURA/

JIZURAでは、歌詞を1行ずつ貼るだけで文字の動きが組み上がります。今回は曲を読み込まず、Whisperで取った秒数をLRC形式のタイムスタンプとして歌詞に埋め込み、それだけで同期させました。

貼り付けた歌詞は次のような形です。

[00:11.00]午前二時/フロアの灯りはひとつだけ
[00:17.80]青いモニターに/映るのは誰だろう
[00:47.90]夜明けまで*ログアウト*しない!
[01:12.70][間奏]

/はカットの切れ目、*で囲んだ語は強調、行末の!はフラッシュの指定です。書き出した素材では最初の歌詞が11.1秒に出ており、Whisperで取った歌い出しの11.0秒との差は0.1秒でした。JIZURAの「文字を声より0.2秒先に出す」仕様を考えても、ずれは0.3秒以内で、ほぼ狙いどおりです。

JIZURAの文字PVのプレビュー
参考:https://852wa.github.io/JIZURA/

なお曲を読み込むと、JIZURAがBPMと拍を自動で検出し、カットの切れ目を拍に寄せてくれます。今回はこの機能を使っていません。拍に合わせて文字を切り替えたい場合は、曲を読み込んでください。

あとはおまかせボタンで演出の案を出し、気に入ったものを書き出すだけです。最初の書き出しまでの操作は、筆者の体感で10〜15分でした。その後、曲名の入れ忘れと書き出し形式の選び間違いで、2回書き出し直しています。

映像と文字PVを合成して1本のMVにする

JIZURAの書き出し設定画面
参考:https://852wa.github.io/JIZURA/

合成の方法は2通りで、どちらもJIZURAの外で映像と重ねる前提です。ブラウザ版には映像を読み込む機能がなく、文字だけの素材を書き出して使います。

スクロールできます
方法JIZURAの書き出し重ねるツール
ブラウザ版+外部ツール透過PNG(ZIP)、またはグリーンバック・ブラックバックの素材Premiere・DaVinci Resolve・ffmpegなど
After Effects連携AE用の構成データ(JSON)、またはAE用のパネルAfter Effects(CEP版は2022以降)
JIZURAの文字PVを映像と合成する2つの方法(2026年9月時点)

AE連携については、作者のREADMEに「実機の AE ではまだ動かしていません」とあり、筆者も今回は試していません。

今回はブラウザ版から透過PNGを書き出し、Opus 5.5が書いたスクリプトでffmpegを動かして合成しました。書き出し時に「中央を空ける(キャラクター用)」をオンにすると、歌詞が左右に振り分けられ、中央の主人公が文字で隠れません。

中央を空けた設定のプレビュー
参考:https://852wa.github.io/JIZURA/

合成スクリプトは22の区間をつないだ映像に文字素材とSunoの曲を重ね、仕上げの合成は128秒で終わりました。

なお文字素材は720pで書き出し、合成時に1080pへ拡大しました。文字をくっきりさせたいなら、JIZURA側で1080p以上を選びましょう。

ffmpegやRemotionを使ってClaude Codeに動画編集を任せる方法は、以下の記事もあわせてご覧ください。

【実践・検証】完成したMVの品質と制作時間・費用

ここからは、完成したMVの品質・時間・費用を実測値で検証します。結論として、MiniMaxの実費は13.23ドル、作業の総経過時間は約3時間でした。

品質面では、主人公の見た目がほぼ全カットでそろい、歌詞と映像の場面もずれていません。一方で、指示の読み違いや文字PVの細かな不具合には人の手当てが必要でした。

完成したMVとカットごとの解説

見どころの1つめは、c02とc12の2カットです。テストとして最初に生成したc02では、参照画像のオフィスがモニターの縁の付箋まで再現され、ゆっくり近づくカメラも指示どおりでした。

c12では、疲れた表情から最後に微笑むまでの変化が描かれています。ただし「ガラスへの映り込み」という指示は途中から外れ、実際の顔を正面から撮った画に変わっていました。演出としては成立しているため、そのまま採用しています。

文字PVを重ねたMVの確認用カット

2つめは、夜から朝への色の変化です。c11では窓の外の空が紺から藍・紫へ移り、c14ではビルを出て走る主人公の背後で空がオレンジに染まっていきます。Opus 5.5が最初に決めた色の設計が、カットをまたいでも崩れていません。

文字PVを重ねたあとに10か所を抜き出して確認したところ、いずれも歌詞と映像の場面が一致していました。

人の手で作る場合との比較

今回の実費と時間を、制作会社などが公開している料金と比べました。MiniMaxの実費だけで見ると、リリックビデオの最安プランの7分の1以下です。

スクロールできます
項目今回(生成AI)リリックビデオ(小規模)実写MV(制作会社)
費用13.23ドル(約1,980円)+各サービスの月額1.5万円〜(税込)30万円〜(税別)/40万円〜
期間約3時間(2回に分けて作業)約1週間〜最短4週間
生成AIでのMV制作と人の手で作る場合の費用・期間の比較(2026年9月時点、1ドル150円換算)

リリックビデオはREGEKUL、実写MVはツムラオフィスとFILMOQの料金ページの値です。今回の費用にはSuno Pro(月10ドル)とClaudeのプラン代は含めていません。

ただし比べているものは同じではありません。実写MVは撮影や演出の専門家が関わり、リリックビデオも修正のやり取りが含まれます。生成AIで作ったMVは、あくまで「自分で判断して直す手間」と引き換えの安さです。

内訳はH3の映像生成が13.20ドル、image-01が0.0385ドルで、MiniMaxのコンソールで確認した残高の減り(13.23ドル)とほぼ一致しました。

プロ級に届いた点と届かなかった点

届いた点は、キャラクターの一貫性とカメラワークの再現度です。一方で、届かなかった点も3つあります。

スクロールできます
区分項目実際の結果
届いたキャラクターの一貫性見た目が明確にブレたのは18カット中1カット(c15)
届いたカメラワーク・演技本生成16カット中8カットが指示どおり。手の崩れも見当たらない
届かなかった否定の指示「湯気は立っていない」のc05で湯気が出た。c10では付箋の色が黄色から緑に変わった
届かなかったリップシンク・カットのつなぎ歌うカットは作らない設計にした。場面転換はすべて単純な切り替え
届かなかった文字PVの細部おまかせで画面をグレーの板が覆うレイアウトが選ばれ、該当する220コマだけ背景の濃さを25%に下げた
MVの品質でプロ級に届いた点と届かなかった点(筆者の検証結果)

特に場面転換は、カット同士を最初と最後のフレームでつないでいないため、商業MVのような凝ったつなぎはできていません。

総合すると、社内向けの映像や個人の作品としては十分通用する仕上がりです。一方、商業MVとして出すなら、カットの選び直しと文字演出の調整に人の手を残しておく必要があるでしょう。

AIでMVを作るときの注意点

生成AIで作ったMVを公開・商用利用する前には、権利の確認と公開先のルールの確認の2つを済ませておきましょう。どちらも2026年9月時点で規約やヘルプページが更新されており、以前の情報のままだと判断を誤るおそれがあります。

制作工程での注意点も、あわせて整理しておきます。今回つまずいたのはJIZURAの書き出しでした。

スクロールできます
つまずいた点対処
4GBを超えたZIPが開けなかった目次が壊れていたため、Opus 5.5に書かせたスクリプトで先頭から直接取り出した
「連番PNG(ZIP)」の素材が不透明だった映像に重ねる場合は「透過PNG(ZIP・背景なし)」を選び直す
曲名が「UNTITLED」と表示された曲名・アーティスト名の欄を埋めてから書き出す
JIZURAの書き出しでつまずいた点と対処(2026年9月時点)

4GBを超えたZIPは、ZIP64という大容量向けの形式に対応していないためとみられます。書き出す尺や解像度を上げるときは注意してください。

楽曲・映像の権利と商用利用の確認

商用利用の条件は、ツールごとに書かれ方がまったく違います。公開前に、それぞれの規約を原文で確認してください。

スクロールできます
ツール商用利用確認しておきたい点
SunoPro・Premierでダウンロードした曲は可商用の権利があっても著作権の保護は保証されない
MiniMax API生成物の所有権は利用者に残ると明記「商用利用を許諾する」という明文はない。AI生成であることの表示義務あり
JIZURA出力物は商用・非商用を問わず自由に使える出力物へのクレジット表記の義務は記載なし。歌詞と曲の権利は各権利者に帰属
MV制作で使ったツールの商用利用の条件(2026年9月時点)

根拠はSunoの利用規約と有料プランの権利に関するヘルプ、MiniMaxの利用規約、JIZURAのREADMEです。

YouTubeなどで公開するときのAI生成コンテンツの表示

YouTubeで公開するなら、アップロード時の[属性]にある[AI の使用]で[はい]を選んでおくのが安全です。YouTubeのヘルプページ「生成 AI コンテンツの使用に関する開示」では、開示が必要な例に「AI 生成の音楽」が挙げられています。

一方、フルアニメーションのように現実と見間違えない映像は、開示が不要な例に入っています。ただし音楽がAI生成である以上、今回のようなMVは開示しておくのが無難です。

同じページには、開示しても視聴者の制限や収益化の資格には影響しないと書かれています。逆に開示を繰り返し怠ると、動画の削除やパートナープログラムの停止につながる可能性があります。

生成AIで作った動画をYouTubeで運用するときのルールや収益化の基準は、以下の記事もあわせてご覧ください。

Opus 5.5を監督役にAIでのMV作りを始めよう

Opus 5.5を司令塔にすれば、作詞から絵コンテ、映像の一括生成、合成までMV制作の大部分を自動化できます。今回はMiniMaxの実費13.23ドル・約3時間で、2分55秒のMVが完成しました。一方で、否定の指示の読み違いやカット間のつなぎなど、採用の判断と仕上げの調整は人が担う部分として残っています。

とはいえ、複数の生成AIをつないだ仕組みを業務で安定して回すには、品質のチェック体制や権利の確認といった別の課題が出てきます。

「生成AIで新しいプロダクトを作りたい」「もっと本格的に生成AIを業務に組み込みたい」とお考えの方は、ぜひ株式会社WEELにご相談ください。

開発実績として、

・新規事業室での「リサーチ」「分析」「事業計画検討」を70%自動化するAIエージェント
・社内お問い合わせの1次回答を自動化するRAG型のチャットボット
・過去事例や最新情報を加味して、10秒で記事のたたき台を作成できるAIプロダクト
・お客様からのメール対応の工数を80%削減したAIメール
・サーバーやAI PCを活用したオンプレでの生成AI活用
・生徒の感情や学習状況を踏まえ、勉強をアシストするAIアシスタント

などの開発実績がございます。

生成AIを活用したプロダクト開発の支援内容は、以下のページでも詳しくご覧いただけます。
➡︎株式会社WEELのサービスを詳しく見る。

アイデア段階でも構いません。まずは無料相談でお気軽にご相談ください。
➡︎生成AIを活用したプロダクト開発・業務効率化について相談する

生成AIを社内で活用していきたい方へ
メルマガ登録

「生成AIを社内で活用したい」「生成AIの事業をやっていきたい」という方に向けて、通勤時間に読めるメルマガを配信しています。

最新のAI情報を日本最速で受け取りたい方は、以下からご登録ください。

また、弊社紹介資料もご用意しておりますので、併せてご確認ください。

よくある質問

プログラミングができなくても再現できますか?

はい、再現できます。今回のスクリプトはすべてOpus 5.5が書き、Claude Code上で実行まで行ったため、筆者がコードを書いた箇所はありません。

ただしClaude Codeの導入や、MiniMaxのAPIキーを環境変数に設定する作業は人が行います。ターミナルに初めて触れる場合は、準備に時間を見ておきましょう。

MiniMaxはAPIとHailuoアプリのどちらを使うべきですか?

カット数が多いMVならAPIをおすすめします。スクリプトから全カットを同時に送れるため、今回の18カットも待ち時間は約13分で済みました。

一方、Hailuoアプリは画面で1本ずつ操作するサービスで、月額プランのクレジットか、購入したクレジットを使って生成します。数カットだけ試したい場合や、プログラムを動かす環境がない場合はアプリのほうが手軽でしょう。有料プランの規約では商用利用が明記されています(Hailuo AIの購読規約)。

MV1本あたりの費用はどのくらいですか?

今回の2分55秒のMVでは、MiniMaxの実費が13.23ドル(約1,980円)でした。内訳は映像生成が13.20ドル、参照画像が約0.04ドルです。

これとは別に、Sunoの商用利用にProプラン(月10ドル)、Claude CodeにClaudeの有料プラン(Pro月20ドル〜)が必要です。3分・20カットで作り直しなしなら、H3の映像費は768Pで14.40ドルが目安になります。作り直しが増えるほど費用も上がる点に注意してください。

Opus 5.5以外のAIモデルでも同じことはできますか?

工程そのものは、ほかのモデルでも組めるはずです。映像や音楽は各サービスが生成しており、Opus 5.5が担うのは設計とスクリプトの作成だからです。

ただし今回検証したのはOpus 5.5だけで、ほかのモデルでの品質や手戻りの量は確かめていません。モデルを替える場合は、コンセプト設計と品質チェックの精度を小さなテストで確かめてから進めてください。

  • URLをコピーしました!
  • URLをコピーしました!
目次