AIで動画を作る方法を試して比べた:昔話「おむすびころりん」をずんだもんの語りで縦型動画に

ブログ

この1か月ほど、AI アシスタントに頼んでいろいろな方法で動画を作ってもらいました。コードで組み立てる縦型ショート、昔話の絵本動画、Gemini Notebook の動画解説。途中で「声を Gemini に替えられないか」も試しています。

この記事では、実際に試した方法を並べて、何ができたか・お金・手間・ハマったところを比べます。いちばん詳しく書くのは、昔話「おむすびころりん」をずんだもんの語りで2分30秒の縦型動画にした例です。本文中の [1] のような番号は、末尾の参考情報へのリンクです。

完成した「おむすびころりん」(2分30秒・縦型。この記事では720pで掲載)。ナレーション:VOICEVOX:ずんだもん/絵:AI生成(gpt-image-2)/原作:日本の昔話

AI で動画を作るなら:映像の作り方・音声の作り方

動画は「映像」と「音声」でできています。AI に作ってもらうときは、映像をどう作るかと音声をどう作るかを別々に選んで最後に合わせるか、両方まとめて作ってくれるサービスに任せるかのどちらかです。

映像を作る方法

方法どんなものか何ができるかお金試したか
RemotionReact で動画を書くライブラリ文字・図・字幕の画面をコードで1フレームずつ描いて動画にする。音声を重ねる役もこれがやる無料(個人と従業員3人までの会社は商用も無料)[8]試した(方法1・2)
HTML+CSS+GSAPWeb ページを作る技術と、動きをつけるライブラリブラウザに画面を描いて動きをつけ、動画として書き出す無料[26]試していない(TikTok の B さんの方法)
gpt-image-2OpenAI の画像生成 AI場面ごとの挿し絵を描かせる。Remotion でズームやクロスフェードをかけて動かす利用料がかかる[9]試した(方法2)
ComfyUI手元の PC で動かす画像生成ソフト自分の PC の GPU で絵を描く無料(GPU が必要)[25]試していない(GPU が無い)
Gemini(Web 版)Google の AI チャット指示文から数秒〜10秒の実写風の動画クリップを作るGemini アプリの生成枠(自分は有料プランで利用)試した(おまけ)
Runway動画生成 AI のサービス(API で利用)指示文や画像から数秒の動画クリップを作る1秒 $0.05〜(Gen-4 Turbo)[20]試していない
Higgsfield動画・画像生成 AI のサービス指示文や画像から動画・画像を作る。TikTok の A さんは、自分の顔の参照画像を使って同じ人物を出していたStarter プランで月 $15[21]試していない

音声を作る方法

方法どんなものか何ができるかお金試したか
VOICEVOX無料の読み上げソフトずんだもん・四国めたん・青山龍星といったキャラクターの声で、台本を一字一句そのまま読ませる無料。キャラクターごとの規約を守る[1][2]試した(方法1・2)
Gemini 3.8 Flash TTSGoogle の読み上げ AI(API で利用)自然な声で台本どおりに読ませる。声の演技も指示できるAPI に無料枠あり[18]まだ試していない(API キーを作っていない。方法4)
ElevenLabs読み上げ AI のサービス自然な声で台本を読ませる無料プランは商用不可。商用なら月 $6〜[23][24]試していない
自分の声マイクで録音本人の声で話す無料試していない(TikTok の B さんの方法)

映像と音声をまとめて作ってもらう方法

方法どんなものか何ができるかお金試したか
Gemini Notebook の動画解説Google の資料まとめサービスの機能資料を入れると、絵とナレーションの入った解説動画が丸ごとできる。台本どおりにはならないプランごとに1日の本数に上限[14]試した(方法3)

映像と音声を別々に作った場合は、最後に Remotion で1本にまとめ、ffmpeg で音量をそろえます。別々に作る方法は台本どおりになり、あとから1か所だけ直すのも簡単です。まとめて作ってもらう方法は手軽ですが、話す内容や絵を細かく決められません。

自分が試した組み合わせ

試したこと映像音声できたもの
方法1:コードで組み立てる縦型ショートRemotionVOICEVOX(青山龍星)縦型・38秒。無料
方法2:絵本型「おむすびころりん」gpt-image-2 の絵 + RemotionVOICEVOX(ずんだもん)縦型・2分30秒・絵16枚
方法3:Gemini Notebook の動画解説Gemini Notebook がまとめて作る横長・10分と5分の2本
方法4:声を Gemini の TTS に替える方法2のものを使う予定Gemini 3.8 Flash TTSまだ無い(未完)
おまけ:Gemini(Web 版)のクリップGemini(Web 版)クリップに付いてきた(記事では外した)横長・10秒
2026年9月に自分の環境で試した結果。料金は2026年9月30日時点の公式ページで確認

それぞれの手間やハマったところは、このあとの章に書いています。後半では、TikTok で見かけた3人のやり方と、検討して使わなかったサービスも紹介します。

方法1:コードで組み立てる縦型ショート(Remotion+VOICEVOX)

映像:Remotion/音声:VOICEVOX → 別々に作って合わせる

2026年9月9日に最初に作ったのがこれです。場面ごとの字幕・読み上げ原稿・秒数を JSON ファイル1枚に書くと、縦型の動画ができあがります。編集ソフトは使っていません。

縦型動画の4つの場面。「この動画、コードで作りました」の字幕、JSONの入力例、使っているツールの一覧、「該当ショットだけ作り直せる」の字幕
方法1で作った38.4秒のデモ動画から4場面。背景と字幕はすべてコードで描いている

流れは4段です。どこかで失敗すると、そこで止まります。

  1. 読み上げ:VOICEVOX で場面ごとに音声を作る。手元で動かせる無料の音声合成ソフトで、公式の Docker イメージもある[2][7]
  2. 組み立て:Remotion(React で動画を書くライブラリ)とヘッドレスの Chrome で、1フレームずつ描いて書き出す。Remotion は個人と従業員3人までの会社なら商用でも無料[8]
  3. 音量をそろえる:ffmpeg の loudnorm(EBU R128 に基づく音量正規化)[11] を2回かけて、-14 LUFS に合わせる。-14 LUFS は動画投稿でよく使われる目安で、各サービスの公式の目標値として確かめたものではありません
  4. 検品:場面数・尺・字幕の文字数・音量を実測して、決めた基準から外れていないか確かめる

動画の長さは、読み上げ音声の長さで自動的に決まります。直したい場面が出たら JSON を1行直すだけで、その場面の音声だけ作り直されます。外部のサービスにお金を払う部分はなく、CPU だけで書き出しまで約2分半でした。

ハマったのは字幕です。字幕を枠に収めるために文字を自動で縮める関数の引数を取り違えて、スペースを含む行だけ文字が極小になって消えていました。日本語だけの行は問題なく表示されるので、気づくのが遅れました。

なお、このデモの声は VOICEVOX の「青山龍星」です。後で書くとおり、青山龍星は企業や個人事業主の利用に事前申請が必要なので、この記事ではデモ動画そのものは載せず、静止画だけにしています。

方法2:絵本型「おむすびころりん」

映像:gpt-image-2 の絵 + Remotion/音声:VOICEVOX のずんだもん → 別々に作って合わせる

9月25日に「昔話を題材に、ずんだもんの読み上げで動画を作って」と頼んでできたのが冒頭の動画です。方法1の仕組みに挿し絵を足して、1場面=1枚の絵にしました。筋は原作どおりで、アレンジはひとつだけ。ねずみの宴にずんだ餅が出てきて、ずんだもんが「ねずみさん、わかってるのだ」と喜びます。

作り方の流れ

工程使ったものポイント
1. 台本テキスト語り・ねずみ・よくばりじいさんの3役。語尾は「のだ」
2. 絵OpenAI の gpt-image-2先にキャラ設定画を1枚描き、それを見本に16枚
3. 声VOICEVOX のずんだもん3役を、同じずんだもんのスタイル違いで演じ分け
4. 組み立てRemotion絵をゆっくり動かし、字幕を1行ずつ声に合わせる。尺は声の長さで決まる
5. 音量ffmpeg(loudnorm)-14 LUFS にそろえる
できあがりは 1080×1920・30fps・2分30秒

1. 台本

台本は「語り」「ねずみたち」「よくばりじいさん」の3役で書きました。1行ずつ別の音声ファイルにして、字幕もその行が読まれているあいだだけ出すようにしています。

読み間違い対策として、字幕に出す文字と読ませる文字を分けられるようにしました。たとえば「中から」は「ちゅうから」と読まれてしまうので、読ませる側だけ「なかから」にしています。合成する前に全行の読み(カナ)を出して確認すると、読み間違いを先に潰せます。

2. 絵:先にキャラ設定画を描かせる

絵は OpenAI の画像生成モデル gpt-image-2 で描きました。gpt-image-2 は2026年4月に公開されたモデルで、参照画像を渡して新しい画像を作ることができます[9][10]。

場面ごとにいきなり描かせると、場面が変わるたびにおじいさんの顔や服が変わってしまいます。そこで最初にキャラクター設定画を1枚描かせ、それを参照画像にして全場面を描かせました。

水彩風のキャラクター設定画。紺のつぎはぎの着物のおじいさん、茶色の着物に白い前掛けのおばあさん、灰緑の着物のよくばりじいさん、赤いはっぴにはちまきのねずみ3匹
最初に描かせたキャラクター設定画。これを見本にすべての場面を描いた(AI生成)

全場面に共通する指示として、次のようなことを英語で前置きしています。

  • 参照画像と同じ画風・キャラクターで描く(和紙に水彩と色鉛筆、温かい色合い)
  • 縦長 9:16 の構図
  • 主役は画面の上3分の2に置き、下4分の1は字幕を載せるので地面や紙の質感だけにする
  • 文字・署名は入れない

そのうえで、場面ごとに「お昼、切り株に座ったおじいさんの包みからおむすびが1つ転がり落ちる」のような説明を足しました。場面絵15枚とタイトル用の1枚で、1枚あたり1分弱かかりました。

3. 声:ずんだもん1人で3役

声は VOICEVOX のずんだもんです[3]。ずんだもんには声色の違う「スタイル」がいくつかあり、それを使って3役を演じ分けました[4]。

役スタイル(ID)調整
語りノーマル(3)話速を少し上げる
ねずみたちあまあま(1)声を少し高く、抑揚を強く
よくばりじいさんツンツン(7)声を少し低く、抑揚を強く
スタイル名と ID は VOICEVOX 公式の音声モデル一覧のもの

ずんだもんの声は商用・非商用どちらでも使えますが、「VOICEVOX:ずんだもん」のクレジット表記が必要です。動画サイトなら、説明欄や動画内のクレジットなど、見る人が気になったときにわかる場所に書くよう求められています[1][4]。この動画では最後の画面に入れ、この記事でも動画のすぐ下に書いています。

4. 組み立て:尺は声が決める

組み立ては方法1と同じく Remotion です。1場面につき絵を1枚使い、ゆっくりズームやパンをかけて(いわゆるケン・バーンズ効果)動きを出しています。場面の切り替えでは、声と字幕の位置を動かさないまま、絵だけを0.6秒ほど重ねてクロスフェードさせています。

動画の1場面。おばあさんがおじいさんにおむすびを渡す絵の下に「ある朝、おじいさんは、山へしばかりに出かけたのだ。」の字幕
字幕は画面の下、絵の「空けておいた」部分に出す

ここでハマったのが日本語の字幕の折り返しです。字幕を枠に収める関数は空白でしか行を分けないので、日本語だと1行のまま縮んで豆粒のような文字になりました。句読点で行を分ける処理を足し、それでも語の途中で分かれそうな行は台本側で改行を入れて対応しました。

動画の最後の画面。「おしまい」の文字と、ナレーション VOICEVOX:ずんだもん、絵 AI生成(gpt-image-2)、原作 日本の昔話「おむすびころりん」のクレジット
最後の画面にクレジットを入れている

5. 音量をそろえる

最後に方法1と同じく、ffmpeg の loudnorm で -14 LUFS にそろえています[11]。セリフの行ごとに別々に合成しているので、そろえないと役によって音量がばらつきます。

方法3:Gemini Notebook の動画解説

映像と音声:Gemini Notebook がまとめて作る

Gemini Notebook は、2026年7月に NotebookLM から名前が変わった Google のサービスです[12]。資料(ソース)を入れておくと、その内容をもとにした「動画解説」を作ってくれます。形式は「解説」「ショート動画」「シネマティック」から選べ、解説とショート動画は日本語にも対応しています。ホワイトボード風などのビジュアルスタイルや、何に焦点を当てるかの指示も付けられます[13]。

自分で用意した資料から、10分9秒のものと5分16秒のもの(1280×720)の横長の解説動画を作りました。台本を書く必要はなく、章立てや避けてほしい言い回しを指示するだけです。そのかわり、台本どおりにはなりません。生成には30分以上かかることがあり[13]、自分のときは長いと数時間かかりました。1日に作れる本数にはプランごとの上限があります[14]。

気をつけたいのは、資料に書いていないことを言い切ることがある点です。5分16秒の動画では、途中で「数多くの研究で報告されています」と話していましたが、入れた資料に研究論文は1本もありませんでした。音声を書き起こして資料と突き合わせたので気づけましたが、見ているだけだと聞き流してしまいそうです。公開する前に、一度書き起こして確かめるのがおすすめです。

方法4:声を Gemini の TTS に替える試み(未完)

音声:Gemini 3.8 Flash TTS に替える試み。映像は方法2のものを使う予定

おむすびころりんが完成したあと、「声を Gemini の読み上げ(TTS)に替えてみて」と頼みました。結論から言うと、まだ替えられていません。

Google は2026年9月23日に、読み上げモデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を発表しています。使える場所は Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook、Google Vids で、Web 版の Gemini アプリは挙がっていません[16][17]。

  • Web 版 Gemini:読み上げ音声のファイルを作ってと頼むと、「音声ファイルは作れない」と断られました(自分のときの結果)。
  • Gemini Notebook:3.8 Flash TTS が一般向けに入っている先です[16]。ところが、朗読台本を資料にして「一字一句そのまま読んで、解説は入れないで」と指示しても、「今回は日本の有名な昔話…から学べる本質をサクッと」と始まる解説番組になりました(自分のときの結果)。音声解説の形式は「Deep Dive」「Brief」「Critique」「Debate」で、どれも資料を解説する番組の形です[15]。
  • AI Studio/Gemini API:台本どおりに読ませるなら、こちらを使うことになります。料金ページでは gemini-3.8-flash-tts に無料枠(Free Tier)があり、有料でも出力音声10秒あたり $0.00225 相当(2026年12月31日まで)です[18]。新しいアカウントは無料枠から始まります[19]。

API を使うには API キーが必要で、まだ作っていないため試せていません。声を差し替えた動画もまだありません。

おまけ:Gemini(Web 版)で10秒のクリップ

映像:Gemini(Web 版)の動画生成。音声も付いてくる

Web 版の Gemini に「スキー板の滑走面にアイロンでワックスをかける様子を、8秒の実写風の動画で」と頼むと、2分ほどで10秒・1280×720 の動画が返ってきました(自分は有料プランの枠で利用)。音声トラックも付いてきましたが、記事で使うときは外して、無音のループ再生にしました。スキー・スノーボードのソール素材の記事に載せています。台本を読ませるような長い動画ではなく、記事の挿し絵代わりの短いクリップ向きです。

よその人のやり方:TikTok で見た3例

方法1を作る前に、TikTok で「毎日ショート動画を回す仕組み」を紹介している投稿を3本見て、やり方を分解しました[27][28][29]。どれも「ネタ決め → 台本 → 絵 → 声 → 合成 → 検品・投稿」という同じ流れで、違うのは各工程を何に任せるかでした。

A:Claude+MCP で寄せ集めB:HTML+CSS で描画C:JSON 台本+Discord 承認
映像と音声別々(映像は Higgsfield、声は ElevenLabs)別々(画面はコードで描き、声は録音)別々(映像は Runway と ComfyUI、声は Gemini の TTS)
台本再生数の分析をもとに作る。「台本を AI に丸投げするな」AI に書かせ、人は採用するかだけ決める場面ごとに JSON で構造化する
絵Higgsfield(MCP で Claude から呼ぶ)画像生成を使わず、HTML・CSS・GSAP で描く動画クリップは Runway、背景画像は手元の ComfyUI
声ElevenLabs本人の声を録音Gemini の TTS
検品・投稿完成したら投稿音量や字幕を自動で採点し、最後は目で見るDiscord に通知し、リアクションで承認したら投稿
2026年9月9日に見た投稿の内容を、画面のテロップやキャプションから読み取ったもの

方法1は、外部サービスにお金をかけない B のやり方と、台本を JSON にして数値で検品する C の設計をいいとこ取りしたものです。C は「月額0円」とうたっていましたが、動画クリップの生成に使っている Runway の API は有料なので[20]、そこは差し引いて見たほうがよさそうです。GSAP はいまは Webflow の支援で全機能が無料になっています[26]。

検討して使わなかったもの

サービス映像/音声できること料金(2026年9月30日時点)使わなかった理由
Runway API映像動画クリップの生成1クレジット $0.01。Gen-4 Turbo は1秒5クレジット($0.05/秒)、Gen-4.5 は1秒12クレジット($0.12/秒)[20]秒単位の従量課金。良い区間を切り出すために何本か作る前提だと、実際の単価は数倍になる
Higgsfield映像動画・画像の生成Starter $15/月(200クレジット)、Plus $49/月、Ultra $129/月[21]。MCP や CLI からの生成は、プランに関係なく必ずクレジットを消費する[22]自動化して使うと、定額プランでも毎回クレジットがかかる
ElevenLabs音声音声合成無料プランは月1万クレジットだが商用利用不可で、公開するならタイトルに elevenlabs.io などの表記が必要。商用ライセンス付きは Starter $6/月から[23][24]VOICEVOX で足りた
ComfyUI映像(静止画)手元の PC での画像生成無料(オープンソース)。手元の GPU で動かすのが前提で、CPU だけでも動く配布版はある[25]使っているマシンに GPU が無い
料金は各社の公式ページ・公式ブログで確認

VOICEVOX の規約は「ソフト」と「キャラ」で別

VOICEVOX を使うときに一番気をつけたいのがここです。最初は「無料で商用可、クレジット表記が必要」とひとまとめに理解していましたが、それは不正確でした。

  • ソフトの規約:VOICEVOX 自体は商用・非商用を問わず使え、VOICEVOX を使ったことがわかるクレジットが必要。作った音声を使うときは、各キャラクター(音声ライブラリ)の規約に従うこと、とされています[2]。
  • キャラクターの規約:キャラクターごとに条件が違います。
    • ずんだもん:商用・非商用とも利用可。「VOICEVOX:ずんだもん」のクレジットが必要[1][4]
    • 玄野武宏:商用・非商用とも利用可。「VOICEVOX:玄野武宏(CV:ガロ)」のようなクレジットが必要[6]
    • 青山龍星:個人ならクレジット表記で商用・非商用とも利用可。ただし企業・個人事業主などは、収益の有無にかかわらず「ななはぴ」への事前申請が必要。クレジットを外すこともできない[5][6]

キャラクターを選んだら、そのキャラクターの規約ページを一度読んでおくのが安全です。

まとめ

  • 映像と音声を別々に作る方法は台本どおりで直しやすく、セットで出てくる方法は手軽だが中身を細かく決められない
  • 台本どおりの動画を無料で作りたいなら、コードで組み立てる方法(Remotion+VOICEVOX)。尺は声が決め、直しも JSON 1行で済む
  • 絵本のような動画にするなら、先にキャラ設定画を描かせてから場面を描かせると、顔や服がそろう
  • 資料から手早く解説動画を作るなら Gemini Notebook。ただし台本どおりにはならず、資料に無いことを言い切ることがあるので、書き起こして確かめる
  • Gemini の声で台本を読ませたいなら、Web 版や Gemini Notebook ではなく AI Studio/Gemini API(無料枠あり)
  • VOICEVOX はキャラクターごとの規約を確認する。ずんだもんは「VOICEVOX:ずんだもん」のクレジットが必要

参考情報

VOICEVOX の規約・音声

  • [1] 東北ずん子・ずんだもんプロジェクト「音源利用規約」— 商用・非商用可、クレジット「VOICEVOX:ずんだもん」 リンク
  • [2] VOICEVOX「利用規約」— ソフトの規約。音声は各音声ライブラリの規約に従う リンク
  • [3] VOICEVOX「ずんだもん」 リンク
  • [4] VOICEVOX 公式「voicevox_vvm」— 音声モデルとスタイル ID の一覧、ずんだもんのクレジット条件 リンク
  • [5] VOICEVOX「青山龍星」— 企業が携わる利用は「ななはぴ」への事前確認が必要 リンク
  • [6] VirVox Project「VOICEVOXの利用規約」— 玄野武宏・白上虎太郎・青山龍星 リンク
  • [7] VOICEVOX ENGINE(GitHub)— Docker イメージ リンク

動画の組み立て・画像生成・音量

  • [8] Remotion「LICENSE」— 個人と従業員3人までの会社は商用でも無料 リンク
  • [9] OpenAI「gpt-image-2」モデルページ リンク
  • [10] OpenAI「Image generation」ガイド — 参照画像を使った生成 リンク
  • [11] FFmpeg Filters Documentation「loudnorm」— EBU R128 loudness normalization リンク

Gemini Notebook・Gemini の TTS

  • [12] Google「NotebookLM is now Gemini Notebook」(2026年7月16日) リンク
  • [13] Gemini Notebook ヘルプ「動画解説」— 形式、言語、ビジュアルスタイル、生成時間 リンク
  • [14] Gemini Notebook ヘルプ — プランごとの利用上限 リンク
  • [15] Gemini Notebook ヘルプ「Audio Overviews」— Deep Dive / Brief / Critique / Debate リンク
  • [16] Google「Gemini 3.8 Flash TTS」発表(2026年9月23日)— 提供先 リンク
  • [17] Gemini API「Release notes」— 3.8 Flash TTS / Flash-Lite TTS の一般提供 リンク
  • [18] Gemini API「Pricing」— gemini-3.8-flash-tts の無料枠と料金 リンク
  • [19] Gemini API「Billing」— 新規アカウントは Free Tier から リンク

使わなかったサービス・ライブラリ

  • [20] Runway API「Pricing」— 1クレジット $0.01、モデル別の秒あたりクレジット リンク
  • [21] Higgsfield 公式ブログ「Credits vs Unlimited AI Video Generation」(2026年9月15日)— プラン価格 リンク
  • [22] Higgsfield ヘルプ「How credits work」— MCP・CLI からの生成は必ずクレジットを消費 リンク
  • [23] ElevenLabs「Pricing」 リンク
  • [24] ElevenLabs ヘルプ「Can I publish the content I generate on the platform?」— 無料プランは商用不可 リンク
  • [25] ComfyUI(GitHub) リンク
  • [26] GSAP「Pricing」— Webflow の支援で全機能無料 リンク

参考にした TikTok の投稿

  • [27] TikTok 投稿 A(@ceomasayume) リンク
  • [28] TikTok 投稿 B(@user1717166941286) リンク
  • [29] TikTok 投稿 C(@bokuwalily) リンク

動画「おむすびころりん」のナレーションは VOICEVOX:ずんだもん、絵は OpenAI の gpt-image-2 による AI 生成です。料金・規約は2026年9月30日時点の各公式ページで確認しました。変わることがあるので、使う前に最新の情報を確かめてください。

コメント

タイトルとURLをコピーしました