この1か月ほど、AI アシスタントに頼んでいろいろな方法で動画を作ってもらいました。コードで組み立てる縦型ショート、昔話の絵本動画、Gemini Notebook の動画解説。途中で「声を Gemini に替えられないか」も試しています。
この記事では、実際に試した方法を並べて、何ができたか・お金・手間・ハマったところを比べます。いちばん詳しく書くのは、昔話「おむすびころりん」をずんだもんの語りで2分30秒の縦型動画にした例です。本文中の [1] のような番号は、末尾の参考情報へのリンクです。
AI で動画を作るなら:映像の作り方・音声の作り方
動画は「映像」と「音声」でできています。AI に作ってもらうときは、映像をどう作るかと音声をどう作るかを別々に選んで最後に合わせるか、両方まとめて作ってくれるサービスに任せるかのどちらかです。
映像を作る方法
| 方法 | どんなものか | 何ができるか | お金 | 試したか |
|---|---|---|---|---|
| Remotion | React で動画を書くライブラリ | 文字・図・字幕の画面をコードで1フレームずつ描いて動画にする。音声を重ねる役もこれがやる | 無料(個人と従業員3人までの会社は商用も無料)[8] | 試した(方法1・2) |
| HTML+CSS+GSAP | Web ページを作る技術と、動きをつけるライブラリ | ブラウザに画面を描いて動きをつけ、動画として書き出す | 無料[26] | 試していない(TikTok の B さんの方法) |
| gpt-image-2 | OpenAI の画像生成 AI | 場面ごとの挿し絵を描かせる。Remotion でズームやクロスフェードをかけて動かす | 利用料がかかる[9] | 試した(方法2) |
| ComfyUI | 手元の PC で動かす画像生成ソフト | 自分の PC の GPU で絵を描く | 無料(GPU が必要)[25] | 試していない(GPU が無い) |
| Gemini(Web 版) | Google の AI チャット | 指示文から数秒〜10秒の実写風の動画クリップを作る | Gemini アプリの生成枠(自分は有料プランで利用) | 試した(おまけ) |
| Runway | 動画生成 AI のサービス(API で利用) | 指示文や画像から数秒の動画クリップを作る | 1秒 $0.05〜(Gen-4 Turbo)[20] | 試していない |
| Higgsfield | 動画・画像生成 AI のサービス | 指示文や画像から動画・画像を作る。TikTok の A さんは、自分の顔の参照画像を使って同じ人物を出していた | Starter プランで月 $15[21] | 試していない |
音声を作る方法
| 方法 | どんなものか | 何ができるか | お金 | 試したか |
|---|---|---|---|---|
| VOICEVOX | 無料の読み上げソフト | ずんだもん・四国めたん・青山龍星といったキャラクターの声で、台本を一字一句そのまま読ませる | 無料。キャラクターごとの規約を守る[1][2] | 試した(方法1・2) |
| Gemini 3.8 Flash TTS | Google の読み上げ AI(API で利用) | 自然な声で台本どおりに読ませる。声の演技も指示できる | API に無料枠あり[18] | まだ試していない(API キーを作っていない。方法4) |
| ElevenLabs | 読み上げ AI のサービス | 自然な声で台本を読ませる | 無料プランは商用不可。商用なら月 $6〜[23][24] | 試していない |
| 自分の声 | マイクで録音 | 本人の声で話す | 無料 | 試していない(TikTok の B さんの方法) |
映像と音声をまとめて作ってもらう方法
| 方法 | どんなものか | 何ができるか | お金 | 試したか |
|---|---|---|---|---|
| Gemini Notebook の動画解説 | Google の資料まとめサービスの機能 | 資料を入れると、絵とナレーションの入った解説動画が丸ごとできる。台本どおりにはならない | プランごとに1日の本数に上限[14] | 試した(方法3) |
映像と音声を別々に作った場合は、最後に Remotion で1本にまとめ、ffmpeg で音量をそろえます。別々に作る方法は台本どおりになり、あとから1か所だけ直すのも簡単です。まとめて作ってもらう方法は手軽ですが、話す内容や絵を細かく決められません。
自分が試した組み合わせ
| 試したこと | 映像 | 音声 | できたもの |
|---|---|---|---|
| 方法1:コードで組み立てる縦型ショート | Remotion | VOICEVOX(青山龍星) | 縦型・38秒。無料 |
| 方法2:絵本型「おむすびころりん」 | gpt-image-2 の絵 + Remotion | VOICEVOX(ずんだもん) | 縦型・2分30秒・絵16枚 |
| 方法3:Gemini Notebook の動画解説 | Gemini Notebook がまとめて作る | 横長・10分と5分の2本 | |
| 方法4:声を Gemini の TTS に替える | 方法2のものを使う予定 | Gemini 3.8 Flash TTS | まだ無い(未完) |
| おまけ:Gemini(Web 版)のクリップ | Gemini(Web 版) | クリップに付いてきた(記事では外した) | 横長・10秒 |
それぞれの手間やハマったところは、このあとの章に書いています。後半では、TikTok で見かけた3人のやり方と、検討して使わなかったサービスも紹介します。
方法1:コードで組み立てる縦型ショート(Remotion+VOICEVOX)
映像:Remotion/音声:VOICEVOX → 別々に作って合わせる
2026年9月9日に最初に作ったのがこれです。場面ごとの字幕・読み上げ原稿・秒数を JSON ファイル1枚に書くと、縦型の動画ができあがります。編集ソフトは使っていません。

流れは4段です。どこかで失敗すると、そこで止まります。
- 読み上げ:VOICEVOX で場面ごとに音声を作る。手元で動かせる無料の音声合成ソフトで、公式の Docker イメージもある[2][7]
- 組み立て:Remotion(React で動画を書くライブラリ)とヘッドレスの Chrome で、1フレームずつ描いて書き出す。Remotion は個人と従業員3人までの会社なら商用でも無料[8]
- 音量をそろえる:ffmpeg の loudnorm(EBU R128 に基づく音量正規化)[11] を2回かけて、-14 LUFS に合わせる。-14 LUFS は動画投稿でよく使われる目安で、各サービスの公式の目標値として確かめたものではありません
- 検品:場面数・尺・字幕の文字数・音量を実測して、決めた基準から外れていないか確かめる
動画の長さは、読み上げ音声の長さで自動的に決まります。直したい場面が出たら JSON を1行直すだけで、その場面の音声だけ作り直されます。外部のサービスにお金を払う部分はなく、CPU だけで書き出しまで約2分半でした。
ハマったのは字幕です。字幕を枠に収めるために文字を自動で縮める関数の引数を取り違えて、スペースを含む行だけ文字が極小になって消えていました。日本語だけの行は問題なく表示されるので、気づくのが遅れました。
なお、このデモの声は VOICEVOX の「青山龍星」です。後で書くとおり、青山龍星は企業や個人事業主の利用に事前申請が必要なので、この記事ではデモ動画そのものは載せず、静止画だけにしています。
方法2:絵本型「おむすびころりん」
映像:gpt-image-2 の絵 + Remotion/音声:VOICEVOX のずんだもん → 別々に作って合わせる
9月25日に「昔話を題材に、ずんだもんの読み上げで動画を作って」と頼んでできたのが冒頭の動画です。方法1の仕組みに挿し絵を足して、1場面=1枚の絵にしました。筋は原作どおりで、アレンジはひとつだけ。ねずみの宴にずんだ餅が出てきて、ずんだもんが「ねずみさん、わかってるのだ」と喜びます。
作り方の流れ
| 工程 | 使ったもの | ポイント |
|---|---|---|
| 1. 台本 | テキスト | 語り・ねずみ・よくばりじいさんの3役。語尾は「のだ」 |
| 2. 絵 | OpenAI の gpt-image-2 | 先にキャラ設定画を1枚描き、それを見本に16枚 |
| 3. 声 | VOICEVOX のずんだもん | 3役を、同じずんだもんのスタイル違いで演じ分け |
| 4. 組み立て | Remotion | 絵をゆっくり動かし、字幕を1行ずつ声に合わせる。尺は声の長さで決まる |
| 5. 音量 | ffmpeg(loudnorm) | -14 LUFS にそろえる |
1. 台本
台本は「語り」「ねずみたち」「よくばりじいさん」の3役で書きました。1行ずつ別の音声ファイルにして、字幕もその行が読まれているあいだだけ出すようにしています。
読み間違い対策として、字幕に出す文字と読ませる文字を分けられるようにしました。たとえば「中から」は「ちゅうから」と読まれてしまうので、読ませる側だけ「なかから」にしています。合成する前に全行の読み(カナ)を出して確認すると、読み間違いを先に潰せます。
2. 絵:先にキャラ設定画を描かせる
絵は OpenAI の画像生成モデル gpt-image-2 で描きました。gpt-image-2 は2026年4月に公開されたモデルで、参照画像を渡して新しい画像を作ることができます[9][10]。
場面ごとにいきなり描かせると、場面が変わるたびにおじいさんの顔や服が変わってしまいます。そこで最初にキャラクター設定画を1枚描かせ、それを参照画像にして全場面を描かせました。

全場面に共通する指示として、次のようなことを英語で前置きしています。
- 参照画像と同じ画風・キャラクターで描く(和紙に水彩と色鉛筆、温かい色合い)
- 縦長 9:16 の構図
- 主役は画面の上3分の2に置き、下4分の1は字幕を載せるので地面や紙の質感だけにする
- 文字・署名は入れない
そのうえで、場面ごとに「お昼、切り株に座ったおじいさんの包みからおむすびが1つ転がり落ちる」のような説明を足しました。場面絵15枚とタイトル用の1枚で、1枚あたり1分弱かかりました。





3. 声:ずんだもん1人で3役
声は VOICEVOX のずんだもんです[3]。ずんだもんには声色の違う「スタイル」がいくつかあり、それを使って3役を演じ分けました[4]。
| 役 | スタイル(ID) | 調整 |
|---|---|---|
| 語り | ノーマル(3) | 話速を少し上げる |
| ねずみたち | あまあま(1) | 声を少し高く、抑揚を強く |
| よくばりじいさん | ツンツン(7) | 声を少し低く、抑揚を強く |
ずんだもんの声は商用・非商用どちらでも使えますが、「VOICEVOX:ずんだもん」のクレジット表記が必要です。動画サイトなら、説明欄や動画内のクレジットなど、見る人が気になったときにわかる場所に書くよう求められています[1][4]。この動画では最後の画面に入れ、この記事でも動画のすぐ下に書いています。
4. 組み立て:尺は声が決める
組み立ては方法1と同じく Remotion です。1場面につき絵を1枚使い、ゆっくりズームやパンをかけて(いわゆるケン・バーンズ効果)動きを出しています。場面の切り替えでは、声と字幕の位置を動かさないまま、絵だけを0.6秒ほど重ねてクロスフェードさせています。

ここでハマったのが日本語の字幕の折り返しです。字幕を枠に収める関数は空白でしか行を分けないので、日本語だと1行のまま縮んで豆粒のような文字になりました。句読点で行を分ける処理を足し、それでも語の途中で分かれそうな行は台本側で改行を入れて対応しました。

5. 音量をそろえる
最後に方法1と同じく、ffmpeg の loudnorm で -14 LUFS にそろえています[11]。セリフの行ごとに別々に合成しているので、そろえないと役によって音量がばらつきます。
方法3:Gemini Notebook の動画解説
映像と音声:Gemini Notebook がまとめて作る
Gemini Notebook は、2026年7月に NotebookLM から名前が変わった Google のサービスです[12]。資料(ソース)を入れておくと、その内容をもとにした「動画解説」を作ってくれます。形式は「解説」「ショート動画」「シネマティック」から選べ、解説とショート動画は日本語にも対応しています。ホワイトボード風などのビジュアルスタイルや、何に焦点を当てるかの指示も付けられます[13]。
自分で用意した資料から、10分9秒のものと5分16秒のもの(1280×720)の横長の解説動画を作りました。台本を書く必要はなく、章立てや避けてほしい言い回しを指示するだけです。そのかわり、台本どおりにはなりません。生成には30分以上かかることがあり[13]、自分のときは長いと数時間かかりました。1日に作れる本数にはプランごとの上限があります[14]。
気をつけたいのは、資料に書いていないことを言い切ることがある点です。5分16秒の動画では、途中で「数多くの研究で報告されています」と話していましたが、入れた資料に研究論文は1本もありませんでした。音声を書き起こして資料と突き合わせたので気づけましたが、見ているだけだと聞き流してしまいそうです。公開する前に、一度書き起こして確かめるのがおすすめです。
方法4:声を Gemini の TTS に替える試み(未完)
音声:Gemini 3.8 Flash TTS に替える試み。映像は方法2のものを使う予定
おむすびころりんが完成したあと、「声を Gemini の読み上げ(TTS)に替えてみて」と頼みました。結論から言うと、まだ替えられていません。
Google は2026年9月23日に、読み上げモデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を発表しています。使える場所は Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook、Google Vids で、Web 版の Gemini アプリは挙がっていません[16][17]。
- Web 版 Gemini:読み上げ音声のファイルを作ってと頼むと、「音声ファイルは作れない」と断られました(自分のときの結果)。
- Gemini Notebook:3.8 Flash TTS が一般向けに入っている先です[16]。ところが、朗読台本を資料にして「一字一句そのまま読んで、解説は入れないで」と指示しても、「今回は日本の有名な昔話…から学べる本質をサクッと」と始まる解説番組になりました(自分のときの結果)。音声解説の形式は「Deep Dive」「Brief」「Critique」「Debate」で、どれも資料を解説する番組の形です[15]。
- AI Studio/Gemini API:台本どおりに読ませるなら、こちらを使うことになります。料金ページでは gemini-3.8-flash-tts に無料枠(Free Tier)があり、有料でも出力音声10秒あたり $0.00225 相当(2026年12月31日まで)です[18]。新しいアカウントは無料枠から始まります[19]。
API を使うには API キーが必要で、まだ作っていないため試せていません。声を差し替えた動画もまだありません。
おまけ:Gemini(Web 版)で10秒のクリップ
映像:Gemini(Web 版)の動画生成。音声も付いてくる
Web 版の Gemini に「スキー板の滑走面にアイロンでワックスをかける様子を、8秒の実写風の動画で」と頼むと、2分ほどで10秒・1280×720 の動画が返ってきました(自分は有料プランの枠で利用)。音声トラックも付いてきましたが、記事で使うときは外して、無音のループ再生にしました。スキー・スノーボードのソール素材の記事に載せています。台本を読ませるような長い動画ではなく、記事の挿し絵代わりの短いクリップ向きです。
よその人のやり方:TikTok で見た3例
方法1を作る前に、TikTok で「毎日ショート動画を回す仕組み」を紹介している投稿を3本見て、やり方を分解しました[27][28][29]。どれも「ネタ決め → 台本 → 絵 → 声 → 合成 → 検品・投稿」という同じ流れで、違うのは各工程を何に任せるかでした。
| A:Claude+MCP で寄せ集め | B:HTML+CSS で描画 | C:JSON 台本+Discord 承認 | |
|---|---|---|---|
| 映像と音声 | 別々(映像は Higgsfield、声は ElevenLabs) | 別々(画面はコードで描き、声は録音) | 別々(映像は Runway と ComfyUI、声は Gemini の TTS) |
| 台本 | 再生数の分析をもとに作る。「台本を AI に丸投げするな」 | AI に書かせ、人は採用するかだけ決める | 場面ごとに JSON で構造化する |
| 絵 | Higgsfield(MCP で Claude から呼ぶ) | 画像生成を使わず、HTML・CSS・GSAP で描く | 動画クリップは Runway、背景画像は手元の ComfyUI |
| 声 | ElevenLabs | 本人の声を録音 | Gemini の TTS |
| 検品・投稿 | 完成したら投稿 | 音量や字幕を自動で採点し、最後は目で見る | Discord に通知し、リアクションで承認したら投稿 |
方法1は、外部サービスにお金をかけない B のやり方と、台本を JSON にして数値で検品する C の設計をいいとこ取りしたものです。C は「月額0円」とうたっていましたが、動画クリップの生成に使っている Runway の API は有料なので[20]、そこは差し引いて見たほうがよさそうです。GSAP はいまは Webflow の支援で全機能が無料になっています[26]。
検討して使わなかったもの
| サービス | 映像/音声 | できること | 料金(2026年9月30日時点) | 使わなかった理由 |
|---|---|---|---|---|
| Runway API | 映像 | 動画クリップの生成 | 1クレジット $0.01。Gen-4 Turbo は1秒5クレジット($0.05/秒)、Gen-4.5 は1秒12クレジット($0.12/秒)[20] | 秒単位の従量課金。良い区間を切り出すために何本か作る前提だと、実際の単価は数倍になる |
| Higgsfield | 映像 | 動画・画像の生成 | Starter $15/月(200クレジット)、Plus $49/月、Ultra $129/月[21]。MCP や CLI からの生成は、プランに関係なく必ずクレジットを消費する[22] | 自動化して使うと、定額プランでも毎回クレジットがかかる |
| ElevenLabs | 音声 | 音声合成 | 無料プランは月1万クレジットだが商用利用不可で、公開するならタイトルに elevenlabs.io などの表記が必要。商用ライセンス付きは Starter $6/月から[23][24] | VOICEVOX で足りた |
| ComfyUI | 映像(静止画) | 手元の PC での画像生成 | 無料(オープンソース)。手元の GPU で動かすのが前提で、CPU だけでも動く配布版はある[25] | 使っているマシンに GPU が無い |
VOICEVOX の規約は「ソフト」と「キャラ」で別
VOICEVOX を使うときに一番気をつけたいのがここです。最初は「無料で商用可、クレジット表記が必要」とひとまとめに理解していましたが、それは不正確でした。
- ソフトの規約:VOICEVOX 自体は商用・非商用を問わず使え、VOICEVOX を使ったことがわかるクレジットが必要。作った音声を使うときは、各キャラクター(音声ライブラリ)の規約に従うこと、とされています[2]。
- キャラクターの規約:キャラクターごとに条件が違います。
キャラクターを選んだら、そのキャラクターの規約ページを一度読んでおくのが安全です。
まとめ
- 映像と音声を別々に作る方法は台本どおりで直しやすく、セットで出てくる方法は手軽だが中身を細かく決められない
- 台本どおりの動画を無料で作りたいなら、コードで組み立てる方法(Remotion+VOICEVOX)。尺は声が決め、直しも JSON 1行で済む
- 絵本のような動画にするなら、先にキャラ設定画を描かせてから場面を描かせると、顔や服がそろう
- 資料から手早く解説動画を作るなら Gemini Notebook。ただし台本どおりにはならず、資料に無いことを言い切ることがあるので、書き起こして確かめる
- Gemini の声で台本を読ませたいなら、Web 版や Gemini Notebook ではなく AI Studio/Gemini API(無料枠あり)
- VOICEVOX はキャラクターごとの規約を確認する。ずんだもんは「VOICEVOX:ずんだもん」のクレジットが必要
参考情報
VOICEVOX の規約・音声
- [1] 東北ずん子・ずんだもんプロジェクト「音源利用規約」— 商用・非商用可、クレジット「VOICEVOX:ずんだもん」 リンク
- [2] VOICEVOX「利用規約」— ソフトの規約。音声は各音声ライブラリの規約に従う リンク
- [3] VOICEVOX「ずんだもん」 リンク
- [4] VOICEVOX 公式「voicevox_vvm」— 音声モデルとスタイル ID の一覧、ずんだもんのクレジット条件 リンク
- [5] VOICEVOX「青山龍星」— 企業が携わる利用は「ななはぴ」への事前確認が必要 リンク
- [6] VirVox Project「VOICEVOXの利用規約」— 玄野武宏・白上虎太郎・青山龍星 リンク
- [7] VOICEVOX ENGINE(GitHub)— Docker イメージ リンク
動画の組み立て・画像生成・音量
- [8] Remotion「LICENSE」— 個人と従業員3人までの会社は商用でも無料 リンク
- [9] OpenAI「gpt-image-2」モデルページ リンク
- [10] OpenAI「Image generation」ガイド — 参照画像を使った生成 リンク
- [11] FFmpeg Filters Documentation「loudnorm」— EBU R128 loudness normalization リンク
Gemini Notebook・Gemini の TTS
- [12] Google「NotebookLM is now Gemini Notebook」(2026年7月16日) リンク
- [13] Gemini Notebook ヘルプ「動画解説」— 形式、言語、ビジュアルスタイル、生成時間 リンク
- [14] Gemini Notebook ヘルプ — プランごとの利用上限 リンク
- [15] Gemini Notebook ヘルプ「Audio Overviews」— Deep Dive / Brief / Critique / Debate リンク
- [16] Google「Gemini 3.8 Flash TTS」発表(2026年9月23日)— 提供先 リンク
- [17] Gemini API「Release notes」— 3.8 Flash TTS / Flash-Lite TTS の一般提供 リンク
- [18] Gemini API「Pricing」— gemini-3.8-flash-tts の無料枠と料金 リンク
- [19] Gemini API「Billing」— 新規アカウントは Free Tier から リンク
使わなかったサービス・ライブラリ
- [20] Runway API「Pricing」— 1クレジット $0.01、モデル別の秒あたりクレジット リンク
- [21] Higgsfield 公式ブログ「Credits vs Unlimited AI Video Generation」(2026年9月15日)— プラン価格 リンク
- [22] Higgsfield ヘルプ「How credits work」— MCP・CLI からの生成は必ずクレジットを消費 リンク
- [23] ElevenLabs「Pricing」 リンク
- [24] ElevenLabs ヘルプ「Can I publish the content I generate on the platform?」— 無料プランは商用不可 リンク
- [25] ComfyUI(GitHub) リンク
- [26] GSAP「Pricing」— Webflow の支援で全機能無料 リンク
参考にした TikTok の投稿
- [27] TikTok 投稿 A(@ceomasayume) リンク
- [28] TikTok 投稿 B(@user1717166941286) リンク
- [29] TikTok 投稿 C(@bokuwalily) リンク
動画「おむすびころりん」のナレーションは VOICEVOX:ずんだもん、絵は OpenAI の gpt-image-2 による AI 生成です。料金・規約は2026年9月30日時点の各公式ページで確認しました。変わることがあるので、使う前に最新の情報を確かめてください。


コメント