トップページ / コラム / 豊臣秀吉の1分動画を、AIに丸ごと任せてみた|Gemini 3.8 TTSとClaude Opus 5.5で、依頼から25分で完成した制作の全記録

豊臣秀吉の1分動画を、AIに丸ごと任せてみた|Gemini 3.8 TTSとClaude Opus 5.5で、依頼から25分で完成した制作の全記録

貝出康

代表取締役

貝出康

豊臣秀吉の1分動画を、AIに丸ごと任せてみた|Gemini 3.8 TTSとClaude Opus 5.5で、依頼から25分で完成した制作の全記録

「1分の歴史解説動画を作ってください」

これ、ふつうに頼むとどうなると思いますか。台本を書く人がいて、ナレーションを読む人がいて、映像を作る人がいて、字幕を入れる人がいる。1分の動画でも、何日もかかることは珍しくないですよね。

2026年9月24日の夜、私はこれをAIに1文で頼みました。主役は、前日の9月23日に公開されたばかりのGoogleの音声合成AI「Gemini 3.8 TTS」と、その前日に発表されたAnthropicの「Claude Opus 5.5」の2つ。どちらも出たばかりのAIです。途中では確認役の別のClaudeや、文字起こしのAIも動いていますが、それもOpus 5.5が自分で呼び出していました。

19時38分に頼んで、20時03分には60秒の動画ファイルが手元にありました。

私がやったことは3つしかありません。1文で頼む。途中で聞かれた質問に1回だけ答える。できあがった動画を見る。台本も、事実確認も、声も、映像も、字幕も、検品も、全部AIがやりました。

しかも途中で、AIは自分が作った画面を見て「字幕が炎に重なって読めない」と気づき、自分で直していたんです。

その25分間に何が起きていたのかを、順番に書いていきます。

このページの目次

まずは完成した動画を見てください

「豊臣秀吉の生涯を1分で」、59.9秒の動画です。音声が出ます。台本と映像はClaude Opus 5.5、ナレーションはGemini 3.8 TTSが担当しました。BGMは入れていません。

完成した動画「豊臣秀吉の生涯を1分で」から切り出した9場面の一覧。タイトル、1537年の出自、木下藤吉郎から羽柴秀吉への改名、本能寺の変、中国大返し、天下統一、太閤検地と刀狩、晩年、縦書きの辞世の句

全部で9つの場面があります。低い身分に生まれた秀吉が、織田信長に仕え、本能寺の変のあと「中国大返し」で京へ引き返して山崎の戦いで明智光秀を破り、関白になって天下を統一する。太閤検地と刀狩で社会の仕組みを変え、朝鮮出兵のさなかに伏見城で亡くなる。最後は辞世と伝わる句を縦書きで見せて終わります。

画面の右側には「出世の階段」があって、金色の瓢箪(秀吉の馬印にちなんだ千成瓢箪です)が1段ずつ登っていきます。下の年表バーも、ナレーションに合わせて1537年から1598年へと進んでいく仕掛けです。

ここまでの構成も色も演出も、私は何ひとつ指定していません。

主役のAIは2つ。役割はこう分かれた

声の担当:Gemini 3.8 TTS

Gemini 3.8 TTSは、Googleが2026年9月23日に公式ブログで発表した音声合成のモデルです。文章を渡すと、それを読み上げた音声が返ってきます。モデルは品質重視の「gemini-3.8-flash-tts」と、安くて速い「gemini-3.8-flash-lite-tts」の2種類。今回は品質重視のFlashを使いました。

Googleは、Flashを「細かな演出やキャラクターづくり向け」、Flash-Liteを「大量に低コストで作る用途向け」と位置づけています。あらかじめ用意された30種類の声に加えて、言語や地域のアクセントごとの声を集めたライブラリがあります。その数は、公式ブログでは2,000以上、APIの説明書では数百と書かれていて、表記がそろっていません。私たちの環境でAPIから日本語の声を一覧にすると、2026年9月24日時点で115件が出てきました。

ほかにも、文章で説明して新しい声を作る「Voice design」、笑い声やため息を入れる音声タグ(<laugh> など)、2人の掛け合いを1回で作る機能があります。

今回選ばれた声は、日本語の声の一覧にある「東京のアクセントで話す60代の男性」の声でした。AIの作業記録には「秀吉は尾張(今の愛知県)の出身なので、関西や九州のアクセントの声は避ける」という判断が残っていました。

台本と映像の担当:Claude Opus 5.5

Claude Opus 5.5は、Anthropicが2026年9月22日に発表した、新しい「Claude 5.5」ファミリーの最初のモデルです。APIの料金は100万トークンあたり入力4ドル・出力20ドルで、前のOpus 5(入力5ドル・出力25ドル)から下がりました。Claude Code、Claude.ai、APIのほか、AWS、Google Cloud、Microsoft Azureでも使えます。

今回はデスクトップアプリの「Claude Code」から使いました。台本を書き、構成を決め、音声を生成するプログラムを動かし、映像を作り、検品するところまでを1つの流れで進めています。

面白いのは、Opus 5.5が「自分の仕事を自分だけで合格にしなかった」ところです。事実確認と検品は、別に立てたAI(Claude Sonnet 5)に独立してやらせていました。書いた本人とチェックする人を分ける。人間の仕事の進め方と同じですよね。

映像は動画生成AIを使わず、コードで描いた

ここ、意外だと思います。文章から映像を丸ごと作る「動画生成AI」は、今回は使っていません。

Opus 5.5は、画面をHTMLとCSS(Webページを作るときの言語です)で描き、アニメーションもプログラムで書きました。それを「HyperFrames」という道具で、1コマずつ撮影するようにMP4に書き出しています。

HyperFramesは、AI動画サービスのHeyGenがオープンソース(Apache-2.0ライセンス)で公開している道具です。GitHubの説明文は「Write HTML. Render video. Built for agents.」。HTMLを書けば動画になり、AIエージェントが使うことを前提に作られています。

なぜこのやり方なのか。理由は3つです。

  • 年号や人名などの文字が、1文字も崩れずに出る
  • 「字幕を少し上に」のような細かい直しをしても、狙った場所しか変わらない
  • 何度書き出しても同じ結果になる

解説動画は、画面の文字が1つ違うだけで信用を失います。だから今回は「きれいな映像」より「正確な文字」を優先した作り方になっています。

  • 声:Gemini 3.8 Flash TTS。日本語の男性の声を1つ選び、場面ごとに8本に分けて生成
  • 台本・映像・工程の指揮:Claude Opus 5.5。Claude Codeの中で全工程を進めた
  • 事実確認と検品:別に立てたAI(Claude Sonnet 5)が、作り手とは独立してチェック
  • 動画への書き出し:HyperFrames。HTMLで作った画面を1コマずつMP4にする
  • 読みの確認:手元のパソコンで動く文字起こしAI(whisper)で、完成した音声を文字に起こして確認

私がやったのは「1文の依頼」と「1問への回答」だけ

1文の依頼から60秒の動画ができるまでの8工程の図。依頼と画面比率への回答と最後の試聴は人、台本と映像はClaude Opus 5.5、事実確認と検品は別のAI(Sonnet 5)、音声はGemini 3.8 Flash TTSが担当。19時38分に依頼し20時03分に完成

私が送った依頼は、これだけです。

Opus5.5とGemini 3.8 TTSを使って、豊臣秀吉の生涯をテーマにした1分動画を作成してください。

長さの配分も、声の種類も、画面のデザインも書いていません。

途中でAIから質問が1つだけ来ました。「画面は横型(16:9)と縦型(9:16)のどちらにしますか」。選択肢の先頭には、縦型が「推奨」として置かれていました。直前の作業で、私が縦型のショート動画の話をしていたのを踏まえた提案です。

私はこう答えました。

カンマンブログで紹介したい。それに適した方で。

これでAIは横型を選びました。ブログの記事の幅に、そのまま収まる形だからです。

ここで大事なのは、AIが人に聞いたのは「答えによって作るものが変わる1点」だけだったことです。声の種類や色づかいは聞かれませんでした。それはAIが自分で決められる。でも縦か横かは、どこで見せるかを知っている人にしか決められない。聞くべきことと、聞かなくていいことを分けていたんです。

25分の中身:AIが自分で決めていたこと

①台本を「字幕用」と「読み上げ用」の2列で書いた

最初に感心したのがここでした。Gemini 3.8 TTSは、渡した文章を一字一句そのまま読みます。漢字の読みを間違えると、それもそのまま読まれてしまう。

そこでOpus 5.5は、台本を2列で持ちました。画面の字幕に出す文と、読み上げ用に渡す文です。読み上げ用では、読み間違えやすい言葉をひらがなに開いています。

字幕に出す文字読み上げ用に渡した文字
尾張おわり
木下藤吉郎きのしたとうきちろう
羽柴秀吉はしば秀吉
中国大返しちゅうごくおおがえし
豊臣の姓を賜りとよとみの姓をたまわり
太閤検地と刀狩たいこうけんちと、かたながり
伏見城ふしみじょう
1分でいっぷんで

「1分」を「いちぶん」と読まれたら、それだけで台なしです。字幕は漢字で読みやすく、声は正しく。字幕と読み上げの文を分けて持つのが、AIナレーションで失敗しないいちばんの工夫だと思います。

②書く前に、別のAIに事実確認させた

台本ができた時点で、Opus 5.5は音声を作る前に、別のAIにウェブ上の資料で事実を確認させました。映像は台本の上に組むので、先に文字を確定させる順番です。

確認の結果、年号や出来事の順番はすべて資料と合っていました。そのうえで、2か所の書き方が直されています。

  • 出自:最初の台本は「農民から天下人へ」。父親には百姓とする説と足軽とする説があり、言い切れないため「低い身分から」に変更
  • 辞世の句:地名の部分は表記に揺れがあるため、引用例の多い「なにわ」に統一。「辞世の句」と断定せず「辞世と伝わる句」と表現
  • 生年:1537年は通説で、1536年とする説もある。画面に「※生年は1536年とする説もあります」と注記

「農民から天下人へ」は、秀吉を紹介するときによく使われる言い方です。私も何の疑問も持っていませんでした。でも、公開する動画としては慎重なほうがいい。人間だと見過ごしやすい「よく聞く言い方」ほど、確認の対象にしていたのが印象に残りました。

③60秒に収まらない。AIは早口にせず、文を削った

ここが今回いちばん苦労したところです(苦労したのはAIですが)。

まずOpus 5.5は、同じ1文を3通りの話し方で読ませて、長さを測りました。

話し方の指定29文字の1文を読んだ長さ
落ち着いた歴史ドキュメンタリー調6.8秒
指定なし5.5秒
テンポよく歯切れのよい歴史解説番組調5.4秒

同じ文でも、指定ひとつで2割ほど長さが変わります。重厚なドキュメンタリー調は雰囲気が出ますが、1分に収めるには遅すぎる。そこで「テンポよく」を採用しました。

それでも、最初の台本(273文字)を全部読ませると、ナレーションだけで63.7秒ありました。前後の間や最後の画面を足すと、1分を大きく超えます。

このとき、AIは音声を早回しにしませんでした。文を削ったんです。「頭角を現し」を削る。「ついに」を削る。辞世の句の前置き「辞世と伝わる句」は読み上げから外して、画面の見出しに回す。文の途中の長すぎる間は、0.35秒までに詰める。

結果、読み上げる台本は246文字、ナレーションは合計53.8秒。動画全体で59.9秒に収まりました。

実際にやってみて分かった目安があります。60秒の解説動画なら、読み上げる台本は250文字前後が上限です。1分の動画を作るなら、書いた台本の文字数をまず数えてみてください。

④映像はHTMLで描いて、声の長さから画面の切り替えを計算した

映像づくりでOpus 5.5がこだわっていたのは「毎回同じ仕掛けで、話の進み具合を見せる」ことでした。

  • 出世の階段:低い身分、信長の家臣、長浜城主、関白、天下人の5段。瓢箪がナレーションに合わせて登る
  • 年表バー:1537年から1598年までの線の上を、光る点が進む
  • 場面ごとの絵:本能寺の変は炎、中国大返しは備中高松から京・山崎への矢印、豊臣の姓は朱色の印、晩年は沈む夕日
  • 辞世の句:縦書きで、読み上げに合わせて1列ずつ浮かび上がる

画面の切り替えのタイミングは、手で打ち込んでいません。できあがった8本の音声の長さを測り、その数字から計算しています。だから、あとで1場面の声を作り直しても、画面が自動でずれずについてきます。

色は金と墨と朱。見出しの文字には、Macに入っている明朝体の「凸版文久見出し明朝」を使っていました。このあたりのセンスも、全部AIの判断です。

AIは自分の作った画面を見て、5か所直していた

映像ができた時点で、自動のチェックはすべて合格していました。表示の崩れはなし、文字と背景のコントラストも51か所すべて基準を満たしている、という結果です。

普通なら、ここで書き出して終わりにしそうなものです。でもOpus 5.5は、動画の途中10か所を静止画にして、自分で目を通しました。そして5つの不具合を見つけています。

AIが検品で直した画面の修正前と修正後の比較。本能寺の変で字幕に重なっていた炎を字幕帯の上で切った例、刀狩で箱に隠れていた刀の刃先を見せた例、辞世の句で隣の列に折り返していた「も」を列に収めた例。左の修正前は当時の設定を再現して描き直したもの
  1. 本能寺の変:炎が字幕と年表バーに重なって、字幕が読めない
  2. 天下統一:「豊臣」の印が、文字の最後にくっついている
  3. 刀狩:刀が箱の中にすっぽり隠れて、空の箱にしか見えない
  4. 晩年:「1598」と「伏見城で死去」の間が詰まりすぎている
  5. 辞世の句:「なにわのことも」の「も」だけが、隣の列に折り返している

上の比較図の左側は、これらの直し方だけを当時の設定に戻して描き直したものです。右が完成品です。

5番目の「も」の折り返しは、正直、私が見ても気づかなかったと思います。縦書きの句で1文字だけ列がずれていたら、見る人には「なんか変」としか伝わらない。自動のチェックが合格でも、人の目(ここではAIの目)で見ないと分からない不具合がある。これは人間のデザイナーの仕事でもまったく同じです。

直したあとも、確認は続きました。

  • 別のAIによる検品:27枚の静止画を、台本と1文字ずつ照らし合わせる。結果は「直すべき点なし」
  • 音声の文字起こし:完成したMP4の音声を、手元のパソコンの中で文字に起こす。8本のナレーションが抜けなく順番どおり入っていることを確認
  • 読みの確認:文字起こしで、固有名詞の音が合っているかを見る

おもしろかったのは文字起こしの結果です。「尾張」は「終わり」、「羽柴」は「橋場」、「近世」は「金星」と書き起こされていました。これは読み間違いではありません。音は正しく「おわり」「はしば」「きんせい」と読めていて、文字起こしの側が同じ音の別の漢字を当てただけなんです。だから、こうした確認は「音が合っているか」で判断します。

とはいえ、最後の確認は人の耳でするしかありません。AIからも「羽柴」「藤吉郎」「なにわ」「伏見城」の4語は、人が聞いて確かめてほしいと頼まれました。

数字で見る今回の制作

項目数字
依頼から完成MP4まで約25分(19:38→20:03)
人が関わった回数3回(依頼・1問への回答・完成品の確認)
動画の長さ59.9秒(1920×1080・30fps)
場面の数9
読み上げる台本246文字
ナレーション8本・合計53.8秒
音声の費用(Gemini 3.8 TTS)約0.04ドル(試し録りを含む)
事実確認で直した表現2か所
検品で直した画面の不具合5か所
動画の書き出しにかかった時間約28秒
完成ファイルの大きさ13.8MB

費用は、Gemini 3.8 TTSで音声を作った分だけの金額です。Claude側の利用料や、アイキャッチの画像生成の費用は含めていません。

それにしても、音声の費用が約0.04ドル。試し録りを含めて、です。

公式の料金表では、Flashの音声出力は100万トークンあたり9ドルです(2026年12月31日までの価格で、2027年1月1日からは18ドル)。音声1分にすると1〜2セント程度。今回の0.04ドルには、声の聞き比べや、長すぎて作り直した分も入っています。

プロの目で見た「足りないところ」

ここまで褒めてきましたが、ウェブ制作の仕事をしている立場から、正直に足りないところも書いておきます。

  • BGMがない:ナレーションだけなので、少し静かすぎる
  • 声の表情は控えめ:聞き取りやすい一方で、ニュースを読むような落ち着いた調子。ドラマのような抑揚はない
  • 絵は図形とアイコンが中心:実写やイラストの迫力はない。刀狩の刀は、細い棒のように見える
  • 同じ図が続く:出世の階段が3つの場面に出てくるので、単調に感じる人もいそう(検品したAIからも同じ指摘がありました)
  • 省略が大きい:60秒に収めるため、賤ヶ岳の戦いや大坂城の築城などは入っていない

つまり、テレビ番組のような完成度ではありません。でも、社内研修の導入や、ブログ記事の補足として置く動画なら、十分に役目を果たせる品質だと感じました。何より、直したいところを言葉で伝えれば、AIがその場で直せる作り方になっているのが大きいです。

よくある誤解:AI動画=動画生成AIで作るもの、ではない

今回やってみて、いくつか思い込みが外れました。

誤解1:AIで動画を作るなら、動画生成AIを使う

解説動画に限って言えば、そうとは限りません。カンマンで試してきた範囲では、映像を丸ごと生成するタイプは、画面の中に正確な文字を出すのがまだ得意ではありません。年号や人名が出る解説動画なら、今回のように画面をコードで描くほうが確実です。

誤解2:AIが作ったのだから、内容は正しい

今回も、別のAIに確認させて初めて2か所の表現が直りました。AIは、もっともらしい「よく聞く言い方」をそのまま書くことがあります。

総務省と経済産業省の「AI事業者ガイドライン(第1.2版)」(2026年3月31日)も、生成AIによる偽情報・誤情報のリスクが高まっていると明記しています。事実確認を別の目に任せる仕組みは、AIを使うときほど必要です。

誤解3:いい声さえあれば、いい動画になる

動画の出来を左右したのは、声の質より尺の設計でした。何文字なら何秒か。どこに間を置くか。60秒という枠に収めるための削り方こそが、今回の制作の中心だったと思います。

中小企業なら、こう使える(カンマンの見解)

「歴史の動画を作って、会社の何になるの?」と思われるかもしれません。見てほしいのは題材より作り方のほうです。1文の依頼から、事実確認つきの解説動画が25分でできる。ここに使い道があります。

たとえば、こんな使い道が考えられます。

  • 商品やサービスの1分紹介:ホームページやSNSに置く短い説明動画
  • 社内の手順説明:新人向けに、作業の流れを1分で見せる動画
  • 採用:仕事の1日を、写真と字幕とナレーションで紹介する
  • 地域の紹介:徳島の歴史や名所を「1分で」伝える観光向けの動画

一方で、使うときに気をつけたいこともあります。

  • 送ってよい文章か:Gemini 3.8 TTSは、読ませる文章をGoogleのサービスへ送る。顧客名や個人情報、社外秘の内容は送らない
  • 履歴の保存:Gemini APIの Interactions API は、初期設定のままだと送った内容を保存する(有料枠で55日、無料枠で1日)。今回は保存しない設定(store: false)で送った
  • 事実と権利:年号や数字は一次情報で確認する。実在の人の声をまねたり、肖像を勝手に使ったりしない
  • 最後は人が確認する:固有名詞の読みと、公開してよい内容かどうかは人が判断する

カンマンでは、お客様の社名や数字が入る原稿は、外部のサービスに送らずに社内のパソコンの中で動く音声合成を使うようにしています。どこまでをクラウドのAIに任せ、どこからを手元で処理するか。この線引きも、AIを業務に入れるときの大事な設計です。

カンマンでは、こうした生成AIの使い方を、実際の業務に合わせて一緒に考える研修や支援をしています。「うちの会社なら何に使えるか」から相談したい方は、お問い合わせからお気軽にどうぞ。

AIに作らせた事例は、ほかにも記事にしています。

よくある質問

Q. 費用はどれくらいかかりましたか?

音声(Gemini 3.8 TTS)は、試し録りを含めて約0.04ドルでした。公式の料金では、Flashの音声出力は1分あたり1〜2セント程度です(2026年12月31日までの価格)。Claude側は会社で契約しているプランの中で使っており、この金額には含めていません。

Q. プログラミングができなくても作れますか?

私はコードを1行も書いていません。ただし、最初にClaude Codeを使える状態にすることや、GeminiのAPIキーを用意すること、動画の変換ソフトを入れることなど、準備は必要です。そこは詳しい人に一度だけ手伝ってもらうのが近道です。

Q. 日本語の読み間違いはありませんでしたか?

今回は、読み間違えやすい言葉をAIが先にひらがなに開いていたので、文字起こしで確かめた範囲では音はすべて合っていました。それでも固有名詞は、公開前に人の耳で確認してください。

Q. 縦型のショート動画にもできますか?

できます。台本と音声はそのまま使えるので、画面の配置だけを縦型に作り直せば済みます。今回はブログに載せるため横型にしました。

Q. BGMは入れられますか?

今回は入れていませんが、別の音楽生成AIで作った曲を重ねることはできます。GoogleのLyria 3.5で曲を作ってみた記録は、こちらの記事にまとめています。

Q. 作った動画は、仕事で使っていいのですか?

使う前に、声や素材を提供しているサービスの利用規約を確認してください。今回の動画は、台本も映像も新しく作ったもので、ほかの人が作った映像や画像は使っていません。それでも、声はGoogleのサービスで作ったものですし、画面の文字にはパソコンに入っているフォントを使っています。仕事で公開するなら、Gemini APIの利用規約とフォントのライセンスを確かめたうえで判断するのが安全です。

まとめ:AIに任せたのは「作業」、人に残ったのは「判断」

今回の25分を振り返ると、AIが担当したのは、台本、事実確認、声、映像、字幕、検品という「作業」のほぼすべてでした。しかも、自分の仕事を別のAIにチェックさせ、自分の目で画面を見て直すところまでやっていました。

一方で、人にしかできないことも、はっきり残りました。

何を作るか決めること。どこで見せるかを伝えること。できあがったものを見て、聞いて、公開していいか判断すること。

AIに任せる範囲が広がるほど、人の仕事は「判断」に集まっていく。1分の歴史動画を作りながら、そんなことを考えていました。

1文で頼めば、動画ができる時代になりました。あなたの会社なら、まず何の1分動画を作りますか。

カンマンでは、こうした動画づくりも含めて、生成AIを実際の業務にどう組み込むかを一緒に考える研修や支援をしています。「商品紹介の1分動画を社内で作れるようにしたい」「どこまでAIに任せてよいか、線引きを相談したい」といったご相談も、お問い合わせフォームからお気軽にどうぞ。

参考・出典

AIの無料セミナー優先参加特典や最新情報が受け取れます

【無料】AIメルマガを受け取る

貝出康

代表取締役

貝出康

1963年徳島市生まれ。 1999年に楽天の三木谷社長の講演を聴き、イン ターネット時代の到来を悟る。翌年、ホームペ ージ制作会社カンマン設立に参画し、これまで のキャリアで培った営業や人事のスキルを活か しての顧客開拓や社内・労務管理を実践。2019 年〜代表取締役。