トップページ / コラム / AIにコテコテの大阪弁で漫才をさせてみた|Gemini 3.8 TTSは「ツッコミの間」まで演じられるのか、1分動画で試した全記録

AIにコテコテの大阪弁で漫才をさせてみた|Gemini 3.8 TTSは「ツッコミの間」まで演じられるのか、1分動画で試した全記録

貝出康

代表取締役

貝出康

AIにコテコテの大阪弁で漫才をさせてみた|Gemini 3.8 TTSは「ツッコミの間」まで演じられるのか、1分動画で試した全記録

AIの声って、どこまで「演技」ができると思いますか。

前回の記事で、豊臣秀吉の生涯を1分で紹介する動画を、Claude Opus 5.5とGemini 3.8 TTSに作らせた話を書きました。そのとき、足りないところとして「声の表情は控えめで、ニュースを読むような落ち着いた調子」と書いたんです。

じゃあ、表情がいちばん必要なものをやらせたらどうなるのか。

思いついたのが漫才でした。しかも、コテコテの大阪弁で。ボケとツッコミの2人の声、方言のアクセント、そして何より「なんでやねん!」が入る一瞬の間。AIの声にとって、これ以上の難題はなかなかありません。

依頼は、今回も1文だけです。21時26分に送って、21時58分には59.4秒の動画ファイルができていました。途中でAIから質問は1つも来ていません。

結論から言うと、7回のツッコミが、ボケの語尾に食い気味で入る漫才になりました。ただし、その「間」を作ったのは声のAIではありません。Opus 5.5が書いたプログラムが、秒単位で計算して並べています。声のAIが担ったのは、1つひとつのセリフの演技です。そしてその裏で、大きな落とし穴も1つ見つかりました。

このページの目次

まずは見てください

漫才「たこ焼き屋」、59.4秒です。音声が出ます。台本と映像はClaude Opus 5.5、2人の声はGemini 3.8 TTSの大阪アクセントの声が担当しました。コンビ名の「なにわスピーカーズ」と登場人物は、どちらも架空です。

AI漫才「たこ焼き屋」の9場面の一覧。オープニングと、なんでやねん・ただの焼き・入るかい・おばちゃんか・2円だけ・串カツ屋か・もうええわの7回のツッコミ、締めのあいさつ。赤い幕の舞台にセンターマイク、小道具の吹き出しと話し手別の字幕

たこ焼き屋さんになりたいボケに、ツッコミがお客さん役で付き合うコントです。「たこ焼きひとつ」と頼めば「お好み焼きひとつー!」。値切れば「998円!」。最後は「知らんけど」で締めて「もうええわ!」。ツッコミは全部で7回入ります。

ツッコミのたびに、ツッコミ役が手の甲でボケを叩き、画面に大きな文字と「パシッ」という効果音が出ます。ボケが口にした小道具(お好み焼き、丸ごとのタコ、アメちゃん、値札など)も、吹き出しの絵になって次々に登場する仕掛けです。

ここまでの台本、声の配役、舞台の絵、ツッコミの演出は、どれも私が指定したものではありません。

秀吉のナレーションと、何が違ったのか

同じ2つのAIで作った2本の動画を並べると、違いがよく分かります。

比べるところ秀吉の1分動画大阪弁の漫才
依頼の文豊臣秀吉の生涯の1分動画1分間の大阪弁のコテコテ漫才の動画
AIからの質問1問(画面の縦横)0問
依頼から完成まで約25分約32分
話す人1人(ナレーター)2人(ボケとツッコミ)
声東京アクセントの男性の声1つ大阪アクセントの男性の声2つ
音声の作り方場面ごとに8本1セリフずつ24本
セリフの間場面の間に0.3秒0.10秒、ツッコミは0.06秒重ねる
動画の長さ59.9秒59.4秒
音声の費用(試作込み)約3.6セント約3.8セント

ひと言でまとめると、秀吉は「読む」動画で、漫才は「演じる」動画です。そして演じるほうが、声の作り方も、間の作り方も、ずっと手間がかかっていました。

Gemini 3.8 TTSで大阪弁をしゃべらせる、3つの手順

Gemini 3.8 TTSは、Googleが2026年9月23日に発表した音声合成のモデルです。Googleの説明書には、品質重視のFlashについて「複雑な複数話者の対話」や「地域の方言・少数派の方言」に向いている、とはっきり書かれています。

ただ、「大阪弁でしゃべって」と頼むだけでは、たぶんうまくいきません。今回AIがやっていたのは、次の3つでした。

①大阪アクセントの声を選ぶ

Gemini 3.8 TTSには、日本語の声を集めたライブラリがあります。APIから一覧にすると、2026年9月24日時点で115件ありました。アクセントの内訳は、東京が73件、大阪が22件、福岡が20件です。大阪の22件のうち、男性の声は9件でした。

その中から選ばれたのが、次の2つです。

  • ボケ:ja-jp-storyteller-2(一覧の説明は「大阪出身の27歳の語り手」、低めの男性の声)
  • ツッコミ:ja-jp-podcaster-5(一覧の説明は「大阪出身の38歳のクイズ番組の司会者」、中くらいの高さの男性の声)

方言は、文字だけを大阪弁にしても伝わりません。アクセントを持った声を選ぶところから始まります。方言を話させたいなら、まず「その地域のアクセントの声」を選ぶ。これが最初の一歩です。

②話し方を文章で注文する

Gemini 3.8 TTSは、話し方を文章で指示できます。今回AIが書いた注文は、こうでした。

コテコテの大阪弁のしゃべくり漫才。ハイテンションで早口、掛け合いは間を詰めてテンポよく

秀吉のときは「テンポよく歯切れのよい、歴史解説番組のナレーション」でした。同じAIでも、注文の文ひとつで、読む声から演じる声に変わるわけです。

さらに、この共通の注文に、役ごとの一言を足していました。

セリフの種類足した注文
ボケボケ役として、とぼけた明るい調子で
ツッコミ(決め台詞)ツッコミ役として、鋭く大きな声で
ツッコミ(それ以外)ツッコミ役として、歯切れよく
締めのあいさつ漫才の締めのあいさつ。元気よく、声を張って

「なんでやねん!」のような決め台詞だけ、注文を強くしているのがポイントです。役と場面に合わせて話し方の注文を変える。人間の演出家がやっていることと、ほとんど同じです。

③台本に「読み上げ用」の列を作る

これは秀吉のときと同じ工夫です。画面に出す字幕と、声に渡す文を別々に持っています。

字幕に出す文字読み上げ用に渡した文字
たこ焼き言うてるやろたこ焼きゆうてるやろ
千円せんえん
998円きゅうひゃくきゅうじゅうはちえん
2円だけかいにえんだけかい
二度づけにどづけ
足はみ出とるあしはみ出とる
高っ!たかっ!

「言うてる」は大阪弁では「ゆうてる」と読みます。字幕は読みやすい漢字で、声は大阪弁の音で。方言の台本ほど、読み上げ用の列がないと声が標準語の読みに引っぱられてしまいます。

  • 声:大阪アクセントの男性の声を2つ(ボケとツッコミで声の高さが違う組み合わせ)
  • 話し方:「コテコテの大阪弁のしゃべくり漫才」と文章で注文
  • 台本:字幕用と読み上げ用の2列。方言の読み(ゆうてる)や数字はひらがなで渡す

いちばんの発見:2人を1回で作ったら、セリフが1つ消えた

ここが、今回いちばん伝えたいところです。

Gemini 3.8 TTSには、2人の会話を1回でまとめて作る機能があります。説明書には、話し手を2人設定して会話の形で渡せば、自然なやり取りのテンポで読み上げる、と書かれています。漫才にはぴったりに見えますよね。

AIも、最初はこの方法を試しました。

試したこと結果
冒頭4行だけを1回で生成(21時30分)文字起こしで4行とも確認できた
23行すべてを1回で生成(21時36分)2行目の「よろしゅうお願いしますー!」が消えていた

23行を一度に作った音声は53.4秒。文字起こしをすると、2行目のボケのあいさつだけが見当たりません。しかも、1行目と3行目の境目に無音もありませんでした。

実際の文字起こしの出だしは、こうです。

はいどうも何はスピーカーズです いやこいつね、たこ焼き屋さんになりたいらしいんですわ

1行目の「はいどうもー!なにわスピーカーズですー!」のすぐあとに、3行目の「いやこいつね」が続いています。間にあるはずの「よろしゅうお願いしますー!」は、どこにもありません。ちなみに「なにわ」が「何は」になっているのは、文字起こしが同じ音の別の漢字を当てただけで、読み間違いではありません。

これが困るんです。セリフが抜けたのか、2人の声が重なって聞こえなくなったのか、文字起こしからは区別がつきません。そしてAIは、音を耳で聞くことができません。

そこでAIは、一括の方法をやめて、24のセリフを1つずつ、話し手の声で別々に作る方式に切り替えました。こうすれば1本ずつ長さを測れて、どのセリフが抜けたかもすぐ分かる。

この方式には、あとから直しやすいという利点もあります。気に入らないセリフが1つあれば、そのセリフだけを作り直せばいい。声を別の人に替えたくなっても、24本をまとめて作り直すのは1行の命令で済む。一括で作っていたら、1か所直すたびに全体を作り直すことになっていました。

  • 短い試しでは問題が出ない:4行では全部入っていた。23行にして初めて1行が消えた
  • 消えても気づきにくい:エラーは出ず、文字起こしで数えて初めて分かる
  • 抜けか重なりか区別できない:境目に無音がないと、音だけでは判断がつかない

公式の説明では、複数話者の対話はFlashの得意分野です。それでも、長い掛け合いを一括で作ると、セリフが黙って消えることがある。耳で全部を確かめられないなら、掛け合いは1セリフずつ作るほうが確実です。これは実際にやってみないと分からなかったことでした。

ツッコミの「間」は、プログラムで作っていた

1セリフずつ作ると、今度は「間」が問題になります。一括生成なら声のAIがテンポを作ってくれますが、別々に作ったセリフは、並べ方しだいで漫才にも朗読にもなります。

AIは、この間を秒単位の規則にしていました。

完成動画の13.3〜20.7秒をボケ・ツッコミ・効果音の3段の波形で並べた図。ツッコミ「なんでやねん」がボケの語尾に0.06秒重なって食い気味に入り、ツッコミの後に0.30秒の笑いの間、効果音はツッコミの出だしから0.04秒後に鳴る
  • ふつうのセリフの間:0.10秒
  • ツッコミの入り:0.06秒食い気味(ボケの語尾に少し重ねる)
  • ツッコミの直後:0.30秒の笑いの間
  • 「パシッ」の効果音:ツッコミの出だしから0.04秒後に鳴らす

上の図は、完成動画の13秒台から20秒台を、話し手ごとの波形で並べたものです。「へいらっしゃい!お好み焼きひとつー!」の語尾に、「なんでやねん!」が0.06秒だけかぶさっているのが分かります。そして「たこ焼き言うてるやろ!」のあとに0.30秒あけて、次のボケ「ほな、タコ抜きで。」が入る。

この数字は、手で打ち込んでいません。台本と、できあがった24本の音声の長さから、プログラムが自動で計算しています。

効果音が、子音を消していた

途中で、こんなこともありました。制作時の作業メモによると、最初は0.16秒の「パシッ」をツッコミの頭に重ねていて、文字起こしで「串カツ屋か」の「くしかつ」が「ふしかつ」になっていたそうです。効果音が「く」の音を覆い隠していたわけです。

AIは効果音を0.07秒に短くし、音量を0.4に下げて、この問題を解消しています。直したあとの文字起こしでは、「串カツ屋か」がきちんと「くしかつやか」と聞き取れるようになりました。

2人同時の「ありがとうございましたー!」

最後のあいさつは、2人が声をそろえる場面です。これも、同じセリフを2つの声でそれぞれ作り、あとから重ねて1本にしていました。

映像の「漫才らしさ」も、AIが考えていた

声だけでなく、映像も漫才の舞台になっていました。

  • 舞台:赤い幕、金色の背景、真ん中に立つ1本のマイク
  • 小道具:ボケが口にしたもの(お好み焼き、タコ抜き、丸ごとのタコ、アメちゃん、値札、串カツ)を吹き出しで絵にする
  • ツッコミ:ツッコミ役が踏み込んで手の甲で叩き、決め台詞が大きな文字で飛び出す
  • 字幕:話し手ごとに色を分け、「ボケ」「ツッコミ」「二人」の札を付ける

エンドカードには「※コンビ名・人物は架空です」という注記まで入っていました。実在のコンビではないことを、AIが画面の中で断っていたわけです。

24のセリフを、1つずつ文字起こしで照合した

AIは音を聞けないので、確認は文字起こしで行っています。24のセリフそれぞれを手元のパソコンで文字に起こし、台本とどれくらい一致するかを数えていました。

おもしろいのは、一致率が低く出たセリフの理由です。いちばん低かったのは「ほな、998円!」で、一致率は0.17でした。でもこれは読み間違いではありません。読み上げ用の台本では「きゅうひゃくきゅうじゅうはちえん」とひらがなで書いていたのに、文字起こしは「998円」と数字で返してきた。表記が違うだけなんです。

ただ、1つだけ本当に確かめられていないセリフがあります。2行目の「よろしゅうお願いしますー!」です。文字起こしでは「よろしくお願いしまーすー」と出ました。実際に「よろしゅう」と言っているのか、文字起こしが一般的な言い方に直したのかは、文字だけでは判断できません。

  • 24セリフ全部が、抜けずに入っている:完成したMP4を文字起こしして、順番どおりに入っていることを確認
  • 数字のセリフ:一致率が低いのは表記の違い(ひらがなと数字)が原因
  • 効果音の影響:「くしかつ」が聞き取れる状態まで直した

一方で、文字起こしでは分からないこともはっきり残りました。大阪弁のイントネーションが自然かどうか。セリフを1つずつ作ったことで、行ごとに声の調子が揺れていないか。そして「よろしゅう」。この3つは、AI自身が「人が聞いて判断してほしい」と書き残しています。

数字で見る今回の制作

項目数字
依頼から完成MP4まで約32分(21:26→21:58)
AIからの質問0回
セリフの数24(うち締めのあいさつ1つは2人の声を重ねたもの)
ツッコミの回数7回
セリフの合計の長さ52.8秒
動画の長さ59.4秒(1920×1080・30fps)
音声の費用(Gemini 3.8 TTS)約3.8セント(本番分は約1.8セント)
動画の書き出し時間約31秒
完成ファイルの大きさ31.1MB

音声の費用は、試した分も含めて約3.8セント。そのうち本番の24本は約1.8セントで、残りの約2.0セントは声の試し録りや、一括生成を試した分です。費用はGemini 3.8 TTSの2026年12月31日までの有料枠の価格で計算しています。Claude側の利用料は含めていません。

プロの目で見た「足りないところ」

今回も、正直に書いておきます。

  • イントネーションは未確認:大阪弁として自然かどうかは、文字起こしでは分からない。大阪の人に聞いてもらうのがいちばん確実
  • 行ごとの調子の揺れ:1セリフずつ作ったので、行によって声の元気さが少し違って聞こえる可能性がある
  • お客さんの笑い声がない:舞台の漫才なのに、客席の反応がない。0.30秒の「笑いの間」が、少し静かに感じるかもしれない
  • 絵は簡素:登場人物はシンプルなイラストで、表情の変化は小さい
  • 方言の選択肢:一覧で見つかった日本語の声のアクセントは、東京・大阪・福岡の3種類だった。私たちの地元の阿波弁(徳島の方言)の声は、今のところ見当たらない

それでも、2つの声が方言で掛け合い、ツッコミが秒単位の規則で食い込んでくる漫才が、1文の依頼から32分でできました。しかも、足りないところを言葉で伝えれば、その場で直せる作り方になっています。

よくある誤解

誤解1:AIの声は、どうしても棒読みになる

話し方を文章で注文すれば、かなり変わります。今回の注文は「コテコテの大阪弁のしゃべくり漫才。ハイテンションで早口」。同じGemini 3.8 TTSでも、秀吉のときの落ち着いたナレーションとはまったく違う声が出てきました。

誤解2:方言は、台本を方言に書き換えれば話せる

文字だけ大阪弁にしても、アクセントが東京のままでは大阪弁に聞こえません。今回は、大阪アクセントを持った声を選ぶところから始めています。そのうえで、「ゆうてる」のような方言の読みは、読み上げ用の台本でひらがなにして渡していました。

誤解3:2人の会話は、1回でまとめて作るのが楽で確実

楽なのは確かです。でも今回は、23行を一括で作ったらセリフが1つ黙って消えました。短い試しでは問題が出なかったので、なおさら気づきにくい。長い掛け合いは、1セリフずつ作って間をあとから組むほうが、確認もしやすく確実です。

中小企業なら、こう使える(カンマンの見解)

「漫才なんて、会社で使う場面ある?」と思われるかもしれません。でも、ポイントは漫才そのものではありません。方言で、2人の掛け合いで、テンポよく伝える音声が、数セントで作れるようになったことです。

たとえば、こんな使い方が考えられます。

  • 地域のPR:大阪や福岡のお店・観光地を、その土地のアクセントで紹介する
  • 掛け合い形式の商品紹介:お客さん役と店員役のやり取りで、商品のよさを1分で伝える
  • 研修のロールプレイ:電話応対や接客の「よい例・悪い例」を、2人の会話で聞かせる
  • 社内向けの告知:固い連絡事項を、ラジオ番組のような掛け合いにする

一方で、気をつけたいこともあります。

  • 方言へのリスペクト:大げさな方言はからかいに聞こえることがある。公開前に、その土地の人に聞いてもらう
  • 実在の人のまねはしない:今回のコンビは架空。実在の芸人さんの声や芸風をまねた音声は作らない
  • 送ってよい文章か:Gemini 3.8 TTSは、読ませる文章をGoogleのサービスへ送る。社外秘や個人情報は送らない
  • AIが作った音声であること:公開するときは、AIで作った音声だと分かるように添える。Googleは、声を再現する機能には本人の同意の確認と「SynthID」という透かしを組み込んでいると説明している

カンマンでは、こうした生成AIの使い方を、実際の業務に合わせて一緒に考える研修や支援をしています。「うちの商品を、掛け合いの音声で紹介してみたい」といったご相談も、お問い合わせからどうぞ。

AIに作らせた事例は、ほかにもあります。

よくある質問

Q. 費用はどれくらいかかりましたか?

Gemini 3.8 TTSの音声は、試した分を含めて約3.8セントでした。本番の24セリフだけなら約1.8セントです。公式の料金では、Flashの音声出力は100万トークンあたり9ドル(2026年12月31日までの価格。2027年1月1日からは18ドル)です。

Q. 大阪弁以外の方言もできますか?

2026年9月24日時点で、日本語の声の一覧にあったアクセントは東京・大阪・福岡の3種類でした。ほかの方言は、文章で声を作る「Voice design」で試す余地がありますが、今回は試していません。

Q. 2人の会話を1回で作る機能は使えないのですか?

使えます。今回も冒頭の4行では問題ありませんでした。ただ、23行を一度に作ったら1行が消えました。短い会話なら一括でもよく、長い掛け合いや、全部を耳で確かめられない場合は1セリフずつ作るのがおすすめです。

Q. 1セリフずつ作ると、行ごとに声の調子がばらつきませんか?

その心配はあります。今回は、話し手ごとに同じ声を使い、共通の話し方の注文に役ごとの一言を足す形で24本を作っています。ただ、実際にそろって聞こえるかどうかは、文字起こしでは確かめられません。公開する前に、人が通して聞いて判断するのが確実です。

Q. 実在の芸人さんの声で作れますか?

作るべきではありません。Gemini 3.8 TTSには、30秒の音声から声を再現する機能もありますが、Googleは「自分の声か、使う権利のある声」を対象にしており、同意を確認する仕組みも組み込んでいると説明しています。今回のコンビ名と登場人物は、どちらも架空です。

Q. プログラミングができなくても作れますか?

私はコードを書いていません。依頼を1文送り、途中で作業が一度止まったときに「続けてください」と送っただけです。ただし、Claude CodeやGeminiのAPIキーなど、最初の準備は必要です。

Q. 縦型のショート動画にもできますか?

できます。24本の音声と間の計算はそのまま使えるので、画面の配置を縦型に作り直せば済みます。

まとめ:AIの声は「読む」から「演じる」へ

秀吉の動画では、AIの声は上手に「読んで」いました。今回の漫才では、2つの声が方言で掛け合い、ツッコミが食い気味に入る。AIの声が「演じる」ところまで来ていることを、はっきり感じました。

同時に、演じるほど、人の仕事も見えてきます。一括で作るとセリフが黙って消えることがある。イントネーションが自然かどうかは、耳で聞かないと分からない。方言を使うなら、その土地の人への配慮もいる。

AIに演じさせるほど、最後に「聞いて判断する」人の役割が大事になる。1分の漫才を作りながら、そう思いました。

あなたの会社なら、誰と誰の掛け合いで、何を伝えますか。

カンマンでは、音声や動画も含めた生成AIの活用を、業務に合わせて一緒に考えています。「どこから試せばいいか分からない」という段階からでも、お問い合わせフォームからお気軽にご相談ください。

参考・出典

AIの無料セミナー優先参加特典や最新情報が受け取れます

【無料】AIメルマガを受け取る

貝出康

代表取締役

貝出康

1963年徳島市生まれ。 1999年に楽天の三木谷社長の講演を聴き、イン ターネット時代の到来を悟る。翌年、ホームペ ージ制作会社カンマン設立に参画し、これまで のキャリアで培った営業や人事のスキルを活か しての顧客開拓や社内・労務管理を実践。2019 年〜代表取締役。