トップページ / コラム / AIのナレーションで阿波弁の「かんまんよ」は再現できるのか|Gemini 3.8 TTSに4回注文しても直らなかった抑揚を、私の録音3回で直した記録

AIのナレーションで阿波弁の「かんまんよ」は再現できるのか|Gemini 3.8 TTSに4回注文しても直らなかった抑揚を、私の録音3回で直した記録

貝出康

代表取締役

貝出康

AIのナレーションで阿波弁の「かんまんよ」は再現できるのか|Gemini 3.8 TTSに4回注文しても直らなかった抑揚を、私の録音3回で直した記録

「かんまんよ」。

徳島の人なら、この文字を見ただけで、頭の中で音が鳴ったんじゃないでしょうか。

カンマンという社名は、この阿波弁から来ています。公式サイトの会社概要には、阿波弁の「かんまんよ〜」は「大丈夫・It’s ok!」のような意味だと書いてあります。コンピューター(com)と人(man)をつなぐ、という意味との掛け合わせです。

先日、会社の26年の歩みを1分の動画にしました。台本と映像はClaude Opus 5.5、ナレーションはGoogleのGemini 3.8 TTSです。その中に「阿波弁の、かんまんよ、にも由来します」という一文があります。

ところが、できあがった動画を聞いたら、ここだけ東京の言い方になっていたんです。

結論から言うと、阿波弁の抑揚は再現できました。ただし、AIに言葉で注文して直ったわけではありません。言い方の注文を4通り試して、4通りとも外れました。最後は、私が自分で「かんまんよ」を3回録音して渡しました。

AIがその録音から測ったのは、「音の高さの動き」だけです。そして、ナレーターの声はそのままに、その1語の音程だけを私の言い方に写し替えた。私が「ここが少し違う」と伝えてから、直した動画が届くまで16分でした。

この記事は、その16分の記録です。AIの声で方言を扱いたい人には、たぶん役に立つ話だと思います。

まずは見てください

「カンマンの歩みを1分で」、55.2秒です。音声が出ます。

2000年の創業から、ウェブ制作、システム開発、ChatGPTの登場を機に生成AIへ全振りしたこと、いまは研修とコンサルティングが柱になっていることまでを、1分に詰めています。今回の主役は、11秒台から始まる社名のシーンです。

カンマンの歩みを1分で紹介する動画の社名シーン。COMとMANの文字、「かんまんよ〜」の吹き出し、阿波弁で「大丈夫」という説明、下に2000年から2026年の年表と字幕

役割分担は、次のとおりです。

担当使ったものやったこと
台本・映像Claude Opus 5.5(Claude Code)公式サイトの沿革を読み、7場面の台本と画面を作った(画面はHyperFramesで描画)
ナレーションGemini 3.8 Flash TTS声 ja-jp-tutor-1(一覧の説明は「東京出身の42歳の図書館員」)で読み上げ
BGMElevenLabs Music落ち着いたピアノから、転機で明るくなる曲
抑揚の直しPraat(Parselmouth経由)「かんまんよ」の音程だけを、私の録音の形に置き換え

私からの依頼は、短い文でした。「OPUS 5.5 と Gemini 3.8 を使って、カンマンの歴史を1分間の動画にしてください。BGMも適当につけてください。ナレーションは、落ち着いた感じの40代女性アナウンサーみたいな感じで」。9月26日の深夜0時20分に送り、2分後に、沿革には載っていない事業の流れ(ウェブ制作から始まり、ChatGPTの登場で生成AIに全振りしたこと)を補足しました。最初の版が届いたのは0時43分です。

「かんまんよ」は、どこがずれていたのか

最初の版を聞いて、すぐに気づきました。「かんまんよ」の言い方が、徳島の人の言い方と違うんです。

ずれていたのは、音(発音)ではありません。「か・ん・ま・ん・よ」という音そのものは、最初から正しく読まれていました。違ったのは、声の高さの上がり下がり、つまり抑揚です。

実際に聞いてもらうのが早いと思います。まずは最初の版です。

最初の版:「かんまんよ」を低く始めて後ろへ上げる読み方(「阿波弁の、かんまんよ、にも由来します」の部分)

この「かんまんよ」の区間を、AIが声の高さで測りました。語頭の「か」が181Hz、そこから300Hz台まで上がっていきます。低く始めて、後ろへ上がる言い方です。

一方、私が言う「かんまんよ」は逆です。「か」が高くて、「んまん」にかけて下がり、「よ」でゆるく戻る。後で録音を測ったら、語頭から底まで約6半音下がっていました。

日本語の方言は、アクセントの仕組みで大きく分かれます。東京を中心とする地域は「東京式」、京都や大阪を中心とする地域は「京阪式」です。徳島県の東部は、京阪式の地域に入ります。今回AIが4つの候補から選んだGeminiの声(ja-jp-tutor-1)は、もともと東京のアクセントで話す設定の声です。だから、「かんまんよ」を東京の言葉のように読んでしまったと考えられます。

ただ、ここでひとつ断っておきたいことがあります。徳島県内でも、地域によってアクセントは違う。北西部は香川寄りの「讃岐式」だと言われています。今回の「正解」は、あくまで私の言い方です。阿波弁の代表の言い方だと言うつもりはありません。

言葉で4回注文した。4回とも外れた

私が「『かんまんよ』の抑揚・・・ここが少し違う」と送ったのが、0時49分です。

AIはまず、言い方の注文を変えた試し録りを4通り作りました。Gemini 3.8 TTSは、話し方を文章で指示できます。いつもの「落ち着いた40代の女性アナウンサー」という注文に、「かんまんよ」の言い方を1文ずつ足したんです。4本の生成は並行して走り、約9秒で終わっていました。

版足した注文測った声の高さの動き
A徳島の方言で、関西弁に近いやわらかい抑揚で、語尾の「よー」を軽く伸ばす184Hzから、なだらかに上がる
B最初の「か」だけを高く言い、「んまんよ」は低く下げる174Hzで始まり、途中で358Hzまで上がってから下がる
C低く始めて「んまん」を高く平らに続け、最後の「よ」で少し下げる180Hzから350Hz台へ上がり、高いまま終わる
D平らに言い、最後の「よ」だけを少し上げて、やさしく語りかけるように164Hzから422Hzまで大きく上がり、最後は156Hzまで下がる

いちばん注目してほしいのは、Bです。

Bの注文は、私の言い方をほぼそのまま言葉にしたものでした。「か」だけ高く、あとは下げる。それなのに測ってみると、高くしてほしかった「か」がいちばん低い174Hzで、高いところは途中の358Hzでした。「か」を高く、という注文と逆の動きをしていたんです。

4本とも、語頭の「か」は160〜180Hz台の低い音から始まっていました。どんな注文を足しても、「か」を高く始める読み方は1本も出てきませんでした。

AIは4本を送ってきて、「どれがいちばん近いですか」と聞いてきました。私が選んだのはDです。聞いてみてください。

言い方を注文した版D:途中で大きく上がり、最後の「よ」が低い

Dは、上がり下がりが大きく、最後の「よ」が低い版です。4本の中では、まだ近いと感じました。でも、やっぱり違う。「か」が高くない。

公式の説明書に、理由らしきことが書いてあった

あとからGemini APIの音声生成の説明書を読み直すと、理由と思われることが書いてありました。

説明書は冒頭で、話し方の指示やタグを組み合わせれば、話し方・アクセント・速さ・調子を導ける、と説明しています。そのうえで、注意点としてこうも書いている。要約すると、「話し方の指示(style)に、年齢や性別、名前、アクセントの恒久的な変更を入れないこと。代わりに、声のライブラリから地域の声を選ぶか、Voice designで声を作ること」という内容です。

つまり、話し手の地域のアクセントのように変わらない特徴は、「声を選ぶ・作る」段階で決めるという考え方なんです。話し方の指示は主に、感情や速さ、調子のような、場面ごとに変わるものを伝えるために使います。今回は、東京のアクセントの声に対して、1語だけ阿波弁で言ってと注文していました。説明書が勧める使い方とは、ずれていたことになります。

では、徳島の声を選べばいいのか。調べてみました。2026年9月26日時点で、声のライブラリにある日本語の声は115件。アクセントの内訳は、東京が73件、大阪が22件、福岡が20件でした。徳島の声は、1件もありません。

  • 話し方の指示:感情や速さ、調子を場面ごとに変えるためのもの。声のアクセントを恒久的に変える手段としては勧められていない
  • 声のライブラリ:日本語は東京・大阪・福岡の3種類(2026年9月26日時点)。徳島はない
  • Voice design:文章で声を作る機能。地域のアクセントもここで決める設計。ただし今回は試していない

大阪の声や、Voice designで作る声を使えば、もっと近づいた可能性はあります。ここは試していないので、分かりません。今回の動画は、落ち着いたアナウンサーの声で全体を読み、社名の1語だけ阿波弁にしたい、という注文でした。声ごと替えるのは、やりたいこととずれていたんです。

「録音データを渡すことで解決できますか?」

Dを選んだあと、私はAIにこう送りました。

「Dでも違うのですが、録音データを渡すことで解決できますか?」

0時53分ごろのことです。言葉で伝わらないなら、音で伝えればいい。そう思っただけでした。

AIの返事は「はい、録音があれば解決できる見込みが高いです」。そのうえで、方法を2つ示してくれました。

  • 抑揚だけ写す:録音から「かんまんよ」の上がり下がりを測り、ナレーターの声のまま、その部分の音程だけを録音どおりに直す
  • 録音をそのまま差し込む:その部分だけ、私の声をそのまま入れる。「社長の本物の阿波弁」という演出になる

AIは、特に希望がなければ前者で進めると書いていました。私はどちらとも答えずに録音を送ったので、そのまま前者で進んでいます。

AIは返事を書く前に、直す処理がこのMacの中だけで動くかどうかも確かめてくれていたんです。録音は外部のサービスへ送らない、とはっきり書いてあった。自分の声は個人の情報でもあるので、ここは大事なところです。

録音のお願いは、とてもシンプルでした。

  • 「かんまんよ」を、ふだんどおりの速さで2〜3回読む
  • iPhoneのボイスメモか、MacのQuickTimeで録れば十分。静かな場所なら音質は問わない
  • ファイルをチャットに貼るか、作業フォルダに置く

ボイスメモのファイルが読めなかった

ここで小さなつまずきがありました。Macのボイスメモから録音をチャットに貼ったら、AIがファイルを開けなかったんです。貼ったときに渡されたのは、ボイスメモのアプリ用の領域にある一時ファイルの場所でした。そこはmacOSのプライバシー保護が掛かっていて、Claude Codeからは「許可されていない操作」として読めなかったんです。

AIはすぐに作業フォルダをFinderで開いて、「録音をこのフォルダへドラッグしてください」と頼んできました。ドラッグして「置きました」と送ったのが0時58分。回避策を延々と探したりせず、人に一手お願いするほうを選んだのは、いい判断だったと思います。

録音から「抑揚の形」だけを写す

録音は8.2秒で、「かんまんよ」が3回入っていました。1回あたり0.6秒ほどです。ここからの処理は、AIが書いたプログラムがすべて手元のパソコンで行いました。

①私の言い方を「形」にする

まず、3回の「かんまんよ」それぞれで、声の高さを細かく測ります。私の声は男性なので、高さの中心は105Hz前後。ナレーターの声は190Hz前後です。そもそもの高さが違うので、そのまま比べても意味がありません。

そこで、高さを半音の単位に直し、時間も0から1の長さにそろえて、3回分を平均しました。こうすると、声の高さに関係なく「どこで上がって、どこで下がるか」という形だけが取り出せます。3回ともほぼ同じ形で、「か」が高く、約6半音下がって、「よ」でゆるく戻っていました。

②ナレーターの「かんまんよ」の場所を探す

次に、ナレーターの音声のどこからどこまでが「かんまんよ」なのかを特定します。使ったのは、手元で動く文字起こしです。1文字ごとの時刻が出るので、「阿波弁の」の「の」が終わってから、「にも」の「に」が始まるまでを「かんまんよ」とみなしました。

土台にしたのは、4本の試し録りのうちAです。Aは、私の形に合わせるときに動かす量が、平均でいちばん小さかった。動かす量が小さいほど、声が不自然になりにくいからです。

③音程だけを置き換える

最後に、その区間の音程だけを、私の形に置き換えます。使ったのは、音声学の研究で広く使われているPraatというソフトです。アムステルダム大学の研究者が開発したもので、PythonからはParselmouthというライブラリで呼び出せます。

Praatには、声の長さや音色を保ったまま、音程の動きだけを差し替える機能があります。「Manipulation」という機能で音程の線を描き直し、「オーバーラップ加算」という方式で声を組み立て直す。だから、声質はナレーターのまま、抑揚だけが私の言い方になるわけです。

「かんまんよ」の声の高さの動きを比べたグラフ。左は言葉で注文した版で、最初の版は後ろへ上がり、版Dは途中で大きく上がって下がり、どちらも私の録音の形と違う。右は録音から抑揚を写した版で、録音の形にほぼ重なる

図の左は、言葉で注文した版。黒い点線が私の録音の形で、青が最初の版、オレンジが版Dです。形がまるで違うのが分かると思います。右は録音から写した版で、緑の線が点線にほぼ重なっている。

抑揚の幅は、録音の1.15倍と少しだけ強めにして当てています。数字で言うと、語頭の「か」は184Hzから283Hzへ、約7.5半音持ち上げました。直したあとの音程を測り直すと、目標の形との差は平均0.05半音でした。

ただし、この0.05半音は「狙った形に合わせられた」という意味です。「阿波弁に聞こえる」ことの証明ではありません。聞こえ方は、人の耳で判断するしかない。ここは分けて考えています。

  • 測る:私の録音3回から、声の高さの動きを半音の単位で取り出して平均
  • 探す:文字起こしの時刻から、ナレーターの「かんまんよ」の0.67秒を特定
  • 写す:Praatで、その区間の音程だけを置き換える。声質・長さ・音はそのまま
  • 外に出さない:録音も処理も、すべてこのMacの中。Geminiに送ったのは台本の文字だけ

一度、高く浮きすぎた

実は、最初の直し方は失敗していました。

最初は「元の音程からのずれが平均で最小になる位置」に私の形を置いていました。数学的にはもっともらしいやり方です。ところが、こうすると「かんまんよ」の語頭が、直前の「阿波弁の」の「の」より9半音以上も高く浮いてしまった。1語だけ急に声が裏返るような位置です。

AIはこれに気づいて、置き方を変えました。「かんまんよ」のいちばん低いところを、直前の「の」より1半音だけ上に置く。前の言葉とつながる高さを基準にしたわけです。

測り直すと、「阿波弁の」の区間は190Hz前後、直した「かんまんよ」は210Hz前後、そのあとの「にも由来します」は150Hz前後でした。前後の語りから浮かない高さに収まっています。

聞いてみた結果

直した版を聞いてください。

録音から抑揚を写した版:「か」が高く、下がって、「よ」でゆるく戻る

AIは1時5分にこの版を送ってきて、聞いてほしい点を2つ挙げていました。抑揚が合っているか。そして、「か」の出だしを大きく持ち上げたので、そこが機械っぽく響いていないか。

私が聞いた判断は、はっきりしています。ちゃんと、徳島の人が言う「かんまんよ」になっていました。「か」が高く出て、すっと下がって、「よ」でやわらかく戻る。声は落ち着いたアナウンサーのまま、社名のところだけ地元の言い方になっている。

最初に気になった違和感は、きれいに消えていました。

同じ直しの中で、AIはほかにも3つ手を入れていました。

  • 間を詰めた:社名のシーンは読点ごとの間が多かったので、他のシーンとテンポをそろえた
  • 吹き出しの時刻:画面の「かんまんよ〜」の吹き出しが、読み始めと同時に出るようにした
  • BGMの長さ:尺が55.2秒に延びたので、曲のテンポを0.938倍にして動画の終わりに合わせた

数字で見る今回の制作

項目数字
最初の依頼から最初の版まで約23分(0:20→0:43)
「少し違う」から直した版まで16分(0:49→1:05)
言い方を注文した試し録り4本(約9秒で生成)
私の録音8.2秒(「かんまんよ」×3回、各0.6秒ほど)
直した区間0.67秒(「かんまんよ」の1語だけ)
語頭の「か」を持ち上げた幅約7.5半音(184Hz→283Hz)
目標の形との差平均0.05半音
動画の長さ55.2秒(1920×1080・30fps)
Gemini 3.8 TTSの費用約3.3セント(試し録りを含む)
抑揚を直す処理の費用0円(手元のパソコンで処理)

Gemini 3.8 TTSの費用の内訳は、本番の7シーンが約1.4セント、声の試し録り4件が約0.8セント、「かんまんよ」の言い方違い4件が約1.1セントです。2026年12月31日までの有料枠の価格で計算しています。Claude側とElevenLabs側の利用料は含めていません。

正直に書いておく、足りないところ

いい結果になりましたが、できていないことも書いておきます。

  • Geminiだけで直ったわけではない:言葉の注文では4回とも直らなかった。直したのは、Opus 5.5が書いた手元のプログラム
  • 直したのは1語だけ:ナレーション全体は東京アクセントのまま。今回はそれが狙いだったが、全文を阿波弁にする方法ではない
  • 「正解」は私1人の言い方:徳島県内でも地域でアクセントは違う。ほかの人が聞けば、別の感想があるかもしれない
  • 作り直すと消える:社名のシーンの音声を作り直すと、この直しは消える。そのたびに処理をかけ直す必要がある

もうひとつ。今回は、大阪アクセントの声、Voice designで作る声、30秒の音声から声を再現する機能は、どれも試していません。「Geminiでは阿波弁が話せない」と言うつもりはなく、「話し方の指示では直らなかった」というのが正確なところです。

よくある誤解

誤解1:方言は、言い方を文章で注文すれば直る

今回は直りませんでした。4通りの注文を試し、4通りとも「か」を低く始めています。しかも、正しい形を言葉にしたBの注文でさえ、測ると「か」がいちばん低い音になっていた。公式の説明書も、話し手の地域のアクセントは、声を選ぶ・作る段階で決めるよう勧めています。方言のアクセントを言葉で伝えるのは、思っている以上に難しい。

誤解2:方言を入れるなら、その部分は人が録り直すしかない

今回、私の声は動画に一切入っていません。私がしたのは、録音を3回分渡すことだけです。そこから「形」だけを取り出して、ナレーターの声に写しています。声を差し替えなくても、抑揚だけ借りることができるんです。

誤解3:AIの声の音程をいじると、不自然になる

いじり方によります。今回は、動かす量がいちばん小さいテイクを土台に選び、前の言葉から浮かない高さに置きました。私が聞いた限りでは、不自然さは感じませんでした。ただし、語頭を7.5半音も持ち上げているので、声やテイクによっては不自然になる可能性はあります。最後は、人が聞いて判断するのがいちばん確実です。

中小企業なら、こう使える(カンマンの見解)

「方言の1語なんて、細かい話でしょう」と思われるかもしれません。でも、地方の会社にとっては、けっこう大事な話なんです。

社名、商品名、地名。こうした言葉の読み方がずれていると、地元の人はすぐに気づきます。たとえば、徳島の人は「とくしま」を平らに言い、県外の人は「く」を上げて言いがちだ、とよく言われます。PR動画のナレーションで地名の抑揚がずれていたら、それだけで「よその人が作った動画」に聞こえてしまう。

今回のやり方なら、次のような使い方が考えられます。

  • 社名・商品名の読み:会社の人が3回録音するだけで、AIのナレーションの読み方をそろえられる
  • 地名の読み:観光や地域のPR動画で、地元の言い方に合わせる
  • 方言のキャッチフレーズ:ナレーションは標準語のまま、決め台詞の1語だけ地元の言い方にする
  • 研修や社内動画:社内でしか使わない言葉や略語の読みを、いつもの言い方に合わせる

一方で、気をつけたいこともあります。

  • 声は個人の情報:録音は本人の同意を取り、外部のサービスに送らずに処理する。今回はすべて手元のパソコンで処理した
  • 他人の声を勝手に使わない:借りるのは自分や社員の、同意を得た録音だけにする
  • 地元の人に聞いてもらう:方言は、からかいに聞こえることもある。公開前に、その土地の人の耳で確かめる
  • 台本の送信先を確認する:Gemini 3.8 TTSは読ませる文章をGoogleへ送る。社外秘や個人情報は台本に入れない

カンマンでは、こうした生成AIの使い方を、実際の業務に合わせて一緒に考える研修や支援をしています。「うちの社名や商品名を、正しい読み方で動画にしたい」というご相談も、お問い合わせからどうぞ。

音声のAIを試した記事は、ほかにもあります。

よくある質問

Q. 費用はどれくらいかかりましたか?

Gemini 3.8 TTSの音声は、試し録りを含めて約3.3セントでした。抑揚を直す処理は手元のパソコンで動かしたので、追加の費用はかかっていません。公式の料金では、Gemini 3.8 Flash TTSの音声出力は100万トークンあたり9ドルです(2026年12月31日までの価格。2027年1月1日からは18ドル)。

Q. Gemini 3.8 TTSに、阿波弁の声はありますか?

2026年9月26日時点では、ありませんでした。日本語の声は115件で、アクセントは東京73件、大阪22件、福岡20件です。

Q. 大阪の声を使えば、阿波弁っぽくなりますか?

試していないので分かりません。徳島県東部と大阪は、どちらも京阪式アクセントの地域です。ただ、同じ仕組みの中でも、言葉ごとの言い方は地域で違います。今回はアナウンサーの声で全体を読みたかったので、声は替えませんでした。

Q. Voice designで、阿波弁の声を作れますか?

試していません。公式の説明書では、年齢や声質、地域のアクセントのような変わらない特徴は、Voice designで声を作るときに決めるよう勧めています。阿波弁の声を一から作りたいなら、試す価値はあると思います。

Q. 録音した声は、どこかに送られましたか?

送っていません。録音の分析も、音程の置き換えも、すべて手元のMacの中で行いました。Geminiに送ったのは、読み上げる台本の文字だけです。

Q. プログラミングができなくても、同じことはできますか?

私はコードを1行も書いていません。「録音データを渡すことで解決できますか?」と聞いて、録音をフォルダに置いただけです。プログラムはOpus 5.5が書いて動かしました。ただし、Claude Codeを使える環境や、GeminiのAPIキーなど、最初の準備は必要です。

Q. 1語だけでなく、文全体を阿波弁にできますか?

理屈の上では、同じやり方を語ごとに繰り返せば近づけられます。ただ、直したい語の数だけ録音と調整が要る。文全体を方言で読ませたいなら、その地域の声を選ぶか作る方法のほうが向いているはずです。

まとめ:AIに方言を伝えるなら、言葉より音

今回わかったことは、シンプルです。

AIの声に方言の抑揚を伝えるとき、言葉で注文するのは思った以上に難しい。「か」を高く、と書いても、そのとおりには動きませんでした。でも、本人の声で3回言ってみせれば、AIはその形を測って、ナレーターの声に写すことができた。

方言のアクセントは、言葉で説明するより、音で聞かせるほうが早い。人に教えるときと同じです。

そしてもうひとつ。「録音を渡せば解決できる?」と思いついたのは私で、それを実際の手順に組み立てたのはAIでした。人が気づいて、AIが形にする。この分担が、いちばんうまく回った場面だったと思います。

あなたの会社の社名や商品名、地元の言い方で、正しく読まれていますか。

カンマンでは、音声や動画も含めた生成AIの活用を、業務に合わせて一緒に考えています。「どこから試せばいいか分からない」という段階からでも、お問い合わせフォームからお気軽にご相談ください。

参考・出典

AIの無料セミナー優先参加特典や最新情報が受け取れます

【無料】AIメルマガを受け取る

貝出康

代表取締役

貝出康

1963年徳島市生まれ。 1999年に楽天の三木谷社長の講演を聴き、イン ターネット時代の到来を悟る。翌年、ホームペ ージ制作会社カンマン設立に参画し、これまで のキャリアで培った営業や人事のスキルを活か しての顧客開拓や社内・労務管理を実践。2019 年〜代表取締役。