AIのナレーションで阿波弁の「かんまんよ」は再現できるのか|Gemini 3.8 TTSに4回注文しても直らなかった抑揚を、私の録音3回で直した記録
公開日:2026年10月01日

代表取締役
貝出康

「かんまんよ」。
徳島の人なら、この文字を見ただけで、頭の中で音が鳴ったんじゃないでしょうか。
カンマンという社名は、この阿波弁から来ています。公式サイトの会社概要には、阿波弁の「かんまんよ〜」は「大丈夫・It’s ok!」のような意味だと書いてあります。コンピューター(com)と人(man)をつなぐ、という意味との掛け合わせです。
先日、会社の26年の歩みを1分の動画にしました。台本と映像はClaude Opus 5.5、ナレーションはGoogleのGemini 3.8 TTSです。その中に「阿波弁の、かんまんよ、にも由来します」という一文があります。
ところが、できあがった動画を聞いたら、ここだけ東京の言い方になっていたんです。
結論から言うと、阿波弁の抑揚は再現できました。ただし、AIに言葉で注文して直ったわけではありません。言い方の注文を4通り試して、4通りとも外れました。最後は、私が自分で「かんまんよ」を3回録音して渡しました。
AIがその録音から測ったのは、「音の高さの動き」だけです。そして、ナレーターの声はそのままに、その1語の音程だけを私の言い方に写し替えた。私が「ここが少し違う」と伝えてから、直した動画が届くまで16分でした。
この記事は、その16分の記録です。AIの声で方言を扱いたい人には、たぶん役に立つ話だと思います。
まずは見てください
「カンマンの歩みを1分で」、55.2秒です。音声が出ます。
2000年の創業から、ウェブ制作、システム開発、ChatGPTの登場を機に生成AIへ全振りしたこと、いまは研修とコンサルティングが柱になっていることまでを、1分に詰めています。今回の主役は、11秒台から始まる社名のシーンです。

役割分担は、次のとおりです。
| 担当 | 使ったもの | やったこと |
|---|---|---|
| 台本・映像 | Claude Opus 5.5(Claude Code) | 公式サイトの沿革を読み、7場面の台本と画面を作った(画面はHyperFramesで描画) |
| ナレーション | Gemini 3.8 Flash TTS | 声 ja-jp-tutor-1(一覧の説明は「東京出身の42歳の図書館員」)で読み上げ |
| BGM | ElevenLabs Music | 落ち着いたピアノから、転機で明るくなる曲 |
| 抑揚の直し | Praat(Parselmouth経由) | 「かんまんよ」の音程だけを、私の録音の形に置き換え |
私からの依頼は、短い文でした。「OPUS 5.5 と Gemini 3.8 を使って、カンマンの歴史を1分間の動画にしてください。BGMも適当につけてください。ナレーションは、落ち着いた感じの40代女性アナウンサーみたいな感じで」。9月26日の深夜0時20分に送り、2分後に、沿革には載っていない事業の流れ(ウェブ制作から始まり、ChatGPTの登場で生成AIに全振りしたこと)を補足しました。最初の版が届いたのは0時43分です。
「かんまんよ」は、どこがずれていたのか
最初の版を聞いて、すぐに気づきました。「かんまんよ」の言い方が、徳島の人の言い方と違うんです。
ずれていたのは、音(発音)ではありません。「か・ん・ま・ん・よ」という音そのものは、最初から正しく読まれていました。違ったのは、声の高さの上がり下がり、つまり抑揚です。
実際に聞いてもらうのが早いと思います。まずは最初の版です。
この「かんまんよ」の区間を、AIが声の高さで測りました。語頭の「か」が181Hz、そこから300Hz台まで上がっていきます。低く始めて、後ろへ上がる言い方です。
一方、私が言う「かんまんよ」は逆です。「か」が高くて、「んまん」にかけて下がり、「よ」でゆるく戻る。後で録音を測ったら、語頭から底まで約6半音下がっていました。
日本語の方言は、アクセントの仕組みで大きく分かれます。東京を中心とする地域は「東京式」、京都や大阪を中心とする地域は「京阪式」です。徳島県の東部は、京阪式の地域に入ります。今回AIが4つの候補から選んだGeminiの声(ja-jp-tutor-1)は、もともと東京のアクセントで話す設定の声です。だから、「かんまんよ」を東京の言葉のように読んでしまったと考えられます。
ただ、ここでひとつ断っておきたいことがあります。徳島県内でも、地域によってアクセントは違う。北西部は香川寄りの「讃岐式」だと言われています。今回の「正解」は、あくまで私の言い方です。阿波弁の代表の言い方だと言うつもりはありません。
言葉で4回注文した。4回とも外れた
私が「『かんまんよ』の抑揚・・・ここが少し違う」と送ったのが、0時49分です。
AIはまず、言い方の注文を変えた試し録りを4通り作りました。Gemini 3.8 TTSは、話し方を文章で指示できます。いつもの「落ち着いた40代の女性アナウンサー」という注文に、「かんまんよ」の言い方を1文ずつ足したんです。4本の生成は並行して走り、約9秒で終わっていました。
| 版 | 足した注文 | 測った声の高さの動き |
|---|---|---|
| A | 徳島の方言で、関西弁に近いやわらかい抑揚で、語尾の「よー」を軽く伸ばす | 184Hzから、なだらかに上がる |
| B | 最初の「か」だけを高く言い、「んまんよ」は低く下げる | 174Hzで始まり、途中で358Hzまで上がってから下がる |
| C | 低く始めて「んまん」を高く平らに続け、最後の「よ」で少し下げる | 180Hzから350Hz台へ上がり、高いまま終わる |
| D | 平らに言い、最後の「よ」だけを少し上げて、やさしく語りかけるように | 164Hzから422Hzまで大きく上がり、最後は156Hzまで下がる |
いちばん注目してほしいのは、Bです。
Bの注文は、私の言い方をほぼそのまま言葉にしたものでした。「か」だけ高く、あとは下げる。それなのに測ってみると、高くしてほしかった「か」がいちばん低い174Hzで、高いところは途中の358Hzでした。「か」を高く、という注文と逆の動きをしていたんです。
4本とも、語頭の「か」は160〜180Hz台の低い音から始まっていました。どんな注文を足しても、「か」を高く始める読み方は1本も出てきませんでした。
AIは4本を送ってきて、「どれがいちばん近いですか」と聞いてきました。私が選んだのはDです。聞いてみてください。
Dは、上がり下がりが大きく、最後の「よ」が低い版です。4本の中では、まだ近いと感じました。でも、やっぱり違う。「か」が高くない。
公式の説明書に、理由らしきことが書いてあった
あとからGemini APIの音声生成の説明書を読み直すと、理由と思われることが書いてありました。
説明書は冒頭で、話し方の指示やタグを組み合わせれば、話し方・アクセント・速さ・調子を導ける、と説明しています。そのうえで、注意点としてこうも書いている。要約すると、「話し方の指示(style)に、年齢や性別、名前、アクセントの恒久的な変更を入れないこと。代わりに、声のライブラリから地域の声を選ぶか、Voice designで声を作ること」という内容です。
つまり、話し手の地域のアクセントのように変わらない特徴は、「声を選ぶ・作る」段階で決めるという考え方なんです。話し方の指示は主に、感情や速さ、調子のような、場面ごとに変わるものを伝えるために使います。今回は、東京のアクセントの声に対して、1語だけ阿波弁で言ってと注文していました。説明書が勧める使い方とは、ずれていたことになります。
では、徳島の声を選べばいいのか。調べてみました。2026年9月26日時点で、声のライブラリにある日本語の声は115件。アクセントの内訳は、東京が73件、大阪が22件、福岡が20件でした。徳島の声は、1件もありません。
- 話し方の指示:感情や速さ、調子を場面ごとに変えるためのもの。声のアクセントを恒久的に変える手段としては勧められていない
- 声のライブラリ:日本語は東京・大阪・福岡の3種類(2026年9月26日時点)。徳島はない
- Voice design:文章で声を作る機能。地域のアクセントもここで決める設計。ただし今回は試していない
大阪の声や、Voice designで作る声を使えば、もっと近づいた可能性はあります。ここは試していないので、分かりません。今回の動画は、落ち着いたアナウンサーの声で全体を読み、社名の1語だけ阿波弁にしたい、という注文でした。声ごと替えるのは、やりたいこととずれていたんです。
「録音データを渡すことで解決できますか?」
Dを選んだあと、私はAIにこう送りました。
「Dでも違うのですが、録音データを渡すことで解決できますか?」
0時53分ごろのことです。言葉で伝わらないなら、音で伝えればいい。そう思っただけでした。
AIの返事は「はい、録音があれば解決できる見込みが高いです」。そのうえで、方法を2つ示してくれました。
- 抑揚だけ写す:録音から「かんまんよ」の上がり下がりを測り、ナレーターの声のまま、その部分の音程だけを録音どおりに直す
- 録音をそのまま差し込む:その部分だけ、私の声をそのまま入れる。「社長の本物の阿波弁」という演出になる
AIは、特に希望がなければ前者で進めると書いていました。私はどちらとも答えずに録音を送ったので、そのまま前者で進んでいます。
AIは返事を書く前に、直す処理がこのMacの中だけで動くかどうかも確かめてくれていたんです。録音は外部のサービスへ送らない、とはっきり書いてあった。自分の声は個人の情報でもあるので、ここは大事なところです。
録音のお願いは、とてもシンプルでした。
- 「かんまんよ」を、ふだんどおりの速さで2〜3回読む
- iPhoneのボイスメモか、MacのQuickTimeで録れば十分。静かな場所なら音質は問わない
- ファイルをチャットに貼るか、作業フォルダに置く
ボイスメモのファイルが読めなかった
ここで小さなつまずきがありました。Macのボイスメモから録音をチャットに貼ったら、AIがファイルを開けなかったんです。貼ったときに渡されたのは、ボイスメモのアプリ用の領域にある一時ファイルの場所でした。そこはmacOSのプライバシー保護が掛かっていて、Claude Codeからは「許可されていない操作」として読めなかったんです。
AIはすぐに作業フォルダをFinderで開いて、「録音をこのフォルダへドラッグしてください」と頼んできました。ドラッグして「置きました」と送ったのが0時58分。回避策を延々と探したりせず、人に一手お願いするほうを選んだのは、いい判断だったと思います。
録音から「抑揚の形」だけを写す
録音は8.2秒で、「かんまんよ」が3回入っていました。1回あたり0.6秒ほどです。ここからの処理は、AIが書いたプログラムがすべて手元のパソコンで行いました。
①私の言い方を「形」にする
まず、3回の「かんまんよ」それぞれで、声の高さを細かく測ります。私の声は男性なので、高さの中心は105Hz前後。ナレーターの声は190Hz前後です。そもそもの高さが違うので、そのまま比べても意味がありません。
そこで、高さを半音の単位に直し、時間も0から1の長さにそろえて、3回分を平均しました。こうすると、声の高さに関係なく「どこで上がって、どこで下がるか」という形だけが取り出せます。3回ともほぼ同じ形で、「か」が高く、約6半音下がって、「よ」でゆるく戻っていました。
②ナレーターの「かんまんよ」の場所を探す
次に、ナレーターの音声のどこからどこまでが「かんまんよ」なのかを特定します。使ったのは、手元で動く文字起こしです。1文字ごとの時刻が出るので、「阿波弁の」の「の」が終わってから、「にも」の「に」が始まるまでを「かんまんよ」とみなしました。
土台にしたのは、4本の試し録りのうちAです。Aは、私の形に合わせるときに動かす量が、平均でいちばん小さかった。動かす量が小さいほど、声が不自然になりにくいからです。
③音程だけを置き換える
最後に、その区間の音程だけを、私の形に置き換えます。使ったのは、音声学の研究で広く使われているPraatというソフトです。アムステルダム大学の研究者が開発したもので、PythonからはParselmouthというライブラリで呼び出せます。
Praatには、声の長さや音色を保ったまま、音程の動きだけを差し替える機能があります。「Manipulation」という機能で音程の線を描き直し、「オーバーラップ加算」という方式で声を組み立て直す。だから、声質はナレーターのまま、抑揚だけが私の言い方になるわけです。

図の左は、言葉で注文した版。黒い点線が私の録音の形で、青が最初の版、オレンジが版Dです。形がまるで違うのが分かると思います。右は録音から写した版で、緑の線が点線にほぼ重なっている。
抑揚の幅は、録音の1.15倍と少しだけ強めにして当てています。数字で言うと、語頭の「か」は184Hzから283Hzへ、約7.5半音持ち上げました。直したあとの音程を測り直すと、目標の形との差は平均0.05半音でした。
ただし、この0.05半音は「狙った形に合わせられた」という意味です。「阿波弁に聞こえる」ことの証明ではありません。聞こえ方は、人の耳で判断するしかない。ここは分けて考えています。
- 測る:私の録音3回から、声の高さの動きを半音の単位で取り出して平均
- 探す:文字起こしの時刻から、ナレーターの「かんまんよ」の0.67秒を特定
- 写す:Praatで、その区間の音程だけを置き換える。声質・長さ・音はそのまま
- 外に出さない:録音も処理も、すべてこのMacの中。Geminiに送ったのは台本の文字だけ
一度、高く浮きすぎた
実は、最初の直し方は失敗していました。
最初は「元の音程からのずれが平均で最小になる位置」に私の形を置いていました。数学的にはもっともらしいやり方です。ところが、こうすると「かんまんよ」の語頭が、直前の「阿波弁の」の「の」より9半音以上も高く浮いてしまった。1語だけ急に声が裏返るような位置です。
AIはこれに気づいて、置き方を変えました。「かんまんよ」のいちばん低いところを、直前の「の」より1半音だけ上に置く。前の言葉とつながる高さを基準にしたわけです。
測り直すと、「阿波弁の」の区間は190Hz前後、直した「かんまんよ」は210Hz前後、そのあとの「にも由来します」は150Hz前後でした。前後の語りから浮かない高さに収まっています。
聞いてみた結果
直した版を聞いてください。
AIは1時5分にこの版を送ってきて、聞いてほしい点を2つ挙げていました。抑揚が合っているか。そして、「か」の出だしを大きく持ち上げたので、そこが機械っぽく響いていないか。
私が聞いた判断は、はっきりしています。ちゃんと、徳島の人が言う「かんまんよ」になっていました。「か」が高く出て、すっと下がって、「よ」でやわらかく戻る。声は落ち着いたアナウンサーのまま、社名のところだけ地元の言い方になっている。
最初に気になった違和感は、きれいに消えていました。
同じ直しの中で、AIはほかにも3つ手を入れていました。
- 間を詰めた:社名のシーンは読点ごとの間が多かったので、他のシーンとテンポをそろえた
- 吹き出しの時刻:画面の「かんまんよ〜」の吹き出しが、読み始めと同時に出るようにした
- BGMの長さ:尺が55.2秒に延びたので、曲のテンポを0.938倍にして動画の終わりに合わせた
数字で見る今回の制作
| 項目 | 数字 |
|---|---|
| 最初の依頼から最初の版まで | 約23分(0:20→0:43) |
| 「少し違う」から直した版まで | 16分(0:49→1:05) |
| 言い方を注文した試し録り | 4本(約9秒で生成) |
| 私の録音 | 8.2秒(「かんまんよ」×3回、各0.6秒ほど) |
| 直した区間 | 0.67秒(「かんまんよ」の1語だけ) |
| 語頭の「か」を持ち上げた幅 | 約7.5半音(184Hz→283Hz) |
| 目標の形との差 | 平均0.05半音 |
| 動画の長さ | 55.2秒(1920×1080・30fps) |
| Gemini 3.8 TTSの費用 | 約3.3セント(試し録りを含む) |
| 抑揚を直す処理の費用 | 0円(手元のパソコンで処理) |
Gemini 3.8 TTSの費用の内訳は、本番の7シーンが約1.4セント、声の試し録り4件が約0.8セント、「かんまんよ」の言い方違い4件が約1.1セントです。2026年12月31日までの有料枠の価格で計算しています。Claude側とElevenLabs側の利用料は含めていません。
正直に書いておく、足りないところ
いい結果になりましたが、できていないことも書いておきます。
- Geminiだけで直ったわけではない:言葉の注文では4回とも直らなかった。直したのは、Opus 5.5が書いた手元のプログラム
- 直したのは1語だけ:ナレーション全体は東京アクセントのまま。今回はそれが狙いだったが、全文を阿波弁にする方法ではない
- 「正解」は私1人の言い方:徳島県内でも地域でアクセントは違う。ほかの人が聞けば、別の感想があるかもしれない
- 作り直すと消える:社名のシーンの音声を作り直すと、この直しは消える。そのたびに処理をかけ直す必要がある
もうひとつ。今回は、大阪アクセントの声、Voice designで作る声、30秒の音声から声を再現する機能は、どれも試していません。「Geminiでは阿波弁が話せない」と言うつもりはなく、「話し方の指示では直らなかった」というのが正確なところです。
よくある誤解
誤解1:方言は、言い方を文章で注文すれば直る
今回は直りませんでした。4通りの注文を試し、4通りとも「か」を低く始めています。しかも、正しい形を言葉にしたBの注文でさえ、測ると「か」がいちばん低い音になっていた。公式の説明書も、話し手の地域のアクセントは、声を選ぶ・作る段階で決めるよう勧めています。方言のアクセントを言葉で伝えるのは、思っている以上に難しい。
誤解2:方言を入れるなら、その部分は人が録り直すしかない
今回、私の声は動画に一切入っていません。私がしたのは、録音を3回分渡すことだけです。そこから「形」だけを取り出して、ナレーターの声に写しています。声を差し替えなくても、抑揚だけ借りることができるんです。
誤解3:AIの声の音程をいじると、不自然になる
いじり方によります。今回は、動かす量がいちばん小さいテイクを土台に選び、前の言葉から浮かない高さに置きました。私が聞いた限りでは、不自然さは感じませんでした。ただし、語頭を7.5半音も持ち上げているので、声やテイクによっては不自然になる可能性はあります。最後は、人が聞いて判断するのがいちばん確実です。
中小企業なら、こう使える(カンマンの見解)
「方言の1語なんて、細かい話でしょう」と思われるかもしれません。でも、地方の会社にとっては、けっこう大事な話なんです。
社名、商品名、地名。こうした言葉の読み方がずれていると、地元の人はすぐに気づきます。たとえば、徳島の人は「とくしま」を平らに言い、県外の人は「く」を上げて言いがちだ、とよく言われます。PR動画のナレーションで地名の抑揚がずれていたら、それだけで「よその人が作った動画」に聞こえてしまう。
今回のやり方なら、次のような使い方が考えられます。
- 社名・商品名の読み:会社の人が3回録音するだけで、AIのナレーションの読み方をそろえられる
- 地名の読み:観光や地域のPR動画で、地元の言い方に合わせる
- 方言のキャッチフレーズ:ナレーションは標準語のまま、決め台詞の1語だけ地元の言い方にする
- 研修や社内動画:社内でしか使わない言葉や略語の読みを、いつもの言い方に合わせる
一方で、気をつけたいこともあります。
- 声は個人の情報:録音は本人の同意を取り、外部のサービスに送らずに処理する。今回はすべて手元のパソコンで処理した
- 他人の声を勝手に使わない:借りるのは自分や社員の、同意を得た録音だけにする
- 地元の人に聞いてもらう:方言は、からかいに聞こえることもある。公開前に、その土地の人の耳で確かめる
- 台本の送信先を確認する:Gemini 3.8 TTSは読ませる文章をGoogleへ送る。社外秘や個人情報は台本に入れない
カンマンでは、こうした生成AIの使い方を、実際の業務に合わせて一緒に考える研修や支援をしています。「うちの社名や商品名を、正しい読み方で動画にしたい」というご相談も、お問い合わせからどうぞ。
音声のAIを試した記事は、ほかにもあります。
- サイトのチャットボットをGPT-Liveで作り直したら、音声で答える「AIアシスタント」になった話
- Gemini「Lyria 3.5」で作曲してみたら、5曲が全部別ジャンルで出てきた話
- OpenAI.FMとは?音声生成の使い方・API料金・仕事で試すポイント
よくある質問
Q. 費用はどれくらいかかりましたか?
Gemini 3.8 TTSの音声は、試し録りを含めて約3.3セントでした。抑揚を直す処理は手元のパソコンで動かしたので、追加の費用はかかっていません。公式の料金では、Gemini 3.8 Flash TTSの音声出力は100万トークンあたり9ドルです(2026年12月31日までの価格。2027年1月1日からは18ドル)。
Q. Gemini 3.8 TTSに、阿波弁の声はありますか?
2026年9月26日時点では、ありませんでした。日本語の声は115件で、アクセントは東京73件、大阪22件、福岡20件です。
Q. 大阪の声を使えば、阿波弁っぽくなりますか?
試していないので分かりません。徳島県東部と大阪は、どちらも京阪式アクセントの地域です。ただ、同じ仕組みの中でも、言葉ごとの言い方は地域で違います。今回はアナウンサーの声で全体を読みたかったので、声は替えませんでした。
Q. Voice designで、阿波弁の声を作れますか?
試していません。公式の説明書では、年齢や声質、地域のアクセントのような変わらない特徴は、Voice designで声を作るときに決めるよう勧めています。阿波弁の声を一から作りたいなら、試す価値はあると思います。
Q. 録音した声は、どこかに送られましたか?
送っていません。録音の分析も、音程の置き換えも、すべて手元のMacの中で行いました。Geminiに送ったのは、読み上げる台本の文字だけです。
Q. プログラミングができなくても、同じことはできますか?
私はコードを1行も書いていません。「録音データを渡すことで解決できますか?」と聞いて、録音をフォルダに置いただけです。プログラムはOpus 5.5が書いて動かしました。ただし、Claude Codeを使える環境や、GeminiのAPIキーなど、最初の準備は必要です。
Q. 1語だけでなく、文全体を阿波弁にできますか?
理屈の上では、同じやり方を語ごとに繰り返せば近づけられます。ただ、直したい語の数だけ録音と調整が要る。文全体を方言で読ませたいなら、その地域の声を選ぶか作る方法のほうが向いているはずです。
まとめ:AIに方言を伝えるなら、言葉より音
今回わかったことは、シンプルです。
AIの声に方言の抑揚を伝えるとき、言葉で注文するのは思った以上に難しい。「か」を高く、と書いても、そのとおりには動きませんでした。でも、本人の声で3回言ってみせれば、AIはその形を測って、ナレーターの声に写すことができた。
方言のアクセントは、言葉で説明するより、音で聞かせるほうが早い。人に教えるときと同じです。
そしてもうひとつ。「録音を渡せば解決できる?」と思いついたのは私で、それを実際の手順に組み立てたのはAIでした。人が気づいて、AIが形にする。この分担が、いちばんうまく回った場面だったと思います。
あなたの会社の社名や商品名、地元の言い方で、正しく読まれていますか。
カンマンでは、音声や動画も含めた生成AIの活用を、業務に合わせて一緒に考えています。「どこから試せばいいか分からない」という段階からでも、お問い合わせフォームからお気軽にご相談ください。
参考・出典
- 株式会社カンマン 会社概要(社名の由来・沿革)
- Google公式ブログ:Gemini 3.8 Flash TTS / Flash-Lite TTSの発表(2026年9月23日)
- Gemini API:音声生成(Speech generation)
- Gemini API:Voice design
- Gemini API:料金
- Praat(アムステルダム大学)
- Parselmouth(PythonからPraatを使うライブラリ)
- 京阪式アクセント(Wikipedia)
- 阿波弁(Wikipedia)
- Anthropic:Claude Opus 5.5
- HyperFrames(GitHub・HeyGen)
AIの無料セミナー優先参加特典や最新情報が受け取れます
【無料】AIメルマガを受け取る

代表取締役
貝出康
1963年徳島市生まれ。 1999年に楽天の三木谷社長の講演を聴き、イン ターネット時代の到来を悟る。翌年、ホームペ ージ制作会社カンマン設立に参画し、これまで のキャリアで培った営業や人事のスキルを活か しての顧客開拓や社内・労務管理を実践。2019 年〜代表取締役。









