OpenAI.FMとは?音声生成の使い方・API料金・仕事で試すポイント
更新日:2026年09月21日
公開日:2025年03月24日

代表取締役
貝出康

こんにちは、カンマンの貝出です。商品紹介の動画や研修資料に声を付けるとき、毎回の録音が負担になることはありませんか。文章から声を作るAIは、その作業を見直す選択肢になります。
OpenAI.FMは、OpenAIの音声合成モデル「gpt-4o-mini-tts」をブラウザーで試せるデモサイト。声と話し方を変えながら、自社の原稿がどう聞こえるかを確かめられます。仕組みを業務システムへ組み込む際は、OpenAIのAPIを利用します。OpenAI.FM
この記事は2025年3月24日の公開記事を、2026年9月21日に見直したものです。料金の単位を訂正し、現在の公式資料で確認できる仕様と、公開当時の試用記録を分けました。
OpenAI.FMで試せること、APIでできること
OpenAIは2025年3月20日に、音声を文字にするモデルと、文字を音声にする「gpt-4o-mini-tts」を発表しました。音声合成では、読む文章に加えて、話し方も指示できるようになっています。OpenAIの発表
たとえば、会社紹介なら「落ち着いた口調で、ゆっくり」、商品案内なら「明るく、聞き取りやすく」と指定して聴き比べる。声だけでなく、同じ文章の伝わり方を試せるのが使いどころです。
OpenAI.FMは、その感触をつかむ入口です。記事を継続して音声化する、動画用のナレーションをまとめて作る、といった運用にはAPIでの組み込みを検討します。デモ画面で試せることと、APIの料金・利用条件は分けて確認しましょう。
API料金の単位は100万トークン
2026年9月21日に確認した「gpt-4o-mini-tts」の公式モデル資料では、料金は次のとおりです。
| 課金の対象 | 単位 | 料金(米ドル) |
|---|---|---|
| 入力テキスト | 100万テキストトークン | 0.60ドル |
| 出力音声 | 100万音声トークン | 12.00ドル |
旧稿の「音声出力1分あたり12ドル」は、課金単位を誤って記載していました。正しくは、音声出力100万トークンあたり12ドルです。この誤った単位を基にした5分間の費用例と、他サービスとの金額比較も取り下げました。
トークンは、モデルが文字や音声を処理する際の単位です。テキストの文字数と音声の再生時間を、そのまま上の表へ当てはめることはできません。実務では短い原稿を数本作り、利用量と請求対象を確認してから、本数を増やすと見積もりやすくなります。修正のための作り直しも、利用量に含めて考えてください。
まず短い原稿で、声と話し方を聴き比べる
確認時点のOpenAI.FMの画面には、声を選ぶ「VOICE」、話し方を調整する「VIBE」、読む文章を入れる「SCRIPT」があります。基本の流れは次のとおり。
- 「SCRIPT」に、音声にしたい短い原稿を入力します。
- 次は「VOICE」で声を選び、「VIBE」で話し方の調整です。
- 「PLAY」で生成・再生し、読み方を確認して「DOWNLOAD」で保存してください。
最初の原稿には、実際に使う商品名や数字を入れるのがおすすめです。流れるように読める文章でも、固有名詞や価格の部分だけ聞き取りにくいことがあります。同じ原稿なら、声や話し方の違いが比較の対象です。
日本語は公式の対応言語に含まれます。ただし、標準音声は英語向けに最適化されているという説明もあります。日本語の仕上がりは、社名・地名・数値の読み方まで耳で確認してください。音声合成の公式ガイド
モデル資料に記載された最大入力は2,000トークンです。日本語の文字数や原稿用紙の枚数へ固定換算せず、長い原稿は意味のまとまりで区切りましょう。分割後は、音声をつないだ際の間や話し方も確認します。モデルの入力上限
カンマンで試した音声を残しておきます
以下は、2025年の初回公開時に掲載したAI生成音声です。今回新しく生成した音声ではありません。当時の試用記録として、そのまま残しています。
武士の口調を試した際には、次のように書いていました。
武士の口調で渋く語らせてみましたが、なかなか良くないですか?日本語でも期待以上のデキです!
カンマンのブランドアイデンティティを読ませた音声も掲載していました。
カンマンのブランドアイデンティティでも試してみました。全く違和感がないです。
この感想は、その原稿と音声を聴いたときのものです。別の原稿、別の声でも同じ品質になることを示す比較試験ではありません。導入を考える際は、自社で使う文章でも確かめてみてください。
仕事で使うなら、確認と修正の手順まで決める
最初に試す原稿は、商品説明動画の一部分や短い操作案内、研修資料の読み上げなどから選んでください。短い原稿で修正箇所を記録しておくと、長い動画へ広げる前に、運用上の課題が見えてきます。
私なら、原稿を直す時間、聞き直す時間、動画へ組み込む時間も確認の対象です。音声生成の料金が小さくても、修正が多ければ制作全体の負担は減らないからです。
他の音声合成サービスと比べるときも、同じ原稿を使い、日本語の読み、修正のしやすさ、利用条件、総費用を並べてみましょう。旧稿にあった星による品質評価や「他社の5分の1」という比較は、条件を示せる根拠がないため削除しました。
公開時には、聞き手にAI生成音声だと分かる表示を付けます。OpenAIの公式ガイドは、この開示を利用上の要件として案内しています。動画の説明欄や音声プレーヤーの近くなど、聞く人が確認できる場所に記載してください。音声合成の公式ガイド
独自の声を使う場合も、標準の音声選択とは手続きが異なります。現在の公式資料にはカスタム音声の機能があり、対象顧客に限定され、本人の同意を収録した音声とサンプルが必要とされています。利用資格と条件を確認してから検討する機能です。カスタム音声の公式資料
まずは、よく使う商品説明を一つ選び、聞きやすい声と原稿の組み合わせを探してみてください。カンマンへのAI活用の相談は、お問い合わせフォームから受け付けています。コラム一覧でも、仕事に取り入れる際の考え方を紹介しています。
更新履歴
リライト済み:2026年9月21日。 API料金の単位、現行の利用条件、根拠のない比較と将来予測を見直し、公開当時の音声サンプルを試用記録として区別しました。初回公開日は2025年3月24日です。
AIの無料セミナー優先参加特典や最新情報が受け取れます
【無料】AIメルマガを受け取る

代表取締役
貝出康
1963年徳島市生まれ。 1999年に楽天の三木谷社長の講演を聴き、イン ターネット時代の到来を悟る。翌年、ホームペ ージ制作会社カンマン設立に参画し、これまで のキャリアで培った営業や人事のスキルを活か しての顧客開拓や社内・労務管理を実践。2019 年〜代表取締役。








