BLOG

Gemini 3.8 TTSの使い方・料金・商用利用|日本語で検証

目次
  1. まず結論——台本は台本のまま、演技の指示は別の欄に
  2. Gemini 3.8 TTSとは——2つのモデルと、できること
  3. 社内検証——日本語15本で分かったこと
  4. 感情を込める3ステップ
  5. 指示の欄(style)と英語タグの使い分け
  6. 熊本の市町村20の読みテスト——地名はひらがなで
  7. 料金——1分いくら、用途別の月額、他社との比較
  8. 仕事で使うときの決まり——無料枠・商用・声の複製
  9. 始め方3ステップ(コード不要)
  10. よくある質問
  11. まとめ——「台本は台本、演出は演出メモ」
  12. 参考にした一次情報

「研修動画のナレーションを付けたいが、社員に読ませると棒読みになる」「店内放送を作り直すたびに、録音の時間が取れない」——声が必要な場面は、中小企業にも案外多いものです。

2026年9月22日、Googleが音声生成AIの新しい正式版「Gemini 3.8 TTS」を公開しました。TTSとは、文章を渡すと、それを読み上げる音声をつくるAIのことです。今回の版で大きく変わったのが「感情や話し方の指示の出し方」で、台本の中に演技の指示を書き込んでいた今までのやり方をそのまま使うと、指示まで読み上げられます(社内の検証で確認しました)。

この記事では、社内でGemini APIから日本語の音声を15本作り、別のAI(Gemini 3.8 Flash)に文字起こしさせて確かめた結果をもとに、次の5つを整理します。

  1. 3.8で変わった「指示の書き方」と、旧来の書き方をそのまま使うとどうなるか
  2. 日本語の台本に感情を込める3ステップ
  3. 熊本の市町村20の読みテスト(Flash TTSとFlash-Lite TTSの差)
  4. 用途別の月額(作り直し込み・2026年内と2027年以降)と、他社との比較
  5. 仕事で使うときの決まり(無料枠と社外秘・商用の考え方・声の複製)

読者は、ITに詳しくない社長や、総務・研修担当の方を想定しています。専門の言葉は出るたびに一言で噛み砕きます。なお、音声の出来の確認はAIの聞き取りによるものです。仕事で使う音声は、最終的にご自身の耳で聞いて判断してください。

まず結論——台本は台本のまま、演技の指示は別の欄に

結論から言うと、Gemini 3.8 TTSで感情を込めるコツは「台本と演出メモを分けて渡す」の一点です。

それだけ聞くとよく分からないと思うので、たとえ話をします。3.8のTTSは、渡された台本を一字一句そのまま読むナレーターです。真面目なので、台本に「(緊張しながら)」と書いてあれば、「緊張しながら」と声に出して読みます。なので、演技の注文は台本に書かず、別紙の「演出メモ」に書いて渡します。この演出メモにあたるのが、指示の欄(公式の呼び名はstyle)です。そして、笑い・ため息・息を呑む、といった一瞬の声は、台本の中に決まった記号(山括弧のタグ)で入れます。演劇でいう「ト書き」の記号だと思ってください。

整理すると、3.8の台本は次の3層でできています。

  1. 台本(本文)——読んでほしい言葉だけを書く
  2. 演出メモ(指示の欄)——その発言全体の感情・速さ・抑揚を短く書く
  3. ト書きの記号(タグ)——笑い・ため息・間など、一瞬の声を文中に入れる

この3層を守れば、「指示まで読み上げられた」「声が別人のようにぶれた」という失敗は、かなり防ぎやすくなります。逆を返せば、台本に演出を書き込む今までの癖が残っていると、3.8ではうまくいきません。

Gemini 3.8 TTSの台本は3層。台本(本文)には読んでほしい言葉だけ、演出メモ(指示の欄)には感情・速さ・抑揚を短く、ト書きの記号(タグ)には笑いや間などの一瞬の声を入れる

上の図が、この記事全体の地図です。以下、この3層を軸に順番に説明します。

Gemini 3.8 TTSとは——2つのモデルと、できること

「Gemini 3.8 TTS」は1つのモデルの名前ではなく、2つのモデルの総称です。

Gemini 3.8 Flash TTSGemini 3.8 Flash-Lite TTS
位置づけ表現力・方言・長い音声の安定性を重視速さと低コストを重視
対応言語130言語101言語
日本語対応対応
音声の単価(2026年内)100万トークンあたり$9.00同$6.00
熊本の市町村20の読み(社内検証)16が正解10が正解
公式資料の配布先Gemini API・Google AI Studio・Gemini NotebookなどGemini API・Google AI Studio・Google Vidsなど

正式版(GA)になったのは2026年9月22日で、Gemini API(開発者向けの窓口)とGoogle AI Studio(ブラウザで試せる画面)から使えます。一方で、チャットの「Geminiアプリ」は公式の配布先に載っていません。スマホのGeminiに話しかけて作るものではなく、AI Studioの画面か、APIから使うものだと考えてください。

できることを、仕事に関係する範囲で挙げます。

  • 文章を渡すと、WAV形式(24kHz・モノラル)の音声が返ってくる
  • 一度に入れられる文章は8,192トークンまで、出てくる音声は16,384トークンまで。音声は1秒=25トークンなので、1回あたり約10.9分が上限
  • 声は、あらかじめ用意された30種(Kore・Puck・Zephyrなど)と拡張の声ライブラリから選ぶほか、文章で新しい声を作る「声の設計(Voice design)」、本人の同意のもとで声を取り込む「声の複製(Voice replication)」がある
  • 2人までの掛け合いを1回で作れる(会話モード)。3人以上は1人ずつ作ってつなぐ

トークンは、AIが量を数える単位です。文章なら文字の量に、音声なら長さに比例して増えると考えてください。音声は「1秒=25トークン」と料金ページに明記されているので、料金は実質「音声の秒数」で決まります。電気のメーターのようなものです。ここは後の料金の章で効いてきます。

3.1までと何が変わったか

旧版(2.5世代と、3.1 Flash TTS Preview)を使っていた方向けに、変わった点を表にします。

3.1まで3.8
演技の指示の渡し方台本の中に指示を書き込む台本はそのまま。指示は別の欄(style)、一瞬の声はタグ
声の作り方用意された声から選ぶ選ぶ・文章で設計する・同意のうえで複製する
長い「人物設定」の文章毎回貼る書き方が広まっていた声がぶれる最大の原因として非推奨。声の設計に置き換える
音声の単価(Flash・100万トークンあたり)3.1は$20.00$9.00(2026年内)→$18.00(2027年〜)

公式ガイドは、旧モデルから持ち込んだ長い人物設定(「Audio Profile」「Director’s Notes」と呼ばれていた書き方)を、声がぶれるいちばん多い原因だと名指ししています。長い設定を毎回貼るのではなく、声は先に「声の設計」で作っておき、台本は台本だけにする。これが3.8の作法です。

Gemini 3.8 TTSの2つのモデル。Flash TTSは表現力と方言、長い音声の安定性を重視し130言語、Flash-Lite TTSは速さと低コストを重視し101言語。どちらも日本語に対応し、Gemini APIとGoogle AI Studioで使える

この図は2つのモデルの違いをカードにしたものです。迷ったら、まず表現力のあるFlash TTSから試すのが無難かなと思います。

社内検証——日本語15本で分かったこと

ここからが、この記事の中心です。社内でGemini APIから日本語の音声を15本作り、Gemini 3.8 Flashに文字起こしをさせて、何がどう読まれたかを確かめました。声はすべて用意された声の「Kore」(2人の掛け合いだけ、営業役にPuck)で統一しています。

まず、同じ一文を使って、指示の出し方だけを変えた結果です。本文は「本日はお忙しい中、お時間をいただきありがとうございます。さっそくですが、新しい企画のご提案をさせてください。」の1文です。

番号指示の出し方長さAIの聞き取り結果
01指示なし8.1秒本文どおり。丁寧で落ち着いた話し方
02台本の先頭に「(緊張して、少し声を震わせながら、ゆっくりと)」と書く(3.1までの書き方)17.2秒「緊張して少し声を震わせながらゆっくりと」まで声に出して読んだ
03指示の欄に英語で強めに(nervous, slightly shaky voice, speaking slowly)。文中に間と息のタグ13.0秒指示は読まれない。息切れ気味で途切れ途切れ(効きすぎ)
04指示の欄に英語で控えめに(a little nervous)。文中に間のタグ10.0秒指示は読まれない。落ち着いて間を取る
05指示の欄に日本語で「少し緊張気味に、ゆっくり」。文中に間のタグ12.9秒日本語の指示も読まれない。04より約3秒ゆっくり

発見1: 旧来の書き方をそのまま使うと、指示まで読み上げた

いちばん伝えたいのが02です。3.1までは、台本の中に「(緊張しながら)」のような指示を書く方法がよく使われていました。これを3.8でそのまま送ると、指示の文まで音声になりました。長さも8.1秒から17.2秒に伸び、その分の料金もかかっています(有料単価に直すと、約0.27円が約0.58円)。

公式ガイドにも、本文に演技指示や話者名を書くと読み上げられる恐れがある、と書かれています。それが日本語でも、そのまま起きたということです。正直なところ、02は「本当にそこまで読むのか」を確かめるために作ったものですが、指示の文を省かずに読みました。3.8に乗り換える方は、まずここを疑ってください。

発見2: 指示の欄に分ければ読まれない。日本語でも効いた

03〜05は、同じ注文を指示の欄に移したものです。どれも指示は読まれませんでした。そして05は日本語の指示です。公式ガイドの例は英語ですが、「少し緊張気味に、ゆっくり」という日本語の指示で、速さの注文がない04より約3秒長い、ゆっくりした読み方になりました。別の文でも、「驚きと喜びで声が弾むように」という日本語の指示で明るく弾んだ口調になっています(後述の06c)。

発見3: 強い指示は効きすぎる

03は、英語で「緊張して、少し声が震え、ゆっくり」と3つ重ねて書き、文中に間と息のタグも入れたものです。結果は、息切れ気味で途切れ途切れ。ビジネスの提案の声としては使いにくい仕上がりでした。一方、04の「a little nervous(少し緊張)」は、落ち着いて間を取る程度に収まっています。

ここから言えるのは、指示は「盛る」より「削る」です。以前の記事AIへの指示は削るほど効くで書いたことが、音声でもそのまま当てはまりました。公式の推奨手順も、まず指示なしで作り、足りないところだけ短く足す、という順番です。

同じ一文を、旧来の書き方と3.8の書き方で作った比較。旧来の書き方では台本の先頭の演技指示まで読み上げて17.2秒になり、3.8の書き方では指示の欄に分けて読み上げられず、日本語の指示でも効いた

この図は、02と05を並べたものです。「指示を書く場所」が違うだけで、結果がここまで変わります。

感情を込める3ステップ

社内検証と公式の推奨手順を合わせると、日本語の台本に感情を込める手順は3ステップに絞れます。

ステップ1: 声を先に決める

感情の前に、声そのものを決めます。用意された30種から選ぶか、「声の設計」で文章から作るかです。アクセント・年齢・性別といった声の土台は、指示の欄で変えようとしないでください。公式ガイドも、土台は声選びか声の設計で決め、指示の欄はその場の感情と速さに使う、と分けています。長い人物設定を毎回貼る書き方は、ここで卒業します。

ステップ2: 台本はそのまま書く

台本には、読んでほしい言葉だけを書きます。演技の注文や「話者1:」のような名前は書きません。公式ガイドは、言い淀みも含めた自然な話し言葉で書くことを勧めています。間を取りたい場所は、まず句読点やダッシュ、三点リーダで示し、それでも足りなければ間のタグ(<short pause>・<long pause>)を入れます。

ステップ3: 指示は短く、足りないところだけ

まず指示の欄を空のまま1本作ります。社内検証の01がこれで、指示なしでも丁寧で落ち着いた声でした。聞いてみて足りないところがあれば、その発言にだけ短い指示を足します。「a little nervous」「少し緊張気味に、ゆっくり」くらいの短さで十分です。途中で感情が変わる台本は、発言(ターン)を分けて、それぞれに別の指示を付けます。

ステップやることやらないこと
1 声を先に決める用意された声から選ぶ/声の設計で作る指示の欄でアクセント・年齢・性別を変える
2 台本はそのまま読んでほしい言葉だけ。間は句読点やタグで台本の中に演技の注文や話者名を書く
3 指示は短くまず指示なし→足りないところだけ短く最初から強い指示を盛る。長い人物設定を毎回貼る

感情を込める3ステップ。1 声を先に決める、2 台本はそのまま書く、3 指示は短く足りないところだけ。まず指示なしで1本作り、足りない発言にだけ短い指示を足す

この3ステップを図にしました。順番が大事で、特に「まず指示なしで1本」を飛ばさないでください。

指示の欄(style)と英語タグの使い分け

3ステップのうち、よく質問されるのが「指示の欄とタグをどう使い分けるか」です。役割がはっきり分かれています。

指示の欄(style)文中のタグ(山括弧)
効く範囲その発言全体書いた場所の一瞬
向いている注文感情・速さ・抑揚(例: 少し緊張気味に、ゆっくり)笑い・ため息・息を呑む・間
書く場所台本とは別の欄台本の中、入れたい場所
言葉公式の例は英語。社内検証では日本語も効いた日本語の台本でも英語のまま
注意強すぎると効きすぎる人の声だけ。効果音のタグは避ける

タグは日本語の文に混ぜて効く

「まさか、本当に契約が決まったんですか?」という一文で、感情の付け方を3通り試しました。

番号台本指示の欄AIの聞き取り結果
06a<gasp> まさか… <short pause> 本当に契約が決まったんですか? <laugh> やった!surprised and delighted(英語)「はぁ、まさか…やったあ!」。驚きから喜びへ
06bまさか、本当に契約が決まったんですか?cold and suspicious(英語)AIの聞き取りでは「驚いて息を呑む」。冷たさは判定できず
06cまさか、本当に契約が決まったんですか? やった!驚きと喜びで声が弾むように(日本語)驚きから歓喜へ。弾む明るい口調

06aでは、<gasp> が「はぁ」と息を呑む声になり、驚きから喜びに移る流れが音になりました。今回の検証では、日本語の文の中に英語のタグを混ぜても、タグそのものが読み上げられることはありませんでした。公式ガイドも「英語以外の台本でもタグは英語のまま」と書いています。

タグの形は山括弧(< と >)です。他社の音声AIで使われる角括弧([laughs] のような形)は、3.8の公式ガイドには載っていません。公式は、山括弧が最も品質が高いとしています。

分類タグの例使いどころ
笑い<laugh>・<chuckle>冗談のあと、嬉しい知らせ
ため息・息<sigh>・<breath>・<gasp>落胆、ひと息、驚き
ささやき・涙<whispers>・<cry>内緒話、悲しい場面
間<short pause>・<long pause>句読点では足りない間

指示が強すぎたときの直し方

03の「息切れ気味」のように効きすぎたときは、指示の言葉を減らします。「nervous, slightly shaky voice, speaking slowly」の3つ重ねを「a little nervous」の1つにし、息のタグを外すと、04のように落ち着きました。日本語なら「少し〜」「やや〜」を頭に付けるくらいの加減です。

一点、正直に書いておくと、06bの「cold and suspicious(冷たく疑う)」は、AIの聞き取りでは「驚いて息を呑む」としか判定できず、冷たさが出たかどうかは確認できていません。喜びや驚きのような分かりやすい感情に比べ、冷たさ・皮肉のような微妙な感情は、人の耳で確かめる必要があります。

コピペで使える指示の例

指示の欄に入れる文と、タグの例をまとめます。社内で試して効いたものと、公式ガイドに例として載っているものを分けました。

指示の欄(style)・社内で試して効いた日本語

少し緊張気味に、ゆっくり

驚きと喜びで声が弾むように

指示の欄(style)・社内で試した英語

a little nervous(少し緊張して)

surprised and delighted(驚いて喜ぶ)

a little nervous but hopeful(少し緊張しつつ、期待している)

surprised, then delighted(驚き、そして喜ぶ)

指示の欄(style)・公式ガイドの例

whispering(ささやく)/ out of breath(息が切れている)/ speaking slowly(ゆっくり話す)/ sarcastic(皮肉っぽく)

文中のタグ・社内で試した日本語の台本

<gasp> まさか… <short pause> 本当に契約が決まったんですか? <laugh> やった!

文中のタグ・公式ガイドの例文

Wait… <short pause> did you hear that? <sigh>

指示の欄とタグの使い分け。指示の欄はその発言全体の感情・速さ・抑揚、文中のタグは笑い・ため息・息・間など書いた場所の一瞬の声。日本語の台本でもタグは英語のまま

この図は、1つの発言の中で「指示の欄」と「タグ」がそれぞれどこに効くかを示したものです。

2人の掛け合いは、相づちを縦線で囲む

もう1つ、3.8で面白かったのが2人の掛け合いです。社内検証の07では、営業と社長の会話を会話モードで作りました。相手の相づちは、台本の中で縦線で囲みます。

営業(指示の欄: a little nervous but hopeful)

社長、先月ご提案したAI研修の件なんですが |うん| 実は、三社から追加のお申し込みをいただきまして。

社長(指示の欄: surprised, then delighted)

<gasp> 三社も? |はい| それはすごいじゃないか <laugh> よし、今日はみんなでお祝いしよう。

結果は18.8秒の音声で、営業の話の途中に「うん」、社長の話の途中に「はい」という相づちが入り、自然な掛け合いになりました(AIの聞き取り)。研修動画の寸劇や、電話応対の見本音声に使える書き方かなと思います。なお、1回で作れるのは2人までで、使えるのは用意された声だけです。

2人の掛け合いの書き方。営業と社長の台本に、相手の相づち「うん」「はい」を縦線で囲んで入れると、話の途中に相づちが入った自然な会話になる。各話者に別の指示を付けられる

上の図は07の台本の構造です。相づちの位置と、話者ごとの指示の分け方を見てください。

熊本の市町村20の読みテスト——地名はひらがなで

地方の会社が音声AIを仕事に使うとき、よくぶつかるのが地名と社名の読みです。熊本の市町村20を漢字のまま読ませ、Flash TTSとFlash-Lite TTSで比べました。

地名正しい読みFlash TTSFlash-Lite TTS
八代やつしろ正解誤り(やしろ)
人吉・球磨・玉名・水俣・菊池・菊陽・多良木・嘉島・甲佐・山都―10とも正解10とも正解
益城ましき正解誤り(ますぎ)
合志こうし正解誤り(ごうし)
大津おおづ正解誤り(おおつ)
宇城うき誤り誤り(うちょう)
和水なごみ誤り(わずみ)誤り(わすい)
産山うぶやま誤り(うみやま)誤り(うずやま)
苓北れいほく正解誤り(れっぷ)
湯前ゆのまえ誤り(ゆまえ)誤り(ゆぜん)
南小国みなみおぐに正解惜しい(みなみおくに)
正しく読めた数16/2010/20

Flash TTSは20のうち16が正解でした。間違えたのは宇城・和水・産山・湯前の4つで、いずれも漢字のふつうの読み方からは推しにくい地名です。Flash-Lite TTSは10が正解で、八代を「やしろ」、益城を「ますぎ」と読むなど、県内では日常的に出る地名でもつまずきました。

ここで大事なのは、間違えた地名をひらがなで書き直したら、Flash・Flash-Liteとも全部正しく読んだことです。「うき」「なごみ」「うぶやま」「ゆのまえ」とひらがなにするだけで直ります。

念のため、20市町村をまとめてもう一度読ませる確認も2本(Flash・Flash-Lite)作りました。ひらがなに直した地名は、このときも全部正しく読みました。一方で、1回目は正しく「おおづ」と読めた大津が、2回目は「おおう」のように聞こえました。同じ文でも、作るたびに読みが揺れることがあるということです。なので、大事な地名・社名・人名は、最初からひらがなで書いておくのが安全です。地名を正しく読ませる手順は、結局これだけです。

  1. まず漢字のまま1本作って、AIか人に聞き取らせる
  2. 間違えた地名だけ、台本をひらがなに直す
  3. 固有名詞の多い台本(店舗一覧・ルート案内など)は、最初から読み仮名のリストを用意しておく

なお、社名の「WizTry」は「ウィズトライ」、「くまもと応援ナビ」「熊本被災者支援ナビ」も正しく読みました。英字の社名も、1例ではありますが正しく読めています。ただし自社名は、一度試してから使ってください。

もう1つ注意があります。この聞き取りはAI(Gemini 3.8 Flash)によるもので、AIが正しい読みに寄せて書き取った可能性は残ります。仕事で使う音声は、公開前に人の耳で確かめてください。

熊本の市町村20の読みテストの結果。漢字のままではFlash TTSが16、Flash-Lite TTSが10正解。読み間違えた地名をひらがなに直すと、その地名はすべて正しく読んだ。大事な名前は最初からひらがなで書くのが安全

この図は、漢字のままの正解数と、ひらがなに直した結果を並べたものです。

料金——1分いくら、用途別の月額、他社との比較

ここからは費用の話です。先に3つ、前提を書いておきます。2026年10月7日時点のGemini APIの料金ページの数字であること、1ドル150円は計算のための仮定であること、そして2027年1月1日から単価が2倍になる予定が料金ページに明記されていることです。最新の数字は、公式の料金ページで確認してください。

単価と「1分あたり」

モデル(区分)入力(文章)出力(音声)2027年1月1日から
Flash TTS(通常)$0.50$9.00入力$1.00、出力$18.00
Flash TTS(一括処理)$0.25$4.50入力$0.50、出力$9.00
Flash-Lite TTS(通常)$0.50$6.00入力$1.00、出力$12.00
Flash-Lite TTS(一括処理)$0.25$3.00入力$0.50、出力$6.00

単位はすべて100万トークンあたりの米ドルです。音声は1秒=25トークンなので、1分は1,500トークン。これを単価に掛けると、1分あたりの費用が出ます。

Flash TTS(2026年内)Flash TTS(2027年〜)Flash-Lite TTS(2026年内)
音声1分あたり$0.0135(約2円)$0.027(約4円)$0.009(約1.35円)

入力(文章)の分は、日本語のトークン換算が公式に書かれていないため正確には出せませんが、仮に1字1トークンとしても、10分ぶんの台本(数千字)で$0.002程度と誤差の範囲です。急がない音声をまとめて作る「一括処理」(BatchやFlexと呼ばれる方式。APIからだけ使えます)は半額です。

社内検証でも、「1秒=25トークン」は、地名の確認用の2本を含む17本すべてで一致しました(例: 8.08秒の音声が202トークン)。最初の15本・約3分5秒ぶんを有料の単価に直すと、合計で約$0.038(約5.7円)です。この実験は無料枠か有料枠かを確認していないため、あくまで有料単価に直した参考値ですが、試行錯誤の費用感はつかめると思います。

音声1分あたりの料金。Flash TTSは2026年内が$0.0135(約2円)、2027年からは$0.027(約4円)と2倍に。Flash-Lite TTSは2026年内が$0.009(約1.35円)。音声1秒=25トークンで、料金は音声の秒数で決まる

この図は、1分あたりの費用を3本の棒で並べたものです。2027年1月1日に真ん中の棒の高さになる、と見てください。

用途別の月額(作り直し込み)

音声は一発で決まりません。読み間違いや間の取り方で、同じ台本を2〜3回作り直すのが普通です。なので、完成した音声の3倍を作るものとして計算しました。

用途(完成→作り直し込み)Flash 2026年内Flash 2027年〜Flash-Lite 2026年内
研修・マニュアル動画のナレーション。月2本×15分(30分→90分)約182円約364円約122円
店内放送・院内アナウンス。30秒×10パターン(5分→15分)約30円約61円約20円
電話の自動案内。1分×10本(10分→30分)約61円約122円約40円
YouTube・SNS動画のナレーション。月4本×15分(60分→180分)約364円約729円約243円
オーディオブック1冊。5時間(300分→900分)約1,822円約3,645円約1,215円

ドルに直すと、たとえば研修動画のFlash 2026年内は$1.215、オーディオブック1冊は$12.150です。円は1ドル150円で計算しています。

月2本の研修動画のナレーションなら、作り直しを含めても月に200円前後。2027年に単価が倍になっても400円弱です。費用の問題というより、「誰が台本を書き、誰が聞いて確かめるか」という手間の問題だと分かります。

ただし、注意点が2つあります。一点目は、1回の生成は約10.9分が上限なので、15分のナレーションは2回以上に分けて作り、あとでつなぐことです。二点目は、ここに出した円の額は1ドル150円の仮定なので、為替によって変わることです。

用途別の月額の目安。研修動画のナレーション月30分は作り直し込みで約182円、店内放送5分は約30円、電話の自動案内10分は約61円、YouTube動画60分は約364円、オーディオブック1冊5時間は約1,822円。いずれもFlash TTS・2026年内・1ドル150円の仮定

この図は、上の表のFlash TTS・2026年内の列を棒にしたものです。2027年以降はそれぞれ2倍と読み替えてください。

他社と並べると——日本語10分でいくら

他社の音声AIと比べるときに厄介なのが、課金の単位がばらばらなことです。Geminiは音声の秒数、ElevenLabsは文字数、Fish Audioはデータ量(バイト数)で数えます。なので、「日本語の読み上げ10分=1分300字で3,000字」という前提をそろえて計算しました。この前提が変わると順位も変わるので、どれが安いと言い切るための表ではありません。

サービス・モデル課金の単位と単価日本語10分(3,000字)の目安商用・無料の条件(料金ページの記載)
Gemini 3.8 Flash TTS音声の秒数(1秒=25トークン)。100万トークンあたり$9.00約20円(2027年〜 約41円)無料枠あり(上限は未確認)。商用の明文はなし(後述)
Gemini 3.8 Flash-Lite TTS同上。100万トークンあたり$6.00約14円同上
ElevenLabs Eleven v4(API)文字数。1,000文字あたり$0.08約36円(2026年10月12日までの割引中は約10円)無料プランに商用ライセンスは付かず、Starter(月$6)から
Fish Audio(s2.1-pro・s2-pro・s1)データ量。100万バイトあたり$15.00(日本語1字≒3バイト)約20円商用条件と、最新モデル(s2.1-pro)の日本語対応は公式ページで確認できず
VOICEVOXソフト自体は無料0円商用・非商用とも利用可。クレジット表記が必要。声ごとの規約に従う

OpenAIの読み上げAPIは、分あたりの公式な換算が確認できなかったので、表に入れていません。

表から言えるのは、2026年内の単価なら、Gemini・ElevenLabs・Fish Audioは、どれも日本語10分で10〜40円ほどの範囲に入る、ということです。差がつくのは単価より、日本語の読みの正確さ、感情の付けやすさ、商用の条件、そして2027年の値上げ後にどうなるかです。ElevenLabsの割引は10月12日まで、Geminiの現在の単価は12月31日までと、どちらも期限つきの価格である点は覚えておいてください。

音声AIの課金の単位の違い。Geminiは音声の秒数、ElevenLabsは文字数、Fish Audioはデータ量(バイト数)で数える。日本語10分=3,000字の前提をそろえると、いずれも10分で数十円の目安になる

この図は、3社の「数え方」の違いを並べたものです。他社と比べるときは、まずこの数え方の違いをそろえてください。

仕事で使うときの決まり——無料枠・商用・声の複製

費用より大事なのが、ここです。会社で使う前に決めておきたいことを3つに分けます。

1. 無料枠で社外秘を扱わない

Gemini APIの通常の枠には無料枠があります(上限の数字は公式で確認できていません)。ただし料金ページには、無料枠は製品改善に使われ、有料枠は使われない、と明記されています。無料枠で送った文章と音声はGoogleの製品改善に使われ、人のレビュアーが読むこともある、というのが規約の書き方です。

無料枠有料枠
製品改善への利用ありなし
向いている使い方公開前提の文章で、書き方の練習社外秘・個人情報を含む台本、本番の音声
自分の声の登録勧めないこちらで

基本的には、「無料枠は練習、本番は有料枠」です。逆を返せば、公開済みのホームページの文章や、一般向けの案内文を読ませる練習なら、無料枠で十分に始められます。顧客名の入った電話案内や、未発表の商品の説明、そして自分の声の登録は、有料枠に切り替えてから。なお、課金が有効なGoogle CloudのプロジェクトにつないだAI Studioや、Workspaceの企業アカウントは、画面に無料と出ていても有料扱いになる、と規約にあります。自社がどちらなのかは、管理者に確認してください。

2. 商用は「許可の明文はないが、所有権はGoogleが主張しない」

「商用利用はできますか」は、検索でもよく出る質問です。正直なところ、Gemini APIの規約には「商用利用可」と明記した一文は見つかりませんでした。禁止の記載もありません。規約が書いているのは、次の4点です。

  1. Googleは生成物の所有権を主張しない
  2. 他の利用者にも似たものが生成されうる
  3. 法令の順守と、利用の責任は利用者にある
  4. 禁止用途の方針(なりすまし等)に従う

Gemini API自体が開発者の業務用途向けの窓口なので、仕事で使うこと自体を禁じる作りにはなっていません。ただし「商用OKと書いてあるから何でもできる」という読み方はできない、ということです。会社の広告や商品に音声を使うなら、規約の原文を一度読み、判断の記録を残しておくことをおすすめします。

3. 声の複製は、本人の同意と「なりすまし禁止」が前提

3.8の目玉の1つが「声の複製」ですが、誰の声でも複製できるわけではありません。

項目公式の条件
必要な音声同じ成人の話者の見本10〜30秒(24kHz・モノラル・16bitのWAV推奨)
同意本人が所定の同意文を読んだ録音が必要(日本語の同意文あり)
保存期間保存型は1プロジェクト200件・1年(使うたび延長)、使い捨て型は7日
使えない地域(AI Studio)イリノイ州・テキサス州・EEA・英国・スイス・インド(日本は列挙されていない)
禁止欺く目的で、明示なく実在の人(故人を含む)になりすますこと

社長の声で研修動画のナレーションを作る、という使い方は現実的です。その場合も、社長本人が同意文を読んだ録音が要ります。他方で、退職した社員の声、取引先の声、有名人の声は、同意が取れない時点で対象外です。公式ブログには、生成音声に電子透かし(SynthID)が入るとありますが、ガイドや規約には記載がないので、「透かしがあるから安全」と考えるのではなく、同意と用途で線を引いてください。

社内ルールにするなら、次の5か条で足りるかなと思います。

  1. 無料枠は練習だけ。社外秘・個人情報・自分の声は有料枠で
  2. 公開する音声は、公開前に人が聞いて確かめる(地名・社名・数字は特に)
  3. 声の複製は、本人の同意の録音がある声だけ。他人の声は作らない
  4. AIの音声だと伝えるべき場面(電話の自動案内など)では、冒頭で明らかにする
  5. 料金の前提(2027年1月の値上げ・為替)を、年に一度見直す

4つ目について、Googleの禁止用途の方針には、人をだます目的で「人だけが作った」と偽ることを禁じる項目があります。だますつもりがなくても、電話口で「人だと思っていた」と後で分かるのは、会社の信用に関わります。生成AIを会社で使うときの基本的な注意点は、経営者のための生成AI超入門でも整理しているので、合わせて読んでいただければと思います。

仕事で使うときの決まり5か条。1 無料枠は練習だけで社外秘と自分の声は有料枠、2 公開前に人が聞いて確かめる、3 声の複製は本人の同意がある声だけ、4 AIの音声だと伝えるべき場面では明らかにする、5 料金の前提を年に一度見直す

この図は5か条をチェックリストにしたものです。印刷して、音声を作る担当者の手元に置いてください。

始め方3ステップ(コード不要)

ここまで読んで「試してみたい」と思った方へ、最小の始め方です。プログラムは要りません。

  1. AI Studioの音声生成ページを開き、Googleアカウントで入る。まずは公開済みの自社サイトの文章など、社外秘でない短い文を1本、指示なしで作ってみる
  2. 出来上がりを聞いて、足りないところにだけ短い指示を足す。日本語なら「少し〜」「やや〜」から。地名や社名を読み間違えたら、その語だけひらがなに直す
  3. 本番の台本(顧客名・未発表情報を含むもの)や自分の声を扱う前に、有料枠に切り替える。切り替え方と無料枠の上限は、公式の料金ページとレート制限のページで確認する

画面の欄名やボタン名は、この記事ではあえて書いていません。画面は更新が早く、記事の説明が古くなりやすいからです。画面の案内に沿って、声を選び、台本を入れるところから始めてください。

始め方3ステップ。1 AI Studioの音声生成ページで社外秘でない短い文を指示なしで1本作る、2 足りないところにだけ短い指示を足し、読み間違えた地名はひらがなに直す、3 本番の台本や自分の声を扱う前に有料枠へ切り替える

この図は3ステップの流れです。最初の1本は、短い文で十分です。

よくある質問

確かめた事実の範囲で答えます。

無料で試せますか

Gemini APIの通常の枠には無料枠があり、AI Studioから試せます。ただし無料枠の上限(回数や量)は公式で確認できていません。また、無料枠で送った文章と音声は製品改善に使われるので、社外秘や個人情報は入れないでください。

商用で使えますか

規約に「商用可」の明文はありませんが、禁止もされていません。Googleは生成物の所有権を主張せず、利用の責任は利用者にある、という建て付けです。会社の広告や商品に使うなら、規約の原文を確認し、判断の記録を残してください。

一度に何分まで作れますか

1回の出力の上限は16,384トークンで、音声1秒=25トークンなので約10.9分です。15分や1時間の音声は、複数回に分けて作り、あとでつなぎます。1時間なら6回以上に分けることになります。

自分の声は使えますか

条件つきで使えます。同じ成人の話者の見本10〜30秒と、本人が所定の同意文を読んだ録音が必要です。他人の声を同意なく複製することは禁止されています。AI Studioでの声の複製は一部の国・地域で使えませんが、日本はその一覧に入っていません。自分の声を登録するなら、有料枠で行うことをおすすめします。

方言や地名は読めますか

熊本の市町村20の社内検証では、Flash TTSが16、Flash-Lite TTSが10を正しく読みました。読み間違えた地名はひらがなで書けば全部直りました。ただし同じ文でも作るたびに読みが揺れることがあったので、大事な名前は最初からひらがなで書くのが安全です。方言の話し方そのものについては、今回は検証していないので分かりません。

3.1までの書き方はそのまま使えますか

台本の中に演技の指示を書く書き方は、3.8では指示まで読み上げられました(社内検証02)。指示は別の欄(style)へ、一瞬の声は山括弧のタグへ移してください。長い人物設定を毎回貼る書き方も、声がぶれる原因として公式が非推奨にしています。

Geminiアプリ(チャット)で使えますか

公式の配布先一覧に、Geminiアプリは載っていません。使えるのはGemini APIとGoogle AI Studioです。公式の資料では、ほかにGemini Notebook(Flash TTS)やGoogle Vids(Flash-Lite TTS)も配布先に挙がっています。

まとめ——「台本は台本、演出は演出メモ」

最後に3行でまとめます。

  1. Gemini 3.8 TTSで感情を込めるコツは、台本には言葉だけ、感情・速さは指示の欄、笑いや間は山括弧のタグ、という3層を守ること。旧来の「台本に演技指示を書く」書き方は、3.8では指示まで読み上げられます
  2. 指示は「盛る」より「削る」。まず指示なしで1本作り、足りない発言にだけ短い指示を足します。日本語の指示も効きました。地名はひらがなで直せば読めます
  3. 費用は、研修動画のナレーション月30分で、作り直し込み約182円(Flash TTS・2026年内・1ドル150円の仮定・2027年からは倍)。費用より、無料枠に社外秘を入れないこと、声の複製は本人の同意がある声だけにすることが、会社で使うときの要です

音声は、研修・案内・広報と、中小企業の仕事の多くの場面に関わります。3.8の作法さえ押さえれば、ナレーターを手配する前に、自社で下書きの音声を作って確かめられるようになる、というところです。

WizTryでは、Gemini for Google Workspaceの研修をはじめ、生成AIを実務で使うための企業研修と、AIエージェントの導入支援を行っています。「研修動画やマニュアルに音声を付けたい」「社内でどこまで自動化してよいか決めたい」といった相談は、熊本の生成AI研修やサービス紹介をご覧のうえ、お気軽にお寄せください。

※本記事は2026年10月7日時点の公式情報と社内検証にもとづきます。料金・仕様・提供範囲は変わることがあります。特に料金は2027年1月1日に改定が予定されています。最新の情報はGoogleの公式ページでご確認ください。

参考にした一次情報

関連するご相談はお気軽に

お問い合わせする →
CONTACT

まずは、貴社の課題をお聞かせください。

「何から始めればいいか分からない」という段階のご相談も歓迎です。貴社の業務内容に合わせて、研修・AIエージェント導入・補助金活用まで含めた最適なプランをご提案します。