AI時短ラボ
モデル· 約22分

Google、Gemini 3.8 Flash TTSと3.8 Flash-Lite TTSを発表──9/15公開の3.8 Liveとは別の読み上げ専用モデル、既製の声は2,000種類超、音声出力は10秒$0.0015〜$0.00225(2026年内)

Googleが2026年9月23日、音声合成専用の新モデルGemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSを発表した。9月15日公開の対話型音声モデルGemini 3.8 Liveとは別物。Googleによると、声は従来の30種類から、自然言語で一から作るVoice design、2,000種類超の既製の声、30秒の録音からの複製まで広がった。対応言語はAPIのモデルページでFlash TTSが130、Flash-Lite TTSが101。有料枠の音声出力は100万トークンあたり$9.00と$6.00(2026年内、10秒換算で$0.00225/$0.0015)。

Introducing Gemini 3.8 Flash TTS and 3.8 Flash-Lite TTS(Google公式ブログのタイトルカード)
執筆・編集:
目次

2026年9月25日未明・日本時間時点の情報です。 Googleが9月23日(米国時間)、音声合成に特化した新モデルGemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSを発表した。9月15日公開の対話型音声モデルGemini 3.8 Liveとは別物で、あちらが「AIと会話する」ためのモデルだったのに対し、今回の2本は「テキストを声にする」ことに特化している。Google公式ブログによると、声は自然言語のプロンプトで一から作る仕組みと、2,000種類超のあらかじめ用意された声のライブラリの両方を備え、開発者向けにはGemini APIとGoogle AI Studioで同日から順次提供が始まった。

3行まとめ

  1. 2モデル、用途で使い分け。 Gemini APIのモデルページによると、Gemini 3.8 Flash TTSは声の忠実度と演技の機微を追う「創作寄り」(対応130言語)、Gemini 3.8 Flash-Lite TTSは低遅延・低コストの「量産寄り」(対応101言語)。旧モデルgemini-3.1-flash-tts-previewの後継として推奨されているのはFlash-Lite TTSの方で、Flash TTSは新設のフラッグシップという位置づけ。
  2. 声の作り方が2系統+複製1系統。 自然言語のプロンプトで声を一から作る「Voice design」、2,000種類超の既製の声から選ぶライブラリ(APIでの名前はExtended Voice Library)、自分の声(または使用権を持つ声)を30秒の録音から複製する「Voice replication」。公式ブログによると、複製には声の持ち主の同意録音が必須で、Gemini Audioモデルが生成する音声には全てSynthIDの電子透かしが入る。
  3. 有料枠の音声出力は10秒$0.0015から。 料金ページによると、100万トークン(音声は1秒=25トークン)あたりFlash TTSが$9.00・Flash-Lite TTSが$6.00(いずれも2026年12月31日まで、2027年1月1日から倍額)。10秒の音声に直すと$0.00225/$0.0015。100万トークンあたりで比べると、旧gemini-3.1-flash-tts-previewの$20.00より安い。テキスト入力は両モデルとも$0.50(2026年内)。無料枠もある。

Gemini 3.8 Liveと何が違うのか

紛らわしいので先に整理する。Gemini 3.8 Live(9月15日公開、通常版とExtended Thinking版の2種)は、話しかけるとAIがリアルタイムに声で返事をするspeech-to-speech型の対話モデルだ。9月15日の公式ブログによると、会話の途中で97言語を自動で切り替えたり、会話を続けながら裏でツールやAPIを実行したりできる。

対して今回のGemini 3.8 Flash TTSとFlash-Lite TTSはtext-to-speech、つまり文字を音声に変換する一方向の合成モデルだ。Gemini APIのモデルページでも、入力はテキスト、出力は音声で、Live APIは「Not supported」となっている。Google公式ブログは今回の2モデルの位置づけを、次の1文で説明している。

These models complement our fast-growing Gemini Audio family, following 3.5 Live Translate, 3.5 Transcribe, 3.8 Live, and 3.8 Live Extended Thinking.

(これらのモデルは、急成長中のGemini Audioファミリーを補完するものだ。3.5 Live Translate、3.5 Transcribe、3.8 Live、3.8 Live Extended Thinkingに続く形になる。)

Google DeepMindのモデルカードも、Live・Live Extended Thinking・Flash TTS・Flash-Lite TTSの4つを「Gemini 3.8 Audio」として1枚にまとめている。つまりGoogleの整理では、TTSはLiveの後継や上位版ではなく、同じ「Gemini Audio」ファミリーの中で役割が違うモデルという扱いになる。音声認識専門のGemini 3.5 Transcribe、対話専門のGemini 3.8 Live、そして今回の読み上げ専門のTTSが横に並ぶ。

声はどうやって作るのか

公式ブログが挙げる声の用意の仕方は大きく3つ。

  • Voice design(声を一から作る): 「ロール」「アクセント」「声の特徴」を自然言語のプロンプトで指定し、100以上の言語・方言で新しい声を作る。ブログはこれをFlash TTSの機能として紹介しているが、APIのモデルページではFlash-Lite TTSもVoice designで作った声に対応すると書かれている。ブログのデモ音声は「メルボルンのハイテンションなDJ」「キンキンした単調なロボット声」「日本の龍」(音声そのものは本記事では試聴していない。後述)。
  • 既製の声のライブラリ(声を選ぶ): ブログによると、メキシコのスペイン語やケベックのフランス語、スコットランド英語(Scots English)といった地域差まで含む2,000種類超の声を使える。APIのモデルページでは「Extended Voice Library」という名前で、GET /v1beta/voicesから一覧を取得できる。
  • Voice replication(声を複製する): 30秒の音声サンプルから、自分の声、または使用権を持つ声を再現できる。ブログによると、声の持ち主による口頭の同意録音を用意し、それが複製元の話者と一致しなければ声を作れない同意確認の仕組みがあり、複製にはSynthIDの電子透かしとC2PAの来歴情報も組み合わされている。SynthIDについては、Gemini Audioモデルが生成する音声はすべて透かし入りだとブログは書いている。

作った声は保存して、継続中のプロジェクトで使い回せるとも書かれている。公式ブログはこの節を "Scale up from 30 original voices to an infinite library."(30種類のオリジナルボイスから、無限のライブラリへ)という1文で始めている。一方、ライブラリの声を選んで声色・高さ・速さ・アクセントを調整する「Voice remixing」は「Coming soon」(近日公開)の扱いで、時期は書かれていない。

演技をセリフ単位で指示する

公式ブログが強調するのは、1行ごとに演技を指示できる細かさだ。以下はブログの説明による。

  • セリフ単位の演出: 台本のト書きを自分で書くか、台本の自然な手がかりからGeminiに演技を任せられる(例は「落ち着いたカスタマーサポート」から「ささやき声のサスペンス」まで)。
  • 長尺での安定性: ブログは「数時間分の連続音声」でも声の品質・自然なペース・声色を保ち、話者のぶれが小さいとし、ポッドキャストやオーディオブック向けと位置づけている。APIのモデルページの書き方は「長い対話や数分単位のナレーション」で声の同一性・声色・音量・部屋鳴りが一貫する、で、時間の単位がブログと違う。
  • 2話者のシーン演出: 1本の台本から2人の会話を組み立て、自然な話者交代を保ったまま2人の声をはっきり分けられる。
  • 非言語の演技指示: <laughs>(笑う)、<sigh>(ため息)、<gasp>(息をのむ)といった山カッコのタグや、|mhm|「うんうん」|yeah|「そうそう」のような相槌を台本に埋め込み、笑いの間やリアクションのタイミングまで指定できる。なおAPIのモデルページが挙げるタグの例は<laugh>・<sigh>・<cough>・<breath>・<short pause>で、ブログの<laughs>とは綴りが違う。コードに写すならモデルページ側の表記を確認したい。

Hume AIのランキングで1位、演技と表現力の表では旧3.1が上

公式ブログはHume AIのベンチマークを引いて優位性を主張している。Flash TTSがVoice Design Benchmarkで総合1位(71.4)、アクセント再現でも1位(60.8)、Hume AIのOverall Quality IndexではFlash TTSが1位・Flash-Lite TTSが2位。加えて、日本語・ブラジルポルトガル語・ベトナム語・現代標準アラビア語(MSA)・メキシコスペイン語・ヒンディー語を含む主要言語で、ブラインドの人間評価「Voice Arena」でも競合の中で上位に入ったとしている。前世代のGemini 3.1 Flash TTSと比べて、長尺コンテンツと2話者の台本制御が大きく改善したとも書かれている。

本記事では、ブログがリンクしているHume AIの公開ページ(Real World VoiceEQ Bench、2026年9月25日未明に取得)の表を読んで数字を確かめた。ページ上のモデル名はgoogle/gemini-3.8-flash・google/gemini-3.8-flash-liteで、「-tts」は付いていない。

  • 「Voice Design - Overall」でgoogle/gemini-3.8-flashが1位・71.4、「Voice Design - Accent」でも1位・60.8。ブログの数字と一致した。
  • ブログが「Overall Quality Index」と呼んでいる順位は、ページ上では「TTS - Overall」という表で、1位がgemini-3.8-flash、2位がgemini-3.8-flash-liteだった。
  • 一方、同じページの「TTS - Acting / Role-fit」と「TTS - Expressiveness」では、前世代のgoogle/gemini-3.1-flashが1位で、3.8の2モデルはその下に並んでいた。「Voice Replication - Overall」(13モデル)ではgemini-3.8-flash-liteが7位、gemini-3.8-flashが11位。
  • ブログが改善を挙げた長尺については、「TTS - Long-form Speaker Stability」でgemini-3.8-flashが2位、gemini-3.1-flashが10位だった。

ブログが挙げた数字はHume AIのページと合っている。そのうえで、ブログが引いたのは総合と声のデザインの表で、演技・表現力の表では旧世代が上、声の複製の表では13モデル中7位と11位、という並びになっている。順位はページの更新で変わりうる。Voice Arenaの結果と、各表の評価手法(Hume AIの論文)には本記事は当たっていない。

旧TTSから移る開発者が直す2か所

Gemini APIのモデルページ(移行ガイド)を読むと、旧世代から移る際に実害の出そうな変更が2つある。

  1. 文中の指示が読み上げられることがある: モデルページによると、Gemini 3.8 TTSは入力テキストを「逐語の台本」として厳密に扱う。"Say cheerfully: Hello!"や"Speaker 1: Hello!"のような文中の指示は、声に出して読まれることがある("may be spoken aloud")。話し方(style)と話者名(speaker)は本文から外し、speech_metadataという構造化フィールドに移すよう案内されている。複数話者のリクエストでは、全てのターンにspeakerを指定する必要がある。
  2. 既定の出力フォーマットがWAVに変わった: 旧モデル(gemini-3.1-flash-tts-preview以前)はヘッダーなしの生PCM(audio/l16)を既定で返していたが、Gemini 3.8 TTSは単発(unary)のリクエストで、標準的なRIFFヘッダー付きのWAV(audio/wav)を既定で返す。モデルページは、生PCMに自前でWAVヘッダーを付けていたコードからはその処理を外すよう書いている。外さなければ、ヘッダー付きのWAVにさらにヘッダーを付けることになる。生PCM・mu-law・A-lawが必要ならresponse_formatを明示的に指定する。

モデルIDはgemini-3.8-flash-ttsとgemini-3.8-flash-lite-tts。モデルページのトークン上限は両モデルとも入力8,192・出力16,384。ただしGoogle DeepMindのモデルカードは、2モデルの出力を「64K token output」と書いており、APIのモデルページの数字と一致しない(入力は「Text up to 8K」で合っている)。APIのスキーマとプロンプトの構造は2モデル共通で、Flash-Lite TTSのモデルページは「1つのパラメータを変えるだけでモデルを切り替えられる」としている。

130言語と101言語、$9と$6──2モデルの比較表

項目 Gemini 3.8 Flash TTS Gemini 3.8 Flash-Lite TTS
モデルID gemini-3.8-flash-tts gemini-3.8-flash-lite-tts
公式の想定用途(モデルページ) 声の忠実度・演技の機微・方言の対応範囲を最大化 高スループット・低遅延・低コストの量産
対応言語数 130言語 101言語
旧モデルとの関係 新設のフラッグシップ(旧モデルの後継指定なし) gemini-3.1-flash-tts-previewの推奨後継
一般ユーザー向けの提供先(公式ブログ) Gemini Notebook Google Vids
無料枠(Standard) あり あり
音声出力価格(有料枠・100万トークン・2026年内) $9.00 $6.00
音声出力価格(有料枠・100万トークン・2027年1月1日〜) $18.00 $12.00
音声出力価格(有料枠・10秒換算・2026年内) $0.00225 $0.0015
テキスト入力価格(有料枠・100万トークン・2026年内) $0.50 $0.50
入力/出力トークン上限(モデルページ) 8,192 / 16,384 8,192 / 16,384

出典: Gemini APIモデルページ2本、料金ページ(Standard)、公式ブログ。「音声は1秒=25トークン」という料金ページの注記を使って100万トークン単価を10秒単価に計算し直し、公式が併記している換算値($9.00→$0.00225など)と一致することを確認した。

比較のため、同じ料金ページの旧gemini-3.1-flash-tts-previewは、Standard有料枠で音声出力$20.00・テキスト入力$1.00(いずれも100万トークンあたり)。新モデルのBatch・Flexの音声出力はStandardの半額、PriorityはStandardの1.8倍。料金ページの表では、無料枠で送ったデータは「Used to improve our products」(製品改善への利用)が「Yes」、有料枠は「No」になっている。

どこで、誰が使えるか

公式ブログによると、開発者向けはGemini APIとGoogle AI Studioで、両モデルとも9月23日(米国時間)から順次提供。AI Studioの試用ページはFlash TTSとFlash-Lite TTSがそれぞれ別URLでブログからリンクされている(ログインしていない状態で開くとGoogleアカウントのログイン画面に転送されることを、9月25日未明に確認した)。企業向けはGemini EnterpriseでのAPI提供が「近日公開」。一般ユーザー向けは、ブログの「For everyone」の欄にFlash TTSがGemini Notebook、Flash-Lite TTSがGoogle Vidsと書かれている。

ただし、同じ9月23日に出たGoogle Vidsの発表ブログは、Vidsへの搭載を次のように「近日」の扱いで書いている。

Coming soon, Gemini 3.8 Flash-Lite text-to-speech in Google Vids will turn any script into a natural-sounding voiceover across 100+ languages.

(近日、Google VidsのGemini 3.8 Flash-Lite text-to-speechが、100以上の言語であらゆる台本を自然な音声のナレーションに変える。)

TTSのブログは「rolling out starting today」(本日から順次提供)の見出しの下にVidsを並べており、同じ日の公式ブログ2本で、Vidsでの提供時期の書き方が揃っていない。

公式ブログによると、開発プラットフォームのAgora・LiveKit・Pipecat・VercelがGemini API経由でこれらのモデルを使った音声生成に対応するほか、Figma・HeyGen・Linguana・Wondercraft・99.co・Ollangが、吹き替えやローカライズ、音声エージェント向けに今回のTTSモデルを組み込むパートナーとして名前が挙がっている。

なお公式ブログの脚注には、AI Studio経由のVoice replication(声の複製)はイリノイ州・テキサス州・EEA・英国・スイス・インドでは利用できないと明記されている。除外の理由は書かれていない。

デモ音声は未試聴、Voice Arenaも未確認

本記事は公式ブログとGemini APIのドキュメントを文字として取得・照合したもので、ブログに埋め込まれた音声デモ(ロボット声・DJ声・龍の声など)は試聴していない。したがって「実際にどれくらい自然に聞こえるか」は本記事の確認範囲外で、公式の説明を紹介するにとどめている。

もう一点、執筆中に気づいたことがある。公式ブログは言語対応を「100以上の言語」と書いていて、130や101という数字はブログ本文に出てこない。APIのモデルページまで見ると、Flash TTSは130言語・Flash-Lite TTSは101言語と、2つの異なる数字になっている。どちらのモデルを使うかで対応言語数が変わることは、モデルページを突き合わせて初めて分かった。

本記事が当たった一次情報

  • Google公式ブログ「Gemini 3.8 text-to-speech says hello」(2026-09-23、著者はLeland Rechis氏とAlan Cowen氏)
  • Gemini APIのgemini-3.8-flash-tts・gemini-3.8-flash-lite-ttsの各モデルページ(対応言語数・トークン上限・移行ガイド)
  • Gemini APIの料金ページ(Standard/Batch/Flex/Priorityの4段。表はStandardの数字)
  • Google DeepMindのモデルカード「Gemini 3.8 Audio」
  • Hume AIの公開ページ「Real World VoiceEQ Bench」(2026年9月25日未明に取得した時点の順位)
  • Google公式ブログ「Anyone can make stunning HD videos with Gemini Omni in Google Vids」(2026-09-23)
  • 比較のためGoogle公式ブログ「Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking」(2026-09-15)

Voice Arenaの結果と、Hume AIの各表の評価手法は今回扱っていない。実際に生成した音声の聴き比べは、試した時点で別記事にする。

シェア: ポスト はてブ

出典・参照資料

AIニュースの解説を動画でも

YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

新しい記事をメールで受け取る

AIの新しい発表を、出典付きで整理して届けます。

関連記事

Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking(Google公式ブログの画像)
モデル09.18読了19分

Gemini 3.8 Liveと3.8 Live Extended Thinking公開──話しながら裏で考えて道具を動かす音声モデル、Artificial Analysisの音声対話指数で首位、音声は1分あたり入力$0.005・出力$0.018

出典 ─ Google公式ブログ(2026-09-15)
Gemini 3.5 Transcribeが正式提供──85言語以上を自動判定・話者最大8人分離を料金表で確認するの記事画像
プロダクト09.05読了11分

Gemini 3.5 Transcribeが正式提供──85言語以上を自動判定・話者最大8人分離を料金表で確認する

出典 ─ Gemini API Changelog(2
Google、Gemini 3.8 Flashと3.8 Flash Cyberを発表──6週間で3本目のFlash、Opus 5の7分の1の値段で金融・法務・長尺動画のベンチは上、汎用エージェントは19.1%対51.8%の記事画像
モデル09.02読了18分

Google、Gemini 3.8 Flashと3.8 Flash Cyberを発表──6週間で3本目のFlash、Opus 5の7分の1の値段で金融・法務・長尺動画のベンチは上、汎用エージェントは19.1%対51.8%

出典 ─ Google公式ブログ「Introducin
Nano Banana(ナノバナナ)とは──Googleの画像生成モデル4種(2 Lite・2・Pro・初代)の違い、API価格(1枚$0.034〜$0.24)、Geminiアプリでの使い方、参照画像14枚・4K・検索グラウンディング、初代の10月2日停止までの記事画像
モデル09.24読了12分

Nano Banana(ナノバナナ)とは──Googleの画像生成モデル4種(2 Lite・2・Pro・初代)の違い、API価格(1枚$0.034〜$0.24)、Geminiアプリでの使い方、参照画像14枚・4K・検索グラウンディング、初代の10月2日停止まで

出典 ─ Gemini API公式ドキュメント(Last updated 2026-09-17 UTC・9月18日取得)
gemini-robotics-er-1.6-preview、8月31日に終了──ロボット向けVLMのER 2移行で変わることの記事画像
モデル08.29読了19分

gemini-robotics-er-1.6-preview、8月31日に終了──ロボット向けVLMのER 2移行で変わること

出典 ─ Gemini API release not
Gemini Omni Flashが正式版に──動画の尺が10秒から40秒へ、720pは0.10ドル/秒で据え置きの記事画像
モデル08.27読了11分

Gemini Omni Flashが正式版に──動画の尺が10秒から40秒へ、720pは0.10ドル/秒で据え置き

出典 ─ Gemini API リリースノート(202
Google、Gemini 3.7 Flashを発表──3.6から3週間・導入価格は半額の0.75ドル、一方で総合指標と知識労働は他社の下の記事画像
モデル08.14読了22分

Google、Gemini 3.7 Flashを発表──3.6から3週間・導入価格は半額の0.75ドル、一方で総合指標と知識労働は他社の下

出典 ─ Google公式ブログ: Introduci
Google、Gemini 3.6 Flashなど3モデルを同時発表──出力トークン17%減・長文1Mで54.0%、一方でコーディング4種目は1位ゼロの記事画像
モデル07.22読了13分

Google、Gemini 3.6 Flashなど3モデルを同時発表──出力トークン17%減・長文1Mで54.0%、一方でコーディング4種目は1位ゼロ

出典 ─ Google公式ブログ: Introduci