Gemini

Gemini 3.8 の音声モデル: 言葉で声を作れる TTS とリアルタイム会話の Live

重要ポイント

  • 9月15日、Gemini 3.8 Live と 3.8 Live Extended Thinking(リアルタイムの音声会話)を公開
  • 9月23日、Gemini 3.8 Flash TTS と Flash-Lite TTS(文章の読み上げ)を公開
  • TTS は指示文で新しい声を作れる。2,000以上の声、100以上の言語・方言に対応
  • 30秒の音声から声を再現できる。ただし本人の同意の確認が必要で、使えない地域もある
  • 作った音声にはすべて電子透かし SynthID が入る

概要

Google は2026年9月、Gemini 3.8 世代の音声モデルを公開しました。リアルタイムの音声会話に使う 3.8 Live と、文章を表現豊かに読み上げる 3.8 Flash TTS です。TTS は、声の特徴を言葉で説明するだけで新しい声を作れるのが特徴です。

詳細

Gemini 3.8 Live

Live API の標準のモデルで、遅延の少ない音声エージェントに向いています。より深く考えてから答える「Extended Thinking」版もあり、複雑なやりとりに使えます。

Gemini 3.8 Flash TTS / Flash-Lite TTS

モデル向いている用途
3.8 Flash TTS声やキャラクターを細かく演出したい作品づくり
3.8 Flash-Lite TTS大量の読み上げを安く行う用途
  • 指示文から新しい声を作れる。2,000以上の声をすぐ使える
  • 100以上の言語・方言に対応
  • 台本の一行ずつに演技の指示を付けられる。2人の会話の掛け合いも自然に
  • 何時間もの長い読み上げでも、声の質や話し方を保つ

声の再現と安全対策

30秒の音声から声を再現できますが、本人の同意を確かめる手続きが必要です。米国のイリノイ州・テキサス州、EEA(欧州経済領域)、英国、スイス、インドでは使えません。作った音声にはすべて SynthID の電子透かしと C2PA の来歴情報が付きます。

使える場所

開発者は Gemini API と Google AI Studio で使えます。一般の利用者は Gemini Notebook や Google Vids から、企業向けの Gemini Enterprise には近日提供の予定です。

出典