0650
SIGNAL テクノロジー
No.0650

GoogleのAI、会話しながらリアルタイムで推論するようになった

ADVERTISEMENT

出典:Google DeepMind Blog

音声AIの歴史は、「話せること」と「考えられること」の分断として整理できる。

2010年代初頭、Siriが登場したとき、人々が驚いたのは「機械が声で返事をする」という体験そのものだった。正確さより、音声インターフェースとして成立することが先決だった時代だ。その後、会話の自然さは急速に改善されたが、構造的な限界は変わらなかった。複雑な問いには答えられないか、答えるまでに沈黙が生じる。速く話すか、深く考えるか。どちらかを選ばなければならなかった。

OpenAIがAdvanced Voiceを発表したとき、そのトレードオフは依然として残っていた。なめらかな対話は実現したが、難問に対してリアルタイムで推論しながら答えるという要件は別の話だった。速さと深さの両立は、音声AIにとって最後の壁のひとつとして立ち続けていた。

Googleが今回投じたのは、その壁への直接的な挑戦だ。

Gemini 3.8 Live Extended Thinkingは、会話の最中に推論プロセスを走らせながら、音声での応答を途切れなく継続する。「少し確認させてください」という言語的な橋渡しで沈黙を埋めつつ、バックグラウンドで多段階の処理を進める。聞き手には自然な会話として届き、裏では複雑なタスクが動いている。

誰が最初にこの恩恵を受けるかは、提供順序が語っている。開発者向けAPIが先行し、企業向けプライベートプレビューが続き、顧客対応領域への展開が予告されている。コールセンター、医療トリアージ、法律相談、営業ロールプレイ。「即座に答えながら、同時に正確でなければならない」現場が、この技術の最初の着地点として並んでいる。

それらの現場で働く人間の価値がどう変化するかは、過去の技術転換が繰り返し示してきたパターンで読める。ショートカットが広がるたびに、参入コストは下がり、競争は激しくなり、次の差別化が求められる局面が来る。今回の発表が意味するのは、「リアルタイムで考えながら話す」という能力が、人間の専有物でなくなる最初の段階だ。

誤情報リスクへの対応として、今回のモデルを含むGoogle製品が生成する音声にはすべてSynthIDの電子透かしが施されている点も、この技術が即時の実用展開を前提に設計されていることを示している。実験的な発表ではなく、社会実装を見据えた展開だ。


3行まとめ

  • GoogleはGemini 3.8 Live(標準モデル)とGemini 3.8 Live Extended Thinking(高複雑タスク向けモデル)の2種類を発表した
  • Extended Thinkingは音声対話を継続しながらリアルタイムで推論を行う機能を持ち、多段階タスクの処理に対応する
  • 両モデルはGemini APIおよびGoogle AI Studioで開発者向けに提供開始され、Google WorkspaceやGeminiアプリへの展開も順次進む

※以下は詳細

ADVERTISEMENT

2つのモデルの違い

今回発表されたのは、用途と性能特性が異なる2つのモデルだ。

「Gemini 3.8 Live」は、スケールとコスト効率を重視した標準モデルに位置づけられる。97言語を会話中に自動検出・切り替えするマルチ言語対応を備え、リアルタイムに近い視覚入力の処理にも対応している。ツールやAPI呼び出しをバックグラウンドで実行しながら会話を途切れなく継続できる点が特徴だ。

「Gemini 3.8 Live Extended Thinking」は、複雑なタスクに特化したモデルだ。推論と発話を同時に進める機能を持ち、「少し確認させてください」といった言語的な橋渡しで応答をつなぎながら、多段階のバックグラウンドタスクを進捗ナレーションとともにこなす。

開発者・企業向けの提供状況

現時点では、Gemini APIおよびGoogle AI Studioを通じた開発者向けアクセスが先行している。企業向けにはGemini Enterpriseでのプライベートプレビューが開始されており、Gemini Enterprise for Customer Experienceへの展開も予定されている。

APIを活用することで、AgoraやLiveKit、LangChain、Pipecat、Vercelといった開発者向けプラットフォームを通じた音声インターフェースの構築・デプロイが可能になっている。Salesforce、Genspark、Lumerisとの連携も合わせて発表されている。

コンシューマー向けの展開

一般ユーザー向けには、Search LiveでGemini 3.8 Liveの提供が始まっている。Gemini 3.8 Live Extended ThinkingはGemini LiveおよびすべてのGoogle AIサブスクライバー向けにGmailとKeepで利用可能になっているほか、Google AI ProおよびUltraサブスクライバー向けにはDocsでも展開されている。

SynthIDによる電子透かし

今回のモデルを含むGoogleのAI製品が生成するすべての音声には、SynthIDによる電子透かしが施されている。この透かしは知覚できない形で音声出力に直接埋め込まれ、AI生成コンテンツの検出を可能にすることで、誤情報防止への対応を図っている。

全体まとめ

GoogleはGemini 3.8 LiveとGemini 3.8 Live Extended Thinkingを発表した。標準モデルは低遅延対話・97言語対応・視覚コンテキスト処理を備える。Extended Thinkingは音声での会話を継続しながらリアルタイムに推論を行う機能を実装しており、多段階タスクの処理に対応する。現在はGemini APIおよびGoogle AI Studioで開発者向けに提供中で、Google WorkspaceやGeminiアプリなどコンシューマー向けサービスへの展開も順次進んでいる。すべての音声出力にはSynthIDによる電子透かしが施されている。

ADVERTISEMENT
NEXT READS
SIGNALへ戻る
— END OF ARTICLE —
SIGNAL