0466
SIGNAL テクノロジー
No.0466

GoogleのロボットAIが、複数台で勝手に役割分担するようになった

ADVERTISEMENT

出典:Google DeepMind Blog

産業用ロボットが工場に本格導入され始めた1980年代、現場に生まれたのは「ロボットの世話をする人間」という新しい職種だった。機械は動くが、状況を読まない。想定外のことが起きれば止まる。結局、ロボットの隣に人間が張り付いて、逐一判断を補う形が定着した。自動化が生んだのは、省人化ではなく役割の再配置だった。

その構図が40年以上続いてきた。

自動化への期待と現実のギャップは、今も物流・製造の現場で繰り返し語られる。「AIを導入したが、ロボットに指示を出す係が必要になった」「システムが止まるたびに人間が介入している」。テクノロジーが高度化するほど、人間が担う”通訳”の役割が残り続けるという皮肉は、ロボット工学の長年の宿題でもあった。

その宿題に、Google DeepMindが今回の発表で本格的に手を入れてきた。

新しいモデル「Gemini Robotics ER 2」が持つのは、三つの能力だ。カメラ映像をリアルタイムで解析して状況を判断する映像理解、複数のツールや制御系を組み合わせて複雑なタスクを完遂するオーケストレーション、そして異なる種類のロボット同士が共有の意味理解を通じて自律的に役割を分担する多機体連携。これらは個別の機能改善ではなく、「人間が逐一指示を出さなくてもロボットが動く」という状態を目指した一連の設計として読める。

特に注目すべきは複数ロボットの連携だ。これまでのロボット協調は、あらかじめ決められた手順に沿って動くものがほとんどだった。今回のアーキテクチャは、異なるメーカー・異なる機体が「共有の意味理解」をベースにコミュニケーションを取り、タスクを引き渡しながら完遂するという設計になっている。ApptronikのApollo 2とFrankaのF3 Duoという異種ロボットが連携するデモは、その方向性を象徴している。

誰の立場が変わるかは明確だ。これまでロボットの”通訳”として現場に必要とされていた人間の役割が、縮小する方向に動く。一方で、こうしたシステムを設計・統合する側の需要は高まる。自動化が省人化ではなく役割の再配置を生み続けてきたパターンは、ここでもまた繰り返されるかもしれない。

テクノロジーが「判断」を引き受けるたびに、人間に残る仕事の定義は書き換えられてきた。今回の発表が示すのは、ロボットが「動く機械」から「考えて協調する主体」へと移行し始めているという事実だ。その移行が現場でどう着地するかは、これから数年の実装が答えを出す。


3行まとめ

  • Google DeepMindは、映像理解・タスクオーケストレーション・複数ロボット間の協調という3つの能力を強化したロボット向けモデル「Gemini Robotics ER 2」を発表した。
  • 継続的なカメラ映像をリアルタイム解析してタスク進捗を5段階で分類し、失敗したステップをワークフロー全体のやり直しなしに自律的に修正・リトライできる。
  • 異なる種類のロボット同士が共有の意味理解を通じて通信・役割分担し、単体では完了できない複雑なタスクを協調して実行できる。

※以下は詳細

ADVERTISEMENT

映像をリアルタイムで読んで動くロボット

Gemini Robotics ER 2は、継続的なカメラ映像をリアルタイムで解析する映像理解の能力を持ちます。連続した映像フィードを監視することで、タスクの進捗を追跡し、問題が発生した際に適応し、次のステップへ移るべきタイミングを正確に把握します。

タスク進捗の分類では、映像の各フレームを5段階の進捗レベルに割り当て、ロボットにリアルタイムの状況認識を提供します。これにより、ワークフロー全体を最初からやり直すことなく、失敗したステップをその場で調整・リトライできます。

複数ツールを組み合わせてタスクを完遂するオーケストレーション

複数の機能やツールを組み合わせて複雑な作業を完遂する「タスクオーケストレーション」の機能も強化されています。開発者は、VLA(Vision-Language-Action)モデルやナビゲーションAPIといった低レベルの制御インターフェースをツールとして宣言し、映像・音声・テキストをモデルに直接ストリーミングできます。

Gemini Robotics ER 2はGemini Live APIと統合されており、レイテンシーに敏感なタスク向けに最適化された双方向ストリーミングによって、多段階タスクを途中で止まることなく実行します。Google Searchなどの外部ツールを呼び出す機能も備えています。

異なる種類のロボット同士が自律的に役割を分担する

複数ロボットの連携は、今回の発表における最も大きな変化です。Gemini Robotics ER 2は、異なる種類のロボットが共有の意味理解を通じてコミュニケーションを取り、タスクの引き渡しと完了を行う能力を持ちます。1台では対応できない複雑なワークフローを、複数台が協調して完遂できます。

実例として、ApptronikのApollo 2とFranka F3 Duoが連携して作業を行うデモが公開されています。異なるメーカーの機体が同一のタスクに向けて協調する形を、実装レベルで示したものです。

全体まとめ

Gemini Robotics ER 2は、映像理解・タスクオーケストレーション・複数ロボット間の協調という3つの能力を統合したロボット向けモデルです。現在、Gemini API・Google AI Studio・Gemini Enterprise Agent Platform(プレビュー)を通じて開発者向けに公開されており、物理AIエージェントの構築に利用できます。異種ロボット間の連携については、ApptronikとFrankaの機体を用いたデモが公開済みです。

ADVERTISEMENT
NEXT READS
SIGNALへ戻る
— END OF ARTICLE —
SIGNAL