Gemini Robotics 2 icon

Gemini Robotics 2

Gemini Robotics 2 は、Google DeepMind のロボティクスモデル群で、全身制御、巧緻な操作、異なるロボット形態をまたぐタスク推論に対応。接続や遅延の制約時に使えるオンデバイス版も搭載。

Gemini Robotics 2

概要

Gemini Robotics 2 は、物理 AI 向けの Google DeepMind のロボティクスモデル群です。発表の中心は 3 つのモデルで、Gemini Robotics 2 は視覚・言語・行動制御、Gemini Robotics ER 2 は具現化推論、Gemini Robotics On-Device 2 はロボットハードウェア上でのローカル実行を担います。

このシステムは、ロボットが指示を認識し、タスクを推論し、幅広い形態のロボットで物理世界と相互作用できるようにすることを目的としています。ソースでは、人型ロボット、両腕ロボット、手、グリッパーでの利用が示されており、全身移動、巧緻な物体操作、ロボット同士の協働の例が含まれています。

機能

汎用ロボット制御

卓上システムからフルサイズのヒューマノイドまで、形状や大きさの異なるロボットを制御し、同じモデルをさまざまな形態に拡張できます。

視覚・言語・行動制御

視覚と自然言語の入力をモーター動作に変換し、ロボットが物理世界の指示に従って行動できるようにします。

全身協調

ヒューマノイドロボットでの全身動作まで制御を拡張し、混雑した空間での歩行、しゃがみ込み、前屈、バランス保持を含みます。

巧緻な操作

5 本指で 22 自由度の手や標準的な 2 本指グリッパーを含む、手やグリッパーによる巧緻な操作をサポートします。

複数ステップのタスク計画

具現化推論モデルを使って複数ステップのタスクを計画し、人間とコミュニケーションを取り、数分にわたって進捗を追跡します。

ローカル展開と適応

ローカル実行向けに最適化されたオンデバイスモデルを備え、数時間分のデータで新しいロボット形態へ迅速に適応できます。

ユースケース

  • 全身を使う家庭内・作業空間タスク

    ヒューマノイドロボットが、対象物まで移動し、しゃがむか前屈してそれを取り、雑然とした部屋の目標位置に置く必要があるタスクに従えます。

  • 巧緻な物体操作

    5 本指ハンドや平行グリッパーを備えたロボットが、結び目を作る、ジップロック袋を密封する、容器にぴったり詰めるなどの繊細な操作を行えます。

  • 長期タスクの実行

    推論層が複数ステップの指示を小さな動作に分解し、進捗を監視し、長いタスク中にステップが失敗した場合に復旧できます。

  • 複数ロボットの協働

    1 台のロボットだけでは作業を完了できない場合でも、複数のロボットが共有ワークフローで連携し、推論モデルを使って協働を整理できます。

  • ローカルなロボティクス展開

    インターネット接続や低遅延のクラウドアクセスなしで動作する必要があるロボットプラットフォームは、ローカル制御と適応のためにオンデバイスモデルを使えます。

Pros and Cons

Pros

  • 卓上システム、両腕ロボット、ヒューマノイド、手、グリッパーを含む幅広いロボット形態をカバーしています。
  • 制御モデルと推論モデルを組み合わせ、ロボットが計画し、行動し、長いタスク列を追跡できるようにしています。
  • 静的な腕のみの制御よりも、人間が作った雑然とした環境に適した全身動作をサポートします。
  • 遅延や接続性が制約になる場合に、ローカル実行のためのオンデバイス विकल्पを備えています。

Cons

  • ソースでは、全身動作は依然として高速化の方向にあり、より高度な操作、特に複数指の巧緻なタスクはなお難しいとされています。
  • 公開情報では、統合、展開の詳細、早期アクセスやプレビューアクセス以外での一般提供について不完全です。

FAQ

Gemini Robotics 2、ER 2、On-Device 2 の違いは何ですか?

Gemini Robotics 2 は、ロボット制御向けの視覚・言語・行動モデルです。Gemini Robotics ER 2 は、複数ステップのタスクを計画して人間とやり取りする具現化推論モデルで、Gemini Robotics On-Device 2 は、ネットワーク遅延やインターネット接続に依存せずにロボットハードウェア上で動作するローカルかつ効率的な VLA モデルです。

Gemini Robotics 2 はどのように提供されていますか?

Google DeepMind によると、Gemini Robotics ER 2 は Google AI Studio で利用でき、Gemini Enterprise Agent Platform ではプライベートプレビューとして提供されています。VLA モデルと On-Device モデルは、早期アクセスのパートナー向けに提供されています。

どのようなロボットを制御できますか?

このページでは、Gemini Robotics 2 は、卓上ロボットからフルサイズのヒューマノイド、両腕ロボットまで、幅広いロボット形態に対応する全身制御と巧緻な操作のためのモデルとして説明されています。

どのようなタスクをサポートしますか?

発表では、歩行、しゃがむ、伸びる、バランスを取るといった全身動作に加え、結び目を作る、ジップロック袋を密封する、ぴったり詰めるといった手やグリッパーによる巧緻な動作が強調されています。

オンデバイスモデルはどのような場合に役立ちますか?

ソースによると、オンデバイスモデルは、ネットワーク遅延やインターネット接続がない状況を含め、ローカルでの実行が必要なケース向けに設計されています。数時間分のデータで新しいロボット形態に適応できます。

Quick Facts

カテゴリ
ワールドモデルと物理 AI
製品ファミリー
Gemini Robotics 2
ソースドメイン
deepmind.google
主要モデル प्रकार
VLA、具現化推論(VLM)、オンデバイス VLA
提供状況
ER 2 は Google AI Studio と Gemini Enterprise Agent Platform のプライベートプレビューで提供。VLA と On-Device は早期アクセスのパートナー向け
代表的なロボット形態
卓上ロボット、両腕ロボット、ヒューマノイド、手、グリッパー

Gemini Robotics 2の代替品

ByteAsk icon

ByteAsk

ByteAskは、C/C++向けのターミナル起点AIコーディングエージェント。リポジトリを編集し、コンパイラやデバッガ、サニタイザ、テストで変更を検証してから差分を表示。無料枠あり。

Lasso icon

Lasso

Lassoは、カタログ情報の拡充、仕入先ファイルの処理、商品コンテンツの生成、競合監視に使えるecommerce商品データプラットフォームです。REST API、SDK、MCP serverも搭載。

CreateOS Sandbox icon

CreateOS Sandbox

CreateOS Sandboxは、FirecrackerマイクロVM上でコードやエージェントのワークロードを実行できる分離型コンピュート環境です。SDK、CLI、MCPで制御可能。

hob icon

hob

hobは、エージェントのセッション、ターミナル、履歴、後続作業を、既存のツールやプロバイダーに合わせて整理できる独立したコーディングエージェント向けワークスペース。ローカルでの制御を重視する開発者に最適。

Ably Chat icon

Ably Chat

Ably Chatは、カスタムのリアルタイムチャットアプリを構築できるチャットAPIプラットフォームです。ルーム単位のメッセージ、入力中表示、プレゼンス、リアクション、メッセージ更新に対応し、利用量ベースの料金も選べます。

Botacts icon

Botacts

Botactsは、電話、メール、SMS、WhatsApp、Telegram、Signalで連絡できるAI bot・agentを探せるWebディレクトリです。公開前の手動審査にも対応。