通用機器人控制
可控制不同形狀與尺寸的機器人,從桌上型系統到完整人形機器人,讓同一模型能跨不同機器人型態擴展。
Gemini Robotics 2 是 Google DeepMind 的物理 AI 機器人模型系列。此次發布聚焦三個模型:用於視覺-語言-動作控制的 Gemini Robotics 2、用於具身推理的 Gemini Robotics ER 2,以及可在機器人硬體上本機執行的 Gemini Robotics On-Device 2。
此系統旨在協助機器人理解指令、推理任務,並在多種不同機器人型態上與實體世界互動。來源示範了其在人形機器人、雙臂機器人、手部與夾爪上的應用,範例包括全身移動、靈巧物件處理,以及機器人之間的協作。
可控制不同形狀與尺寸的機器人,從桌上型系統到完整人形機器人,讓同一模型能跨不同機器人型態擴展。
將視覺與語言輸入轉換為動作指令,使機器人能根據指令在實體世界中行動。
將控制延伸到人形機器人的全身動作,包括在雜亂環境中的行走、蹲下、彎腰與平衡。
支援使用手部與夾爪進行靈巧操作,包括五指、22 自由度的手,以及標準雙指夾爪。
使用具身推理模型來規劃多步驟任務、與人類溝通,並追蹤數分鐘內的進度。
包含針對本機執行最佳化的裝置端模型,並能以少量數小時資料快速適應新的機器人型態。
人形機器人可以執行需要走到物體旁、蹲下或彎腰取物,並將其放置到雜亂房間中目標位置的任務。
配有五指手或平行夾爪的機器人可以進行繩結、封好 ziplock 袋或緊密裝入容器等精細操作。
推理層可以將多步驟指令拆解為較小動作、監控進度,並在較長任務中某一步失敗時進行恢復。
當單一機器人無法獨立完成工作時,多個機器人可在共享工作流程中協調作業,並使用推理模型組織協作。
必須在沒有網際網路連線或低延遲雲端存取的情況下執行的機器人平台,可使用本機模型進行本機控制與適應。
Gemini Robotics 2 是用於機器人控制的視覺-語言-動作模型。Gemini Robotics ER 2 是具身推理模型,負責規劃多步驟任務並與人類溝通;Gemini Robotics On-Device 2 則是可在本機、效率優化的 VLA 模型,可在不依賴網路延遲或網際網路連線的情況下於機器硬體上執行。
Google DeepMind 表示,Gemini Robotics ER 2 可在 Google AI Studio 上使用,並在 Gemini Enterprise Agent Platform 的私人預覽中提供。VLA 與 On-Device 模型則提供給早期存取合作夥伴。
此頁面將 Gemini Robotics 2 描述為可用於全身控制與靈巧操作的模型,適用於從桌上型機器人到完整人形機器人與雙臂系統等不同機器人。
公告重點包括走路、蹲下、伸展、平衡以及物件操作等全身動作,也包括用手和夾爪進行的靈巧動作,例如打結、封好 ziplock 袋,以及緊密裝填。
來源指出,本機模型適用於需要在本機執行的情境,包括沒有網路延遲或網際網路連線的情況。它可用數小時的資料適應新的機器人型態。
ByteAsk 是專為 C 與 C++ 打造的終端機優先 AI coding agent,先編輯儲存庫再用真實編譯器、除錯器、sanitizer 與測試驗證變更,並提供免費方案與付費方案。
Lasso 是一站式 ecommerce 商品資料平台,協助補強目錄資料、處理供應商檔案、產生商品內容與監控競品,並提供 Web App、REST API、SDK 與 MCP server。
CreateOS Sandbox 是以 Firecracker micro-VM 執行程式與 agent 工作負載的隔離運算環境,支援私有網路、SDK、CLI 與 MCP 程式化控制。
hob 是一個獨立的 coding agents 工作區,整合 agent sessions、終端機、歷史紀錄與後續工作,並維持你既有的工具與供應商設定。適合想保有本機路由、歷史與工作區結構控制權的開發者。
Ably Chat 是一個聊天 API 平台,適合打造自訂即時聊天應用程式。支援聊天室訊息、輸入中提示、在線狀態、表情回應與訊息更新,並提供依使用量計費選項。
Botacts 是一個 AI 機器人與代理目錄,可依電話、Email、SMS、WhatsApp、Telegram 或 Signal 聯絡。也提供提交新機器人供人工審核後上架。