通用机器人控制
可控制不同形状和尺寸的机器人,从桌面系统到完整人形机器人,同一模型能够跨不同形态扩展。
Gemini Robotics 2 是 Google DeepMind 的物理 AI 机器人模型家族。此次发布聚焦三种模型:用于视觉-语言-动作控制的 Gemini Robotics 2、用于具身推理的 Gemini Robotics ER 2,以及用于在机器人硬件上本地执行的 Gemini Robotics On-Device 2。
该系统旨在帮助机器人理解指令、推理任务,并在广泛的不同形态中与物理世界交互。来源展示了其在人形机器人、双臂机器人、手和夹爪上的应用示例,包括全身运动、灵巧物体处理以及机器人之间的协作。
可控制不同形状和尺寸的机器人,从桌面系统到完整人形机器人,同一模型能够跨不同形态扩展。
将视觉和语言输入转化为运动动作,使机器人能够根据指令在物理世界中执行操作。
将控制扩展到人形机器人的全身运动,包括在杂乱环境中的迈步、下蹲、弯腰和保持平衡。
支持通过手和夹爪进行灵巧操作,包括五指、22 自由度的手以及标准双指夹爪。
使用具身推理模型来规划多步骤任务、与人类沟通,并在数分钟内跟踪进度。
包含一个针对本地执行优化的端侧模型,可利用少量数据快速适配新的机器人形态。
人形机器人可以执行需要走到物体旁、蹲下或弯腰抓取,并将其放置到杂乱房间中的目标位置的任务。
带五指手或平行夹爪的机器人可以执行打结、封装拉链袋或紧密装入容器等精细操作。
推理层可以将多步骤指令拆分为更小的动作,监控进度,并在较长任务中某一步失败时进行恢复。
当单个机器人无法独立完成工作时,多台机器人可以在共享工作流上协作,并使用推理模型来组织协同。
必须在没有互联网连接或低延迟云访问的情况下运行的机器人平台,可以使用本地模型进行本地控制和适配。
Gemini Robotics 2 是用于机器人控制的视觉-语言-动作模型。Gemini Robotics ER 2 是具身推理模型,负责规划多步任务并与人类沟通;而 Gemini Robotics On-Device 2 是本地、高效的 VLA 模型,可在机器人硬件上运行,无需依赖网络延迟或互联网连接。
Google DeepMind 表示,Gemini Robotics ER 2 可在 Google AI Studio 上使用,并在 Gemini Enterprise Agent Platform 中提供私测。VLA 和 On-Device 模型向早期访问合作伙伴开放。
页面将 Gemini Robotics 2 描述为一种用于全身控制和灵巧操作的模型,适用于从桌面机器人到完整人形机器人以及双臂系统等不同类型的机器人。
该公告强调了行走、蹲下、伸展、保持平衡以及操控物体等全身动作,也包括用手和夹爪进行的灵巧动作,例如打结、封口拉链袋以及紧密装箱。
来源称,这个本地运行模型适用于需要在本地执行的场景,包括没有网络延迟或互联网连接的情况。它还可以用几个小时的数据适配新的机器人形态。
ByteAsk 是面向 C 和 C++ 的终端优先 AI 编码 agent,可直接编辑仓库,并在展示 diff 前用真实编译器、调试器、sanitizers 和测试验证修改。提供免费版与付费方案。
Lasso 是一站式电商产品数据平台,用于丰富目录记录、处理供应商文件、生成产品内容并监控竞品,提供 Web 应用、REST API、SDK 和 MCP server,适合团队与开发者。
CreateOS Sandbox 是基于 Firecracker 微型虚拟机的隔离计算环境,用于运行代码和 agent 工作负载,支持私有网络、SDK、CLI 和 MCP 程序化控制。
hob 是面向编码 agent 的独立工作区,可将 agent 会话、终端、历史记录和后续工作围绕你已在用的工具与提供商有序管理,适合重视本地路由、历史和工作区结构控制的开发者。
Ably Chat 是用于构建自定义实时聊天应用的 chat API 平台,支持房间消息、输入指示、在线状态、表情回应与消息更新,并提供按使用量计费选项。
Botacts 是一个 AI 机器人和代理目录,可通过电话、邮箱、短信、WhatsApp、Telegram 或 Signal 联系。还支持提交新机器人并在发布前人工审核。