罗盘 / 机器人真实世界示教数据瓶颈
暗星档案 · 未点亮的星

机器人真实世界示教数据瓶颈

本条为初评草案(AI 辅助编目):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。

机器人真实世界示教数据瓶颈T5 量级 · 新星
机器人学不会做家务,因为没有足够真实世界数据可学
暗星编号DS-1108
E · 能量与能力前沿
领域ai-computing
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难

训练能通用操作物理世界的机器人策略,需要大量「动作-状态」同步数据,而这类数据在互联网上并不存在,只能靠遥操作采集,2026年遥操作数据采集成本已从每小时约340美元降到约118美元,但每操作员每小时仍只能产出5-50条演示轨迹,是产能而非质量的瓶颈。Physical Intelligence的π0、NVIDIA的GR00T、Google DeepMind的Gemini Robotics等机器人基础模型都在追求百万级演示数据规模。攻破意味着有一套能大规模、低成本、高一致性采集真实世界机器人示教数据的产线体系(而不只是模型架构创新),让通用具身智能真正有「燃料」可用。

卡在哪 · 机制级卡点

遥操作数据高保真但产出速度慢、成本高,仿真数据便宜但存在「仿真到现实鸿沟」、人类视频数据丰富但缺少精确的动作标注;当前产业界的做法是三种数据源混合使用,但如何按具体任务、本体类型、预算目标去配比,尚无成熟方法论,扩大到百万级演示时数据物流(采集站点管理、传感器标定一致性、格式统一)本身也成为新瓶颈。

谁在攻

Physical Intelligence(π0模型)、NVIDIA(GR00T)、Google DeepMind(Gemini Robotics)均在推进百万级演示数据规模的机器人基础模型训练

怎么参与

机器人学/具身智能相关研究生课题;参与开源机器人数据集贡献(如Open X-Embodiment);遥操作数据采集相关的创业与外包岗位