ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

【阅读笔记11】机器人操作的数据金字塔《Data Pyramid for Embodied Manipulation》

【阅读笔记11】机器人操作的数据金字塔《Data Pyramid for Embodied Manipulation》 本篇位置本批第 11 篇。它和第 12 篇搜狐·42号电波解读的是同一篇综述——北大、南洋理工、港科大、新加坡国立、上交、上海AI Lab 等十余家机构近 30 位研究者 2026-07-28 联合发布的 72 页长文《Data Pyramid for Embodied Manipulation: A Survey》arXiv:2607.24744通讯作者北大仉尚航。两篇的分工第 12 篇是媒体概览发布次日写的快评这一篇是技术深读版8-11 发布十个章节逐层拆。要快速知道综述说了什么看第 12 篇要拿它当工作手册用看这一篇。一、亮点速读一段话看懂这篇这篇解读把综述拆成一个隐喻、两条主轴、四个维度、五层数据、三类模型、六个开放问题。一个隐喻就是数据金字塔塔尖是真实机器人数据塔基是互联网通用数据。两条主轴是全文的灵魂——可扩展性这份数据能多容易越攒越多和机器人对齐这份数据能多直接地帮真机学会执行动作二者负相关越贴近真机执行的数据越贵越难扩量越容易海量获取的数据对怎么动真家伙的指引越间接。四个维度是质量、多样性、可复用性、物理保真度——注意质量被排在第一位光堆量没用。五层从塔尖到塔基依次是真实机器人数据、UMI 风格数据、第一/第三人称数据、仿真数据、通用数据每层都给了长什么样、怎么采、优缺点。三类模型具身大脑/VLA/世界动作模型对数据的胃口不同具身大脑吃无动作数据建世界知识VLA 以带动作数据为核心监督、无动作数据靠 latent action/几何表征/中间监督三条路利用WAM两类都要。最后六个开放问题里触觉数据缺失被点名为金字塔最大的结构性缺口而数据配方各层比例怎么配被称为整个领域最被低估的问题。对数采岗位来说这篇综述等于把我们采的数据在行业坐标系里排第几层、缺哪层、怎么配第一次变成了可以公开讨论的公共语言。二、阅读笔记1. 金字塔的骨架两轴四维而不是五层名单很多人包括第 12 篇把这篇综述读成五层名单但解读版强调名单只是结果骨架才是贡献可扩展性Scalability取决于对硬件、人力、环境重置、安全监督、边际生成成本的依赖程度机器人对齐Robot Alignment数据能否直接帮机器人在真实物理世界学会执行动作两轴负相关所以不存在最好的数据只存在在你的预算和任务下最合适的层四个评价维度质量有效、一致、信息量大、任务相关重复轨迹/错误标注/信号没对齐都是虚胖、多样性任务/物体/场景/视角/指令/具身形态/传感配置/行为方式/结果的覆盖面决定分布偏移时稳不稳、可复用性能否跨任务/环境/本体/模型家族迁移、物理保真度接触、摩擦、柔顺、传感噪声、执行延迟、物体运动是否被忠实捕捉。这条骨架直接可用以后对内汇报数据规划可以不说我们要采 X 万小时而说我们在金字塔第几层补多少、四个维度上各打几分。2. 塔尖第一层真实机器人数据的三种采集范式最实用的一节综述把真机数据的来源归成三类比第 10 篇2024-12的两大类分得更细① 脚本化采集不靠人一条条操控规则执行检测→选位姿→接近→抓取IK运动规划自动生成适合规整工作空间但多样性有限轨迹回放录好的成功轨迹换摆放换环境重播扰动省人力但对环境变化敏感自主策略 rolloutRL/IL 训出的策略自己跑QT-Opt、MT-Opt 路线能覆盖失败-恢复行为但带策略偏见、产大量低质轨迹。② 遥操作人实时操控最适合接触密集的精细行为细分六种手法动觉示教直接用手掰机械臂适合固定底座主从式小号同构臂当手柄——ALOHA、GELLO 都是这条对双臂协调友好集成主从操控臂与受控机器人合二为一如 ARX AC-One有直观力反馈代价是人的手会入镜导致部署时画面分布漂移设备介导VR/XR 手柄、手机、SpaceMouse跨平台方便但精度和延迟是短板视觉遥操从 RGB/RGB-D 估人手动作再重定向HumanPlus、DexPilot成本低但怕遮挡和快速运动可穿戴/动捕重定向数据手套、惯性服、外骨骼高维稳定标定和重定向成本高。③ 人在回路增强把失败变成养料部署中遇到难搞或要失败的状态时人介入接管、记录纠错动作。谱系从 DAgger → ThriftyDAgger只在新奇/高风险状态求助→ Fleet-DAgger多机并行→ DexCap灵巧手接管→ CR-DAgger不打断自主执行、只做柔顺增量纠错。对数采岗的三条直接挂钩主从式那行就是知识库里 ALOHA/Gello 条目的学术归类集成主从手会入镜是选设备时一个很具体的坑人在回路 知识库 5.5部署后 free 数据回流通道的学术名字——我们规划回流通道时可以直接引用 DAgger 这条谱系做依据。3. 第二层 UMI关键在相对末端轨迹这个动作表示解读版把 UMI 的技术要点讲得比第 10 篇透UMI 不记录某个机器人专属的关节角而是用腕部相机IMU视觉惯性 SLAM 估手持夹爪的 6D 位姿轨迹和开合状态动作用相对当前末端的下一步目标表示——避免全局坐标系漂移、减少误差累积同时给出一个和具体身体无关的动作空间部署时再经标定/IK/低层控制器映射到不同机器人。演化谱系单臂夹爪UMI、FastUMI、LEGATO→ 双臂/灵巧手DexWild、DexUMI→ 移动平台UMI on Legs→ 多视角/3D 感知/触觉力感知ViTaMIn、FreeTacMan、exUMI规模从几百条到 FastUMI-100K、RealOmni、Daimon-Infinity 的十万至几十万条。综述的结论很清醒UMI 是真实机器人数据的可扩展补充而非替代——具身差距视角、末端几何、运动学、动力学、接触条件并未完全消除且缺机器人专属的本体感知和驱动动力学。4. 第三层 第一/第三人称硬件矩阵与监督怎么造为什么排中间比仿真真真实物理、灵巧手、日常多样性比 UMI 离机器人远镜头跟人走、手遮接触区、身体场景出画采集硬件三类视觉单目 RGB双目 RGB-D事件相机各自的怕点无深度怕模糊遮挡标定和纹理要求稀疏运动姿态追踪IMU 怕漂移手部穿戴传感器精度高但受干扰头显 inside-out 动捕便携但依赖专有管线辅助交互传感注视与音频肌电 EMG 被遮挡也有效但依赖贴片指尖力触觉阵列直接给接触证据监督四类 × 三条构建路线语义、几何、多模态、机器人导向四类监督每类都有人工标注模型预测拟合传感器直接捕捉三条路成本和误差来源各不相同根本局限局部可观性问题 缺机器人本体感知/驱动动力学/可直接执行动作人-机身体差距未解决。采集上是权衡无设备录制好扩量但缺精确标签穿戴传感更准但受成本/耐用性/负担限制。5. 第四层 仿真基础设施、四种生成法、世界模型当模拟器三大基础设施具身与传感系统URDF/MJCF/USD 描述文件物体与场景资产不只要好看的网格还要碰撞几何、质量惯性、材质、抓取/铰接标注——ShapeNet/Objaverse 给形状多样性Google Scanned Objects/OmniObject3D 提真实感PartNet-Mobility 给铰接PhysXNet/PhysX-Mobility 给物理感知即插即用ManiTwin 用 AIGC 生成 10 万 物体扩池子物理与渲染后端MuJoCo 刚体接触Isaac Gym·Lab GPU 并行SAPIEN 铰接PyBullet 轻量SoftGym 可形变Genesis·Newton 多物理可微——引擎本身决定数据能长什么样合成演示四种生成法人在仿真里执行保真但受人力限制常作种子规则执行可复现、边际成本低但表达力受限于写死的专家轨迹回放与扩展MimicGen、DexMimicGen、RoboCasa少量种子在新物体/场景复用自主/生成式 rolloutRL/IL策略、LLM/VLM 生成任务程序、世界模型批量产数据——GenSim、RoboGen、RoboTwin、InternData 系列世界模型当模拟器综述里很新的一块三种角色——策略训练的虚拟环境World4RL 等、策略评估器WorldGym、WorldEval、合成数据引擎GigaWorld-0、DreamGen好处是不用手搓资产、能建模时序演化坏处是产出看起来合理但物理上不成立的轨迹需过滤和真数据校准Sim-to-Real 两类不匹配观测不匹配纹理、光照、材质、深度噪声、触觉响应交互不匹配再分运动学差距——形态/关节限位/坐标系/控制频率和动力学差距——执行延迟、柔顺、摩擦、接触、形变只被部分建模。综述的原话级判断核心问题不是能造多少而是造的数据是否抓住了决定真机部署成败的感官变化和不可约的动力学不确定性规模≠多样性综述用 InternData-A1 举例——技能受限的生成会让动作关键点挤在一小块区域大量重复。和知识库 RoboTwin 条目对读综述把 RoboTwin 归在LLM/VLM 生成任务程序的自主 rollout 一支与 GenSim、RoboGen、InternData 同列结合解读版提到的英伟达 SimFoundry、字节 TableVerse可以看到一条清晰的趋势线——仿真数据生成正从人类手写专家策略转向LLM 驱动的自动生成RoboTwin 正是这条线上的代表工作。6. 第五层 通用数据按能贡献什么能力分七类视觉-语言语义与常识推理LLaVA 系列等分割与定位把语义落到空间区域SA-1B、RefCOCO、RoboPoint 等是从认出杯子到知道抓哪的接口3D深度/点云/重建/空间问答给几何脑规划目标拆步骤ALFRED、EgoPlan-IT、ShareRobot语义到执行的中间推理层视频与时序感知记忆Ego4D NLQ、Moment-10M物理/因果/失败推理CLEVRER、IntPhys、RoboFail抓取GraspNet-1Billion、DexGraspNet 2.0指定末端在哪、怎么接触。结论当宽泛的感知-语义-推理先验用再由更贴近机器人的层去接地到物理执行。7. 异质数据怎么被基座模型吃进去配方、动作空间、三类家族数据配方四个趋势从单一真机轨迹走向异质混合但最优配方未定论——纯机器人数据训的 LingbotVLA、DreamZero 也很强没有证据表明塞越多源越好预训练规模跨入十万小时时代Qwen-RobotManip 约 3.81 万小时多源语料、Xiaomi-Robotics-1 超 10 万小时 UMI 轨迹第一人称数据地位上升从辅助源变成介于通用网数据和具身轨迹之间的预训练基底HumanScale 最高 5000 小时精选、EgoScale 扩到 2 万 小时带动作标签对低质量数据容忍度上升π0.7配足够清晰的提示时低质量轨迹也有用——可能预示从猛过滤转向显式标注轨迹质量与意图。动作空间对齐跨具身训练的技术核心两个层面结构对齐三法具身特定投影保留各自动作接口、适配器映射到共享骨干GR00T N1、Octo固定维度零填充统一向量长度、空闲维填零有效性掩码π0、Qwen-VLA语义动作槽共享向量每个维度固定物理含义如 Qwen-RobotManip 的 80 维规范状态-动作向量不同机器人只填相关子集——对齐最强几何对齐三坐标系机器人中心、相机中心让视觉相似动作数值更一致、手腕中心手部局部关节与全局腕部运动解耦METIS、LDA-1B。综述直言现有研究对各坐标约定的受控消融太少哪种最好仍不清楚。三类模型家族的数据胃口具身大脑重理解不重出动作无动作数据建世界知识带动作数据转成 affordance/抓取位姿/路点/子任务标签等可迁移监督VLA带动作数据是直接监督——RT-2 离散 action token 自回归或 π0/GR00T/RDT 的扩散头、π0.5/SmolVLA 的流匹配头无动作数据靠 latent action 代理LAPA、UniVLA、显式几何表征Track2Act、General Flow、层级中间监督CoT 式三条路WAM带动作数据对齐未来演化↔可执行动作无动作数据只做观测级未来预测常见两阶段配方大规模无动作预训练打动力学底动作条件后训练接地。8. 六个开放挑战综述的未来押注清单按收集什么怎么收集怎么用三条线①触觉数据缺失——金字塔缺了一层接触信息RoboMIND 2.0、Humanoid Everyday 已开始纳入但仍未成标准模态②失败与恢复数据——现有数据集严重偏向成功专家演示需要更丰富的失败标注前因、发生时刻、类别、原因、恢复动作、最终结果③跨金字塔层的可扩展采集管线——穿戴多传感设备仍不成熟怕遮挡、漂移、标定麻烦未来要更轻、无线、模块化、低侵入自动跨设备标定④跨具身状态-动作对齐——坐标约定、标定参数、控制器模式应作为一等公民元数据记录⑤第一人称先验用于灵巧手——把人视频当结构化交互先验而非精确动作标签再用机器人数据接地⑥数据配方本身——各层最优比例、采样比、分阶段分配远未确定且缺计算量匹配的受控消融。和知识库第五部分六件事的对读综述的④坐标/标定元数据一等公民≈ 我们的 5.4②失败数据保留≈ 我们的 5.5 回流通道⑥配方与消融≈ 我们的 5.1 KPI 与 5.6 评价指标。我们半年前自己推出来的几条工作原则和这篇 30 人综述的开放清单高度重合——这不是巧合是同一个瓶颈的两面。对内汇报时可以直接引用综述给我们的规划背书。9. 质量警告综述把质量放在四个补充评估维度之首解读版结尾转述了综述的警惕其一自动标注的质量稀释——VLM 自动生成的标注可能含幻觉对象、错误关系、模板化语言自动标注通常需要经过置信度估计、一致性检查或人工验证才能使用其二多样性与质量的权衡——高多样性数据来自不可控的实验室外高质量数据来自可控的实验室里。包括信息密度、标注可信度、物理一致性等指标在内的数据质量评估体系可能是比 Scaling Law 本身更紧迫的基础设施建设——这句和知识库 5.6把缺评价指标当成机会是同一句话的两种说法。三、重点名词解析机器人对齐Robot Alignment数据能多直接地帮机器人在真实物理世界学会执行动作。金字塔的纵轴之一与可扩展性负相关。特权标签Privileged Labels仿真白送的、真机几乎拿不到同等精度的标签——每个物体的 6D 姿态、每个接触点的力分布、每步关节精确状态、任务成功与否。仿真数据的真正价值之一。反事实数据生成真机只能记录发生了什么仿真可以可控地生成可能发生什么结构化探索用于学鲁棒策略。语义动作槽Semantic Action Slot跨具身结构对齐三法中最强的一种——共享动作向量的每个维度固定物理含义不同机器人只填自己相关的子集Qwen-RobotManip 的 80 维规范状态-动作向量。潜在动作代理Latent Action Proxy从无标注视频学习动作相关的隐式表征LAPA、UniVLA优势是可规模化仍需少量真机演示落地。人在回路Human-in-the-Loop/ DAgger 谱系部署中失败或临界状态由人接管并记录纠错动作把失败转成恢复数据。DAgger → ThriftyDAgger → Fleet-DAgger → DexCap → CR-DAgger。局部可观性第一人称第一人称视角下手会遮挡接触区、身体场景出画导致观测不完整需第三人称相机或后处理补。数据配方Data Recipe各层数据的组合、采样比例、分阶段分配策略。综述称其为整个领域最被低估的问题。世界-动作模型WAM以世界如何演化、动作如何改变世界为主目标的模型家族可当学出来的模拟器、规划器、策略评估器、合成数据引擎。与具身大脑重理解、VLA重出动作并列三类。四、数字速查表数字含义档口径说明72 页 / 近 30 位作者 / 十余家机构综述本体规模arXiv:2607.247442026-07-28 发布通讯作者北大仉尚航RT-113 万条 / 700 任务真机数据集规模综述转引原论文口径RoboMIND107K 条 / 479 任务RoboMIND 2.031 万条 / 739 任务 / 超 1000 小时真机数据集规模综述转引AgiBot World Beta100 万条轨迹 / 近 3000 小时真机数据集规模综述转引与知识库既有口径一致Open X-Embodiment超 200 万条轨迹跨机构聚合真机数据⚠️本篇知乎写超 200 万第 12 篇搜狐写240 万条 / 22 种平台两篇都转引自同一综述数字不一致引用前需回 arXiv 原文核对EgoScale1,000 → 20,000 小时性能持续提升未见天花板自我中心数据预训练缩放实验英伟达披露综述转引是方向性 Scaling Law 线索不是已证实的 Scaling LawXiaomi-Robotics-110 万小时 UMI 预训练 1 万小时跨具身后训练含 7,200 小时自有真机 1,000 小时指令标注 UMI两阶段训练配方厂商报告综述转引HumanScale最高 5000 小时精选第一人称数据规模综述转引EgoDex829 小时Apple Vision Pro 采集第一人称手部交互数据综述转引原论文DexGraspNet 2.04.27 亿抓取样本仿真/抓取数据规模综述转引SA-1B11M 图像 / 1.1B 分割掩码通用数据规模综述转引原论文Qwen-RobotManip约 3.81 万小时多源语料预训练规模厂商报告综述转引ManiTwin10 万 AIGC 生成物体仿真资产池综述转引六、原文原文入口https://zhuanlan.zhihu.com/p/2070472232380392009 知乎专栏作者叶子2026-08-11 发布被解读的一手文献《Data Pyramid for Embodied Manipulation: A Survey》arXiv:2607.247442026-07-28。短评述性引用均出自解读原文加引号标注论两轴矛盾和真实机器人执行最贴合的数据每一条动作都能直接在真机上跑往往最贵、最难扩大规模而能轻松海量扩产的数据比如网上的图片文字对怎么动真家伙的指引却很间接、很模糊。论仿真价值核心问题不是能造多少而是造的数据是否抓住了决定真机部署的那些感官变化和不可约的动力学不确定性。论质量基建包括信息密度、标注可信度、物理一致性等指标在内的数据质量评估体系可能是比 Scaling Law 本身更紧迫的基础设施建设。图片一律未搬运。解读中的图 1数据金字塔即本批用户附图所示的五层结构图 2—4 为两轴空间示意、三类采集范式、三类模型家族取数差异如需请回原链接。
返回列表