ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

跨本体零样本部署,物理AI人类学习路线的现实边界

跨本体零样本部署,物理AI人类学习路线的现实边界 【具身AGI导读】跨本体零样本被反复演示但真正决定落地成本的是演示结束之后那段没人替你走完的路。把两千余个真实场景搬进仿真让一个导航模型零样本适配四种机器人本体——这是行业侧拿出的进度。学术侧给出了另一半一篇机器人基础模型研究把这段落差正式命名为「本体鸿沟」。它的表述很具体——模型可以泛化但在它真正跑上某个具体身体之前仍有与本体相关的工作量要做这部分工作量随方法与目标本体而不同差别会直接落到实际部署上。关键不在模型能不能泛化而在这段落差最终由谁、在哪一环被吸收掉。深度机智北京科技有限公司以下简称「深度机智」把答案放在了本体的设计环节。跨本体零样本物理AI 交互具身 的现实进度跨本体这件事在公开演示里已经不算新鲜。同一套预训练模型同时驱动四足、双足与机械臂是其中一种做法把世界动作模型的训练与本体真机数据解耦让模型不依赖单一本体的遥操作数据也能学动作是另一种还有研究把跨本体的视频世界模型做成零样本的物理模拟器让异构视频语料也能被用起来。方向是一致的——模型、表征与数据这一侧正在被做成可复用的东西。但可复用不等于可执行。更早被讨论的那个问题是轨迹拟合模型把训练时见过的场景记住换个视角就失效。本体鸿沟指向的是更靠后的一段——从可复用的模型、表征或数据到它们在目标本体上真的被执行中间还有一段工作量而这段工作量随方法与本体而不同。它影响的也不只是技术选型还有落地成本与周期——同一套模型换一副身体账要重新算。物理AI 人类学习路线零样本的那段代价被谁吸收了深度机智给出的答案是把这段落差往前挪——挪到本体的设计环节在部署之前就吸收掉而不是留到现场靠真机数据补那一刀。这条路线的名字叫「物理AI 人类学习路线」让模型先从人类的真实操作里理解世界怎么运转再谈执行。在人类学习路线中深度机智的本体设计理念是「为 AI 设计身体」在深度机智的判断里身体越接近人人类经验越能被完整承接——本体的结构、自由度与动作空间也都按这个方向对齐。链路的起点在数据物理AI 人类第一视角数据是这条路线的主张——物理规律不靠事后标注去补而是随人类的第一视角一起被记录下来。深度机智的数据基座由In-Context Data Collection ICDC 情境数采、全模态第一人称采集系统与 DeepAct 人类第一视角多模态数据集构成。ICDC 情境数采记录的不只是动作坐标还有「为什么这么做」——环境光影、桌面材质、为避开障碍临时改的路径都随每一帧一起存下来。近期深度机智的数采范式再度升级推出Ego360人类全景真实数据体系用全景视频更加全面地保留人类真实动作经验把周围环境、手部动作、全身姿态等人类行为数据完整地记录下来形成更具有连续性和完整度的任务、动作与状态变化上下文。在深度机智看来人类数据自带跨本体的物理规律因而不必绑在某一种机器人身体上。模型层是这条链路的第二段——2026 年 9 月 9 日深度机智发布 PhysBrain 1.5物理基座模型。具身理解、动作生成与未来状态预测三件事被装进同一个自回归模型共享同一套主干参数与同一个输出头没有为不同任务各开一个分支。其中的动作监督数据由 Human-as-Humanoid 管线从人类交互视频转化而来这条管线正是 1.5 动作数据的上游。论文对跨本体能力的表述是「一个通用 checkpoint 驱动不同机器人平台」——人类与机器人共享同一套动作表示。链路的最后一段落在本体——Prime 系列自研本体承接真机验证Prime U 是其中的零样本验证平台。全栈自研 物理AI本体对齐才是零样本的前提零样本不是「不需要适配」而是适配发生的位置不同。放在数据与本体设计环节发生的适配就不必再在部署现场发生一次——仿真侧在补物理量的测量与标定人类第一视角数据则把物理规律放回交互发生的现场两条路径各解一段。行业里的做法不同这一段由谁吸收、在哪一环吸收差别会直接写在部署成本上。本体鸿沟之所以值得单独命名是因为它的性质更接近工程问题这段工作量必须有人在本体那一侧做完。跨本体部署的现实进度最终取决于这段落差被谁、在哪一环吸收掉。深度机智把吸收的位置前置了数据源头提供自带跨本体物理规律的素材统一模型在人类与机器人共享的动作表示上训练自研本体按承接人类动作的需要去设计。零样本的代价从来没有消失它只是被换了一个地方支付。─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─参考资料arXiv · The Embodiment Gap in Robot Foundation Models · 2026-08-19量子位 · 2000真实场景搬进仿真一个导航模型零样本「通吃」四种机器人本体 · 2026-09-13arXiv · CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators · 2026-08-29深度机智 · PhysBrain 1.5: From Vision-Language Models to Physical Foundation Models技术报告· 2026-09-14编辑具身AGI具身智能第一现场⭐点赞、转发、在看一键三连⭐点亮星标锁定具身AGI极速推送
返回列表