
摘要本文解读 CoRL 2025 论文《Few-Shot Neuro-Symbolic Imitation Learning for Long-Horizon Planning and Acting》。该论文提出首个把高层符号域与低层连续控制器同时从少量原始演示中学出来的神经符号模仿学习框架N-S IL通过融合演示到黑盒节点转移图的抽象、ASP 求解器的 PDDL 域归纳与Oracle 观测过滤加扩散策略让机器人仅凭5 条技能演示就能完成需要多步符号推理的长时程任务其特别之处在于人的参与被压缩到两件极轻的事——按图像比对高层状态、给状态转移打标签全程不需要写谓词、不需要符号标注、也不需要领域知识。实验在6 个域、4 种机械臂上验证叉车域 5 条演示冷启动成功率 0.4320 条达 0.95并零样本迁移到多托盘仓储任务取得 0.90而端到端基线在 Towers of Hanoi 上用了500 条完整演示仍然完全解不出来为长时程具身任务的数据效率问题提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机模仿学习为什么解不了长时程任务研究主线从问题到结论基准/方法设计把演示抽象成图让符号自己长出来分类全景四个核心设计要素方法细节Oracle 如何自动决定策略该看什么Oracle把符号抽象变成注意力机制动作步分解与扩散策略归纳出来的符号域长什么样训练、数据与硬件配方实验设计与结果结果对比总结关键发现为什么这篇论文值得关注Oral 信号分析叙事与措辞分析限制 → 空白 → 三重兑现局限性常见问题FAQNS-IL 到底需要多少条演示才能工作人工标注到底要做多少事它和传统 TAMP 的根本区别是什么为什么它能在 6 个完全不同的域上都工作为什么用扩散策略而不是直接回归动作这套方法现在还有什么不能做的参考链接论文基本信息项目内容标题英文Few-Shot Neuro-Symbolic Imitation Learning for Long-Horizon Planning and Acting标题中文少样本神经符号模仿学习长时程规划与执行作者Pierrick Lorang*、Hong Lu、Johannes Huemer、Patrik Zips、Matthias Scheutz机构Tufts UniversityHuman-Robot Interaction Lab/ Austrian Institute of Technology会议CoRL 2025PMLR v305arXivhttps://arxiv.org/abs/2508.21501项目网站https://youtu.be/E8slaN81oAA背景与动机模仿学习为什么解不了长时程任务模仿学习让机器人从示教中直接获得行为但它有两个结构性问题一是只看短时程技能二是对分布漂移毫无办法。论文给出的形式化起点很直接——模仿学习要学一个策略 $\pi(\tilde{s})$最小化与专家动作的均方误差 $L(\pi) \frac{1}{T}\sum_{t0}^{T}|\pi(\tilde{s}_t) - a_t|^2$。这个目标成立的前提是当前观测足以决定下一步动作。长时程任务恰恰打破了这个前提。要完成 Towers of Hanoi 或者多托盘装载机器人不仅要精确控制还要规划——先做什么、再做什么、什么时候等待。人类靠的是把问题抽象成符号表示而 TAMP任务与运动规划这条线虽然也做分层传统做法却把符号模型留给人工编写导致它又脆弱又难移植。更关键的是同时学符号和学控制这件事一直没人做成。论文对既有路线做了完整盘点这张表解释了本文的定位路线代表工作仍然缺什么符号模型学习Konidaris 等2018依赖预定义文法与谓词符号引导的强化学习PeORL、RAPid-Learn、Lorang 等符号状态仍需手工设计聚类归纳谓词Shah 等2024需要 50 条以上演示且难表达时序关系ASP/SAT 模型学习Bonet Geffner 2020Rodriguez 等 2021把求解器用于已有符号域域本身仍要给定本文 N-S ILLorang 等CoRL 2025—符号域与控制器同时学出论文的问题链也把动机收敛得很清楚观察模仿学习在短技能上表现不错但一进入需要多步推理的任务就崩。诊断瓶颈不在神经网络的容量而在缺少一个能泛化的高层结构——而学这个结构又需要符号标注。方案把每条演示看成两个高层状态之间的转移人只做图像比对与打标签让图结构自己承担抽象。系统化用最小双模拟压缩图用 ASP 求解器从图里归纳出 PDDL 域。验证六个域、两种仿真栈、三种端到端基线从 5 条演示起步做受控对比。从历史脉络看这条线的转向同样明显2011 年 Kaelbling 与 Lozano-Pérez 确立 TAMP 范式符号模型由人手工编写2021 年 Silver 等人在 IROS 上开始从少量示范计划里学算子2020 到 2022 年Bonet Geffner 与 Rodriguez 等人把域归纳形式化为 ASP/SAT 求解问题让学符号变得可计算2023 到 2024 年AutoTAMP 一类工作把大语言模型当作翻译器把自然语言转成 PDDL 再用符号验证器闭环纠错到 2025 年这篇论文符号域和控制器第一次被同时从少量原始演示中学出来人的角色退化成比对图像。也就是说这条研究线完成了从人写符号、机器执行到机器学符号、人只做视觉确认的迁移。图 1N-S IL 框架总览——符号侧负责规划什么神经侧负责怎么动研究主线从问题到结论图 9NS-IL 的研究主线——把学符号从专家直觉变成一个可求解的组合问题Mermaid 流程图基准/方法设计把演示抽象成图让符号自己长出来要让符号从数据里长出来第一步是解决标注从哪来。论文的答案是让人的工作尽可能不涉及符号知识。黑盒节点每个高层状态只以一张场景快照 一个编号的形式存在不给出任何符号语义。人需要判断的只有一件事——两个状态是不是同一个。这一步把标注门槛从会写 PDDL降到看得出一样。带标签的边每条技能演示被映射成一个节点转移 $(n_{\text{start}}, l, n_{\text{end}})$其中 $l$ 是人给的转移标签。所有技能共享标签空间例如pick(.)这个标签同时适用于苹果和橙子。最小双模拟初始图里会有大量结构等价的节点论文对整张图求最小双模拟 $\bar{G}$ 来消除冗余。这一步不只是好看——它是让 ASP 搜索可行的前提也让少量演示足以覆盖域结构。图同构约束下的域归纳给定图 $G$求解器寻找最简的规划实例 $P \langle \sigma, I \rangle$使得它诱导出的符号图与输入图满足 $G(P) \cong G$。输出的 $\sigma$ 就是 PDDL 域。这里有一个反直觉的设计实例的初值和目标不需要在演示阶段被逻辑化给出它们只用来维持符号记号的内部一致性。一个容易被忽略的细节是任务图本身有多轻量节点相对任务的求解顺序是无序的人也不需要描述节点之间的符号差异只要保证它们彼此可区分。不同域的图复杂度差别很大——Stacking 和叉车装卸的图只有两个节点加一条边因为它们是单技能任务、不需要规划而 Hanoi、Kitchen、Nut Assembly 和多托盘仓储才会形成真正的多节点结构。其中 Kitchen 特别典型它的图由两个簇构成簇间靠一条单向的WAIT或COOK边连接正是这条时序边把等食物煮熟变成了一个可规划的算子而这类时间依赖的转移恰恰是聚类方法很难发现的。图 10从演示图到 PDDL 域——四个设计要素如何互相供能Mermaid 分类图分类全景四个核心设计要素整个框架可以拆成四个互相咬合的要素黑盒节点负责降标注门槛双模拟化简负责压搜索空间Oracle 负责自动推导观测接口扩散策略负责在受限动作子空间里稳定控制。它们不是四个独立技巧而是一条流水线——符号抽象既用于规划又反过来决定神经策略该看什么。方法细节Oracle 如何自动决定策略该看什么Oracle把符号抽象变成注意力机制框架里最有杠杆的一步是Oracle。给定算子 $o_i$先定义会因它而改变状态的物体集合 $\mathcal{E}{o_i} {\varepsilon_k \in \mathcal{E} \mid \text{symbolic state of } \varepsilon_k \text{ changes under } o_i}$再由 $\gamma$ 做符号过滤、$\alpha$ 做坐标变换两者复合即 $\phi(\tilde{s}_t) \alpha \circ \gamma(\tilde{s}_t, o_i)$其中坐标变换写作 $\alpha(\tilde{s}, \mathcal{E}{o_i}) {\tilde{s}(\varepsilon_k) - \tilde{s}(\text{EE}) \mid \varepsilon_k \in \mathcal{E}{o_i}}$EE 是末端执行器。执行时策略只看到被过滤并重新参数化后的观测 $a_t \pi{exec}(\phi(\tilde{s}t))$。这套设计同时给出三样东西降维只保留相关物体、平移不变性坐标相对末端执行器跨布局泛化因此变好以及可解释性看一眼 $\mathcal{E}{o_i}$ 就知道这个技能关心什么。论文把它称为符号注意力机制它完全自动推导不需要任何人工观测设计。动作步分解与扩散策略技能还会被进一步拆成动作步演示中唯一标签是 MOVE 的域系统会自动识别出reach-pick → pick → reach-drop → drop四段每段被限制在更简单的动作子空间里。拆分的依据不是硬编码规则而是演示中一致的动作空间使用模式。低层控制用扩散策略建模它学的是对加噪专家动作去噪的过程损失为 $\mathcal{L}{\text{diff}} \mathbb{E}{(\tilde{s}t, a_t) \sim \mathcal{D}, \epsilon \sim \mathcal{N}(0, I)}\left[|\epsilon - \epsilon{\theta}(a_t \sigma \epsilon, \phi(\tilde{s}_t))|^2\right]$。选扩散而不是直接回归的原因是多模态动作分布——同一个观测下可能存在多条同样合理的轨迹直接回归会退化成平均值。论文也明确说明框架对具体模仿学习算法的选择保持开放。归纳出来的符号域长什么样把 ASP 求解器的原始输出摊开看是最能说明这套方法工作方式的证据。注意这些谓词本身没有语义是求解器自己发明的域归纳出的算子前置条件机器发明谓词效果Towers of HanoiMOVE $a_1(x_1,x_2,x_3)$$p_1(x_1,x_1), p_1(x_2,x_2), p_1(x_2,x_3), p_2(x_1,x_2)$$\neg p_1(x_1,x_1), \neg p_1(x_2,x_3), p_1(x_2,x_1), p_1(x_3,x_3)$Nut AssemblyMOVE $a_1(x_1,x_2,x_3)$$p_1(x_1,x_2)$$\neg p_1(x_1,x_2), p_1(x_3,x_2)$Forklift 仓储MOVE / LOAD / UNLOAD叉车空闲、叉车在该位置、托盘在该位置交换空位与位置装载或卸载托盘KitchenMOVE / TURNON / TURNOFF / WAITWAIT 需要炉子开着且食物在锅里产出已煮熟谓词求解器输出的谓词可以被人类事后翻译回来Hanoi 的 $p_1$ 与 $p_2$ 对应(on . .)与(greater . .)Kitchen 的 $p_2$ 对应(stove-on)、$p_4$ 对应(cooked .)。这正是这篇工作可解释性的来源——中间产物不是一堆权重而是能读的计划域。训练、数据与硬件配方复现这个框架需要的信息量其实不大。策略侧采用低维设定下的 Diffusion Policy训练视界 16 步观测 4 步、动作 8 步主干是 8 层、4 个注意力头、256 维嵌入的 Transformer启用因果注意力。扩散调度用 DDPM100 个训练时间步、平方余弦的 beta 曲线总共训练 8000 个 epochbatch size 256学习率 $1 \times 10^{-4}$带 1000 步 warmup 与余弦退火EMA 逆 gamma 1.0、上限 0.9999。数据方面演示由脚本自动生成并在所有动作维度上注入高斯噪声——均值取当前目标指令的一半、标准差 30%目的是在保持任务可行的前提下增加轨迹多样性。硬件上全部实验跑在单张 RTX 4090 加 64 GB 内存训练单个策略按任务复杂度与演示数量耗时20 分钟到 5 小时而学习符号域这一步在纯 CPU 上完成最快的是 Nut Assembly只需0 秒最慢的 Kitchen 大约要一天。完整评测符号域构建 规划 策略执行每个域约1 到 3 小时。图 2一次 MOVE 演示被如何过滤、变换与拆解——Oracle 与动作步分解的实例实验设计与结果评测覆盖6 个域横跨两套完全不同的仿真栈域仿真栈控制接口是否需要规划Stacking3 方块随机堆叠任务Robosuite笛卡尔夹爪控制否单技能KitchenRobosuite笛卡尔夹爪控制是Nut AssemblyRobosuite笛卡尔夹爪控制是Towers of Hanoi数字方块自实现Robosuite笛卡尔夹爪控制是Forklift 装载/卸载ROS2 Gazebo运动与货叉控制否单技能Multiple Pallets StorageROS2 Gazebo运动与货叉控制是叉车域值得单独说明铰接式运动学让插齿成为整个评测中最难的控制环节因为前向位移由后车体控制。演示全部是短时程技能堆叠、插齿、装载、卸载单条最长300 步且带观测噪声。评测协议每个 agent 跑30 个 episode结果在5 个随机种子上取平均每个策略训练8000 个 epoch主指标是长时程任务成功率泛化实验另报完成度推进。基线是三种端到端方案——(IL) 全轨迹模仿学习、(H-IL) 高层策略接地低层策略、(H-IL Dense) 高层策略接收整条轨迹而不是起点的一个点。为了保证信息对等基线的高层策略接收绝对观测低层策略与本文一样接收 $\alpha$ 变换后的相对观测。最核心的数据效率结论来自叉车域演示数量叉车装载/卸载成功率多托盘仓储零样本迁移50.43—100.58—200.950.90300.98—20 条演示这一行是关键装载卸载达到 0.95 的同时模型还能零样本迁移到更复杂的多托盘仓储任务取得 0.90。含义是符号抽象让更多托盘、更多区域这类扩展不再需要新演示——只要域结构仍然成立规划器就能自动组合出新的算子序列而神经策略处理的是被 Oracle 过滤后的局部观测对全局配置变化并不敏感。图 3三个代表性评测域——物理形态、控制接口与仿真栈完全不同框架一视同仁图 4主结果——在少至 5 条演示的条件下Neuro-Symbolic 方法同时拿下短时程与长时程任务图 5泛化实验——零样本迁移到更难的 Hanoi 配置以及用 5 条额外专家动作步演示做课程式微调图 6跨域任务图——人只需按图像判断状态是否同一不必理解节点的符号含义复现这套结果需要留意 Nut Assembly 这类域的特殊性圆螺母配圆柱销、方螺母配方销构成两组装配约束物体类型、几何结构与接触模式都与其他域不同但框架依然能从演示中归纳出可用的符号域。它也是符号域学习最快的一个域。图 7Nut Assembly 环境——域无关性验证符号域学习耗时 0 秒动作步分解带来的收益同样可测把技能拆成受限的动作子空间之后仅 5 条演示即可让 Stacking 这类任务接近 100% 的成功率。相比之下叉车域不做拆分因为那里的技能本身就已经很单一这也说明拆分是由演示中一致的动作空间模式自动识别的而不是硬编码规则。图 8动作步分解——拆分依据是演示中一致的动作空间使用模式结果对比总结图 11从失效基线到数据效率——NS-IL 在六个域上的成功率区间Mermaid 对比图关键发现差距是断崖式的不是渐进的。长时程推理上基线与500 条完整演示仍完全解不了 Towers of Hanoi——它们无法把任务分解出正确子目标最终退化为随机输出而本文能从部分演示中稳定抽象出问题约束。失败归因非常干净。所有失败都发生在低层技能没有达到预期效果的时候没有一次是推理本身出错。这句话的价值在于它证明符号层的求解器边界被正确识别了。动作步分解本身就是效率来源。把技能限制在更简单的动作子空间后仅 5 条演示就让成功率逼近 100%比多给数据更有效。短时程任务看不出差异这恰好是设计的一部分。叉车装卸与 Stacking 不涉及规划、只有一个物体、相对位姿已给定各方法表现接近一旦 Stacking 涉及多方块Oracle 的符号过滤加相对观测立刻拉开差距。零样本扩展成立。只在最基础的 3×3 Hanoi 配置上训练直接迁移到 4×3 至 7×5 的配置与最多10 厘米的柱位偏移绝对性能会下降但方法优势保持20 条演示的叉车模型迁移到多托盘仓储仍取得 0.90。学习符号域的成本极不对称。同一套流程在 Nut Assembly 上是0 秒在 Kitchen 上要约一天——瓶颈在域结构的复杂度而不在策略训练。为什么这篇论文值得关注Oral 信号分析用创新模式的视角看NS-IL 至少命中三条。重新表述为可解对象把从演示学符号重述为图同构问题——求最简的 $P$ 使 $G(P) \cong G$再交给 ASP 求解。这个重述的收益很具体规划实例的初值和目标不必在演示中被显式给出求解器依然能在 6 个域上一致恢复出正确域。分解并委托求解器任务拆开后分别委托给擅长它的组件——ASP 归纳符号域、Metric-FF 做经典规划、扩散策略执行算子。判断这种模式执行得好不好的标准是系统是否清楚每个求解器的能力边界而本文给出的证据相当干脆失败全部来自低层技能而非推理。设计混淆隔离诊断工具作者在叉车装卸与 Stacking 上刻意隔离技能学习与规划两个变量。隔离实验的结果是各方法在纯技能学习阶段表现一致差距只在引入多物体与长时程推理之后才出现——这直接把增益归因到了符号抽象而不是策略容量。叙事与措辞分析限制 → 空白 → 三重兑现论文的叙事走的是非常标准的三段式所有引用逐字来自原文。开场先立限制However, it typically focuses on short-horizon skills, struggles with distribution shifts over time, and generalizes poorly to novel situations.中间用一句to our knowledge定位空白To our knowledge, no prior work jointly learns low-level control policies and high-level planning models from a few demonstrations without relying on predefined symbolic states, predicates, or lexicon.结尾用一句收束兑现Our framework advances explainable, generalizable, and>局限性对数据质量敏感作者最初因演示动作过快导致精度下降把执行速度显著放慢之后插齿与堆叠的成功率才恢复。有效的数据集必须在多样性以支持泛化与一致性以支持高效学习之间取得平衡。依赖抓取点估计计算物体与末端执行器的相对位姿需要持续准确的有效抓取点估计失败会直接限制对新物体的泛化能力尤其在 Oracle 已经做了观测过滤之后。Oracle 自身的边界出现新动作如拧螺丝、新物体类型如螺丝刀或新谓词时需要往图里补充节点与图像配对若观测或动作空间因环境新异而改变则必须调整规划或重学控制器。只在仿真中验证全部结果来自 Robosuite 与 ROS2/Gazebo尚未接入真实人类演示。作者展望在真实叉车上采集专家演示明确要求不依赖 1:1 仿真映射、把全部 Robosuite 场景搬到真实 Kinova 机械臂上并引入 CLIP/GPT 这类基础模型自动完成状态匹配与技能标注。常见问题FAQNS-IL 到底需要多少条演示才能工作少至5 条技能演示即可冷启动叉车域 5 条演示成功率 0.43Stacking 这类任务借助动作步分解接近 100%。演示数量增加到 20 条时叉车域达到 0.95。作为对比三种端到端基线在 Towers of Hanoi 上用了500 条完整演示仍然完全失败。人工标注到底要做多少事只有两件给一次状态转移打标签例如pick以及通过比对快照图像判断两个高层状态是否同一。不需要定义谓词、不需要对象类型、不需要符号语义、不需要领域知识也不需要给出任务的初值与目标。它和传统 TAMP 的根本区别是什么传统 TAMP 的符号模型由人手工编写因此脆弱且难移植NS-IL 把符号域从演示里学出来——先建图、求最小双模拟压结构再用 ASP 求解器在图同构约束下归纳出 PDDL 域。人在其中的角色从写符号退化成看图像。为什么它能在 6 个完全不同的域上都工作因为抽象发生在域无关的层次节点与边只依赖状态是否相同这一视觉判断算子由求解器从转移结构里归纳而每个技能的观测接口由 Oracle 依据符号抽象自动推导。所以 Robosuite 的桌面堆叠和 ROS2/Gazebo 的铰接式叉车可以共用同一套流程。为什么用扩散策略而不是直接回归动作因为同一观测下往往存在多条同样合理的轨迹直接回归会退化成它们的平均产生模式崩塌。扩散策略学的是去噪过程能保留多模态的动作分布。论文也强调框架对具体模仿学习算法保持兼容。这套方法现在还有什么不能做的主要是真实世界所有结果都来自仿真作者把它明确列为未来工作。此外它依赖准确的抓取点估计面对全新动作或全新物体类型时仍需要人工补充图中的节点与图像配对符号域学习成本在不同域之间也相差极大0 秒到约一天。参考链接论文 arXiv 摘要页https://arxiv.org/abs/2508.21501作者提供的项目演示视频https://youtu.be/E8slaN81oAAB 站中文视频讲解https://www.bilibili.com/video/BV1cWak6zEQRBonet Geffner,Learning First-Order Symbolic Representations for Planning from the Structure of the State SpaceECAI 2020https://doi.org/10.3233/FAIA200361Silver, Chitnis, Tenenbaum, Kaelbling Lozano-Pérez,Learning Symbolic Operators for Task and Motion PlanningIROS 2021https://ieeexplore.ieee.org/document/9635941/Shah, Nagpal, Verma Srivastava,From Reals to Logic and Back: Inventing Symbolic Vocabularies, Actions, and Models for Planning from Raw Data2024http://arxiv.org/abs/2402.11871给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件