)
「6%参数统一组间位姿估计」目录01 已知每组内部的关系不等于知道两组如何对齐02 现有方法的缺口关键不只是“有没有几何”还有“在哪里使用几何”1. 先估计图像对再聚合成组级结果2. 多视图基础模型能联合看图但未必理解“两组”的结构03 方法架构让基础模型处理组内几何让桥接模块学习跨组关系1. 分组编码先把每组“放回自己的几何里”2. 重采样用少量 token 承载组内信息3. 跨组桥接既告诉模型“来自哪里”也告诉它“对齐到哪里”4. 位姿输出一次前向将所有目标帧放进共同参考系04 实验结果从跨季节对齐到仿真训练、真机测试1. 跨季节难点究竟出在“看不懂场景”还是“连不上两组”2. 多相机里程计利用已标定的阵列估计两个时刻之间的运动3. 仿真到真实仿真训练的几何能力能否迁移到真实相机4. 输入几何有误差模型会照单全收吗5. 轻量体现在哪里少训练参数也减少重复的图像对推理05 从给定图像组到实际应用先选出值得比较的两组机器人在冬天记录了一段校园轨迹到了夏天又沿着附近的道路经过。树木、光照、路边物体都变了如何把这两次观测对齐另一台机器人装有多个朝向不同的相机。相机之间的安装关系已经标定如何根据前后两个时刻的图像判断机器人移动了多少前者通常叫跨序列重定位后者属于多相机里程计。一个跨越不同采集过程一个估计平台运动看起来需要两套不同的方法。但把问题拆开会发现它们有一个共同点每组观测内部相机之间的相对位置和朝向已经有了真正未知的是两组观测之间的关系。浙江大学联合浙江人形机器人创新中心、杭州师范大学提出的G2GGroup-to-Group从这一共同结构出发研究如何让多视图基础模型利用已有的组内几何完成跨组位姿估计。该工作已被CoRL 2026接收。论文G2G: Exploiting Intra-Group Geometry for Inter-Group Pose Estimation论文链接https://arxiv.org/abs/2606.08284项目主页https://weiyufei0217.github.io/G2G/代码https://github.com/WeiYuFei0217/G2G第一作者魏雨飞浙江大学五年级博士生研究方向为3D 视觉感知、世界模型与具身智能。01 已知每组内部的关系不等于知道两组如何对齐理解 G2G首先要分清两个层次的“已知”和“未知”。对于一段图像序列视觉里程计、SLAM 或 SfM 可以提供各帧在这段序列内部的相对位姿。对于一套多相机阵列标定可以提供各相机相对于参考相机的外参。这些信息都属于组内几何。但两段独立记录的轨迹通常各有自己的局部坐标系同一套相机阵列在两个时刻的观测也分别对应机器人当时的位置。知道两组内部如何排列并没有告诉我们第二组应该旋转、平移多少才能放进第一组的坐标系。可以把它想象成两块已经各自拼好的拼图每块内部的相对关系已经确定接下来的任务是找到两块之间的对齐关系。组内几何提供了结构却没有提前给出跨组问题的答案。G2G 将这两种情形写成同一个任务输入两组 RGB 图像、相机内参和各自的组内外参估计它们之间的六自由度刚体变换。这样统一的意义不只是换一个任务名称。它让两类应用共享相同的输入输出接口也让同一模型的组级推理能力可以用于两种观测组织方式。同时G2G 并不假设输入几何绝对准确。里程计会漂移标定也可能存在误差。因此方法既要利用这些先验也要保留纠正它们的能力。02 现有方法的缺口关键不只是“有没有几何”还有“在哪里使用几何”1. 先估计图像对再聚合成组级结果一种自然的做法是先建立两组图像之间的局部特征对应求出若干图像对的相对位姿再通过几何求解或运动平均得到组级结果。Reloc3R 等方法也采用先进行图像对位姿预测、再利用已知位姿聚合的思路。这条路线可以利用组内几何但如果跨组外观差异已经破坏了前面的对应关系或位姿预测后面的聚合就很难补救。例如同一片树木在冬夏两季仍处于相同空间位置图像纹理却可能完全不同。几何上看到了同一片区域并不意味着图像上容易找到可靠的对应。2. 多视图基础模型能联合看图但未必理解“两组”的结构DUSt3R、MASt3R、VGGT 等工作推动了前馈几何估计的发展。其中VGGT 可以联合处理多视图并预测相机参数DUSt3R、MASt3R 则通常还需要将图像对结果进一步对齐。然而直接把两组图像交给这类模型并不等于告诉它哪些图像共享一套已知的局部几何哪些关系才是需要求解的未知量。已有研究也在引入几何先验但方式并不相同Reloc3R 在预测后的运动聚合中使用已知位姿Rig3R 将相机阵列元信息用于前向推理MapAnything 可以在特征编码阶段融合相机位姿和射线等条件。G2G 要补上的是“两组各自带有局部几何但组间变换未知”这一接口。这里存在一个容易忽略的坐标系问题MapAnything 能接收位姿条件但原生条件建立在统一参考系下。两组分别以自己的参考帧为原点时不能把它们的局部外参直接当成同一个世界坐标系中的位姿。若先把第二组外参转换到第一组坐标系又恰好需要那个尚未求出的组间变换。G2G 因此选择先在各自的局部坐标系中理解每一组再学习两组之间的关系。03 方法架构让基础模型处理组内几何让桥接模块学习跨组关系G2G 采用“冻结—桥接”Freeze-and-Bridge设计保留 MapAnything 已经学到的几何融合能力在其上增加少量可训练模块。冻结骨干约有5.39 亿参数新增的三个可训练模块合计约3200 万参数占完整模型不到 6%。这里的 6% 指需要训练的参数比例完整骨干仍参与前向计算。▲ G2G 总体架构两组观测先由冻结骨干分别编码再通过重采样、跨组桥接和位姿头输出相对于公共锚帧的位姿。1. 分组编码先把每组“放回自己的几何里”两组图像分别进入同一个冻结的 MapAnything 骨干。每一组都提供自己的相机内参和组内外参并以本组参考帧作为局部原点。骨干将图像内容、相机位姿和像素射线方向融合再在组内交换多视图信息。输出的特征因此不仅描述“图里有什么”也带有“这些观测在本组中是什么空间关系”的信息。组内外参只在这一阶段显式输入。后面的可训练模块接收的是已经融合几何信息的特征而不是另拿一份外参在预测结束后才进行修补。这也是冻结骨干的价值所在已有模型已经学会如何把图像和相机几何联系起来下游训练可以集中学习尚未具备的跨组关系同时保留大规模预训练得到的表征。2. 重采样用少量 token 承载组内信息每帧图像会产生大量图块特征。若全部送入后续注意力模块训练时需要保存的中间状态会迅速增加。G2G 使用 Perceiver Resampler以可学习查询读取每帧特征将默认配置下的256 个图块 token 压缩为 64 个潜在 token。它的主要作用是控制计算成本而非直接提高精度。消融实验中去掉重采样器甚至能改善部分结果但训练显存和训练时间明显增加。这体现了方法对精度与资源开销的主动取舍。3. 跨组桥接既告诉模型“来自哪里”也告诉它“对齐到哪里”压缩后的两组特征被拼接起来并加入三类标记帧标记说明这是组内的第几帧或哪一个相机组标记区分特征来自 A 组还是 B 组锚帧标记指定 A 组的参考帧 A₀作为所有输出的共同坐标原点。随后两层合并自注意力同时进行组内信息共享和跨组信息交换。这一设计把两件事结合起来模型可以利用同组其他视角理解当前观测也可以据此推断它与另一组的关系。跨组推理不再只依赖某一张图与另一张图的独立判断。4. 位姿输出一次前向将所有目标帧放进共同参考系位姿头读取锚帧与目标帧的桥接后特征分别预测旋转和平移。所有目标帧批量处理一次前向即可得到它们相对于 A₀ 的位姿。其中B 组的输出用于完成跨组对齐A 组非锚帧的输出则重新估计组内关系使模型能够修正输入中的残余误差。需要其他帧之间的相对位姿时可以从共同参考系下的结果组合得到。训练时G2G 使用旋转与平移损失并提高跨组项的权重。课程学习先引入高共视样本再逐步加入低共视的困难样本对输入外参加入 SE(3) 扰动则让模型学习如何利用不够准确的几何。G2G 位姿模型只使用相对位姿监督不需要深度预测损失。深度在可用时用于离线计算共视程度、构建训练样本推理时模型仍需 RGB、相机内参和组内外参。04 实验结果从跨季节对齐到仿真训练、真机测试论文在 HM3D、TartanGround、NCLT 和 ZJH 四个数据集上评估跨序列重定位与多相机里程计覆盖室内外仿真、真实跨季节和仿真到真实迁移。各学习型对比方法按其原有监督方式在目标数据上重新训练或微调包括适用时的深度监督G2G 位姿模型仅使用相对位姿监督。以下结果均对应论文给定的评测协议。1. 跨季节难点究竟出在“看不懂场景”还是“连不上两组”NCLT 反复采集同一校园不同日期之间存在季节、光照和局部场景变化。在跨序列重定位中G2G 的平均平移误差为0.692 m平均旋转误差为2.47°。更能说明问题的是论文中的诊断实验只输入 NCLT 同一次采集的五帧图像时VGGT 的组内旋转误差中位数约为2.3°。但在其中加入一帧来自另一季节的图像后若干诊断样例中的组内估计仍然准确跨季节位姿却显著失准。这表明瓶颈并非简单的“模型无法处理校园图像”而在于如何将外观变化明显、几何上仍有关联的两组观测连接起来。G2G 将组内几何提前融入特征再进行跨组推理正是在针对这一困难。▲ 真实场景对齐结果NCLT 展示不同季节之间的组间估计ZJH 展示仿真训练后的真机测试。点云用于呈现对齐效果并非 G2G 的输入。2. 多相机里程计利用已标定的阵列估计两个时刻之间的运动切换到多相机输入时任务接口保持不变每组是一个时刻的多相机观测组内外参来自标定需要估计的是两个时刻之间的运动。在 NCLT 同日期阵列评测中G2G 的平均误差为0.078 m / 1.02°在更困难的跨日期阵列配对中仍保持0.172 m / 1.97°而 Reloc3R 对应为0.752 m / 4.47°。这些是给定观测组之间的相对位姿误差。G2G 提供的是可用于里程计的组间估计模块完整长轨迹系统还需要帧选择、结果累积等环节。▲ 不同阵列配置下的相对位姿估计。MA-AB 使用真值组间变换构造输入是 oracle 参照VGGT 的平移结果经过逐对最优 Sim(3) 真值对齐需结合该评测条件阅读。3. 仿真到真实仿真训练的几何能力能否迁移到真实相机在 ZJH 上可训练模块只使用仿真数据训练随后直接用于真实四相机采集无需使用真实数据微调网络。跨序列重定位的旋转正确率 RRA5° 从仿真的96.5%保持到真实的95.0%真实多相机里程计的平均旋转误差为2.82°优于表中其他非 oracle 方法。在新域进行尺度对齐后平移估计同样保持良好精度。这表明冻结骨干所保留的几何表征以及在仿真中学到的跨组推理能力可以迁移到真实观测。4. 输入几何有误差模型会照单全收吗论文在两组输入外参上施加旋转标准差1.5°、平移标准差0.1 m的扰动。五种评测设置中G2G 的平均组间平移误差变化不超过0.015 m平均旋转误差变化不超过0.05°重新估计的组内平均旋转误差均低于0.85°。这说明在所测试的扰动范围内模型能够将输入几何作为有噪测量加以利用并进行一定程度的校正。这样的结果也解释了为什么“在哪里使用几何”很重要如果外参只在最后的几何聚合中出现噪声会直接进入求解当外参已经融入特征并在训练中经历过扰动后续模块就有机会结合视觉信息学习纠偏。5. 轻量体现在哪里少训练参数也减少重复的图像对推理对于两组各五帧的输入逐对处理需要评估5×525 个跨组图像对。G2G 在一次模型前向中统一输出所有目标位姿。在论文报告的 RTX 4090、BF16、每组五帧、224×224 输入、推理 batch size 为 1 的设置下G2G 推理延迟约为49.8 ms推理显存约为2.33 GBReloc3R 完成 25 次成对推理及聚合约需461.6 ms。重采样器的收益则主要体现在训练同一测试配置、训练 batch size 为 16 时默认 64-token 版本的显存占用为5.44 GB去掉重采样器、保留全部 256 个 token 时增至21.34 GB。相比之下这两种配置的推理延迟只从约 49.8 ms 变为 52.1 ms。因此“不到 6% 可训练参数”和“64-token 压缩”分别解决不同层面的成本问题前者减少需要更新的模型部分后者显著降低跨组注意力的训练开销。05 从给定图像组到实际应用先选出值得比较的两组前面的实验以两组观测已经给定为前提。真实机器人拿到的往往是一段当前视频以及一条很长的历史轨迹。此时还需要先回答哪两个窗口适合送进 G2G论文附录提供了一个可选的共视度预测前端。它复用冻结的 DINOv2 图像编码器缓存逐帧特征再用约184 万参数的解码器预测候选图像之间的共视程度。窗口级检索据此选择一对观测组交给 G2G 估计位姿。在 HM3D 验证中用预测共视度选窗与用真值共视度选窗得到的下游 G2G 位姿精度没有显著差异。这为从长轨迹中自动构建输入组提供了一条路径。这里两部分的职责需要区分选窗前端在部署时仅看 RGBG2G 位姿估计仍需要选中两组的内参和组内外参。前端训练所需的共视标签由深度投影构造也与 G2G 的纯相对位姿监督分开。▲ 可选的部署前端从长序列中预测共视关系、选择窗口再进行组间位姿估计。G2G 为跨序列重定位和多相机里程计提供了共同的估计模块也可以作为地图对齐、多机器人协同等系统中的一个组成部分。后面这些应用仍需结合检索、几何验证或后端优化等环节并非本文已经完成的全套系统。它的适用边界同样清晰需要可用的组内几何严重错误或缺失的先验会影响性能低共视实验也不意味着任意两组毫无关联的图像都能被可靠对齐。论文在各数据集分别训练评估并未宣称一个权重已经覆盖所有数据域。G2G 最值得关注的启发是如何围绕基础模型已有的能力划分任务让成熟的几何表征继续处理组内关系把新增的学习能力集中到尚未解决的跨组关系上。对于已经具备里程计、地图或相机标定的机器人系统这让已有的几何信息真正参与了视觉推理也让重定位与多相机运动估计获得了一个共同接口。项目主页提供更多定性结果及交互式三维对齐 Demo欢迎试用与交流。