ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

文献阅读1

文献阅读1

MUCD: Unsupervised Point Cloud Change Detection via Masked Consistency

摘要

3D Change Detection (3DCD) has gradually become another research hotspot after image change detection. Recent works focus on using artificial labels for supervised or weakly-supervised training of siamese networks to segment changed points. However, labeling every points of multitemporal point clouds is very expensive and time-consuming. In addition, these works lack effective self-supervised signals, and existing self-supervised signals often fail to capture sufficiently rich change information. To solve this problem, we assume that the powerful representation of 3D objects should model the consistency information of unchanged regions and distinguish different objects. Based on this assumption, we propose a new unsupervised framework called MUCD to learn change information of multi-temporal point clouds through bidirectional optimization of change segmentor and feature extractor. The training of network is divided into two stages. We first design a foreknowledge point contrastive loss based on the characteristics of the 3DCD task to initialize the feature extractor, and then propose a masked consistency loss to further learn the shared geometric information of unchanged regions in the multi-temporal point clouds, utilizing it as a free and powerful supervised signal to train a change segmentor. In the inference stage, only the segmentor is used to take multi-temporal point clouds as input and produce change segmentation result. Extensive experiments are conducted on SLPCCD and Urb3DCD, two real-world datasets of streets and urban buildings, to verify that our proposed unsupervised method is highly competitive and even outperforms supervised methods in scenes where semantic information changes occur, exhibiting better performance in generalization ability and robustness.
三维点云变化检测(3DCD)已继图像变化检测之后,成为又一大研究热点。现有相关研究大多依靠人工标注,采用有监督 / 弱监督方式训练孪生网络,实现变化点分割。但对多时相点云逐点标注成本高昂、耗时严重;同时现有方法缺少有效的自监督信号,已有的自监督信号也难以捕捉足够丰富的变化特征。 针对上述问题,本文提出核心假设:三维物体的优质特征表征应当能够建模未变化区域的一致性特征,并区分不同物体。基于该假设,本文提出一种无监督框架 MUCD,通过变化分割器与特征提取器的双向协同优化,学习多时相点云的变化信息。 网络训练分为两个阶段:第一阶段结合三维点云变化检测任务特性,设计先验点对比损失完成特征提取器初始化;第二阶段提出掩码一致性损失,挖掘多时相点云未变化区域共享几何特征,将其作为免费且高效的监督信号训练变化分割器。推理阶段仅需输入多时相点云至分割器,即可输出变化分割结果。 本文在面向街道、城市建筑场景的真实数据集 SLPCCD 与 Urb3DCD 上开展大量实验,结果证明:所提无监督方法具备极强的竞争力,在存在语义变更的场景中性能甚至超越有监督算法,拥有更优异的泛化能力与鲁棒性。

然后下来我会从问题定义、核心方法与创新点、实验验证以及个人理解哥部分去梳理一下全文的内容:

问题定义

解决的问题:

本文解决的是三维点云变化检测任务,即从同一地点、不同时间采集的两帧多时相点云中,自动识别并分割出发生变化的点。

问题为什么重要或者有挑战性?

我们可以从以下四个维度去回答这个问题:

挑战维度具体描述
标注代价极高现有所有方法均依赖全监督或弱监督训练,需要对每个点进行人工标注,耗时耗力
泛化能力差有监督模型在特定带标签数据集上训练,面对语义变化场景(如路牌变树木)时检测能力有限
自监督信号匮乏现有自监督信号(如自重建)无法捕捉足够丰富的变化信息,特征差异趋向均值,难以区分变化与未变化区域
点云特殊性与图像像素不同,多时相点云的点对之间不存在一一对应关系,增加了特征对齐与学习的难度

核心方法与创新点:

整体框架

第一阶段:特征提取器初始化

  • 自重建任务(Self-Reconstruction)→ Lrec
  • 先验点对比损失(Foreknowledge Point Contrastive Loss)→ Lfpc

第二阶段:双向联合优化

  • 分割器(PointNet++ + NFF)生成变化概率图 Mx/My
  • 掩蔽一致性损失(Masked Consistency Loss)→ Lmcon
    1.用变化概率屏蔽变化点的干扰
    2.强制未变化区域特征保持一致

推理阶段:
仅保留分割器 → 阈值分割(threshold=0.5)→ 最终变化检测结果

总损失函数:

关键创新点

方法提出了三个核心创新点:掩蔽一致性损失、先验点对比损失、最近邻特征融合,然后下面对三个核心创新点进行详细整理:

掩蔽一致性损失(Masked Consistency Loss, MCL)

核心思想:未变化区域在两帧点云中具有几何/语义一致性,变化区域则差异显著——以此作为无标签的自监督信号。

具体做法:对 PxPx​ 中每个点,在 PyPy​ 中搜索 KNN 邻域并取特征均值;利用分割器输出的变化概率 mx,i mx,i​ 对变化点进行掩蔽(权重为 1−mx,i1−mx,i​),只强制未变化点的特征保持跨时相一致性。

优势:形成分割器与特征提取器的双向优化闭环——特征提取器引导分割器,分割器反过来帮助特征提取器排除噪声干扰。

先验点对比损失(Foreknowledge Point Contrastive Loss, FPC)

核心思想:在 3DCD 任务中,部分点的变化状态可以先验判断——同一场景的地面点必然未变化(正样本),不同场景的非地面点必然发生了相对变化(负样本)。

具体做法:以当前场景不同时相的地面点为正样本对,以不同场景的非地面点为负样本,设计对比损失初始化特征提取器。

优势:相比纯自重建任务,能提取更具判别性的特征,避免特征差异均值化问题,为后续联合训练打下坚实基础。

最近邻特征融合(Nearest Feature Fusion, NFF)

核心思想:变化检测需融合孪生网络两个分支的特征,但点云点对并非一一对应。

具体做法:在分割器最后一层,对每个点从另一时相点云中查找空间最近邻,将其特征融合后再送入 MLP 输出变化概率。

优势:无需点对点的精确对应,即可实现跨时相特征融合,有效提升变化分割性能。

实验验证

数据集

方法在实验设置这里主要选用了SLPCCDUrb3DCD两个数据集。

数据集场景类型采集方式特点
SLPCCD(Change3D)街道小尺度场景车载激光雷达含行人、车辆等详细目标形状信息
Urb3DCD城市大尺度三维地图航空激光雷达5个子集,分辨率/噪声/传感器各异

对比消融实验设置

在实验设置这里,文章设计了对比、迁移和消融实验,其中对比实验用于证明方法相较于之前的有监督和弱监督方法确实实现了提升,迁移实验用于证明方法的泛化性,消融实验用于证明方法的三个核心创新在整体方法流程中所具体起到的作用。

对比试验结果

方法与有监督sota方法实验结果对比

方法与弱监督sota方法实验结果对比

迁移实验

消融实验结果
在 SLPCCD 测试集上的消融研究结果:

MCL 中 kk 值在 SLPCCD 测试集上的消融研究结果。

个人理解:

我认为可以通俗的理解方法是做了这样一个事情,把"找变化"这个需要监督的问题,转化为"维持一致性"这个不需要监督的问题。

整个方法设计了三个最核心的改动,从整个流程从前往后说:

首先是特征提取器的优化过程中,设计了一个先验点对比损失,在这个设计中,作者发现了一个事实,就是在一个场景中,有一个一定不变的东西,那就是地面,因为地面就在那里。所以不需要任何标注,因此我们可以得知同一场景两帧里的地面点,特征应该相似,也就是正样本对;不同场景的非地面点,特征应该不相似,也就是负样本对。这个设计的好处在于它用场景本身的物理先验替代了人工标注,地面点是免费的、天然可靠的监督信号,用它来预热特征提取器,让网络在联合训练开始前就已经具备基本的特征判别能力。

然后是MCL掩码一致性损失,我们知道整个方法的框架是包含两个核心模块的:特征提取器和分割器,分割器输出每个点"是变化点"的概率。然后,对于那些被分割器认为没变的点,强制它们在两帧点云里提取到的特征要尽量相似。在MCL的设计中实现了一个很巧妙的双向优化:
1.分割器说"这个点没变" ,特征提取器就努力让这个点在两帧里特征一致。
2.特征提取器提取得越好 , 变化点的特征差异就越大,分割器就能更准确地把变化点识别出来
3.分割器越准确,掩蔽掉的变化点越干净,特征提取器学得越纯粹。
实现了两个模块间的一个自我增强的闭环。

最后是最近邻特征融合,我们知道图像有像素对齐,但点云没有,所以NFF通过在空间上找最近邻的方法解决了这个问题,对于对 Px里的每个点,去 Py里找空间距离最近的k个点,把它们的特征取平均,作为"对应区域"的特征代表。把"点对点",变成"点对区域"。进而解决了问题。

返回列表