ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

(论文速读)FFS:用 Normalizing Flow 改进 VOS 的虚拟异常特征合成

(论文速读)FFS:用 Normalizing Flow 改进 VOS 的虚拟异常特征合成 论文题目Normalizing Flow based Feature Synthesis for Outlier-Aware Object Detection基于归一化流的特征合成用于异常感知目标检测会议CVPR 2023摘要可靠目标检测器的真实部署对自动驾驶等应用十分重要但 Faster R-CNN 等通用检测器容易对异常目标给出过度自信的预测。近期方法通常使用类别条件 Gaussian 估计实例特征密度并从低似然区域合成异常特征训练模型但某一类别下的低似然样本并不保证在其他类别下仍是低似然。本文提出 FFS利用可逆 Normalizing Flow 学习所有 ID 类别特征的联合分布并从联合分布的低似然区域合成异常特征。这样生成的样本相对于所有 ID 类别都具有更低似然从而形成更好的 ID/OD 决策边界。FFS 在图像和视频异常感知目标检测上均取得了更好的结果。一、研究背景VOS 的问题在哪里目标检测中的异常检测比整图分类更复杂因为同一张图中可能同时出现已知目标ID和未知目标论文记作 ODOutlier。模型不仅要找到目标还要避免把未知目标高置信度分类成某个已知类别。VOS 已经提出一种很自然的思路不在像素空间生成异常图像而是在对象特征空间中为每个类别拟合 Gaussian再从低似然区域采样 virtual outliers。但这里存在一个关键问题“对类别 A 来说是异常”不代表“对所有类别来说都是异常”。从 A 类 Gaussian 低似然区域采出的样本可能恰好落入 B 类 Gaussian 的高似然区域于是这个所谓 outlier 实际上仍像某个 ID 类。论文 Figure 1VOS 与 FFS 对 ID、background patches 和 synthetic OD 的 log-likelihood 分布比较Figure 1 直接展示了这个问题。FFS 得到的 ID、背景与 synthetic OD 的 likelihood 分布分离更清晰。作者因此把问题从“分别拟合每个类别”改成了学习所有 ID 类共同构成的联合特征分布。一句话概括 FFS用 Normalizing Flow 建模整个 ID manifold再从联合分布的低似然区域生成真正有价值的异常特征。二、FFS 整体框架论文 Figure 2FFS 的训练与推理框架FFS 建立在 Faster R-CNN 上。Backbone 和 RPN 产生 proposalsROI Align 得到固定维度的 box feature ()。背景 proposal 被过滤只保留真实 ID 对象特征) 训练 Normalizing Flow。训练中有三条路径普通检测feature → classification / box regression →密度建模ID feature → Normalizing Flow →异常感知Flow sampling → synthetic outlier → Energy →训练初期先关闭 ()让 Flow 学到稳定的 ID 分布随后从 latent space 采样并通过逆映射生成 synthetic features再从中选择低似然样本作为 outliers。ID 与 synthetic outlier 进入分类头计算 Energy并通过 () 拉开两者。推理时不再生成异常样本只对检测框计算 Energy。阈值 () 被设为在验证集上接受 95% 的 ID若 Energy 低于阈值判为 ID否则判为 OD。三、Normalizing Flow 如何合成异常特征FFS 使用可逆映射 ()把复杂的 ID feature 分布映射到零均值、单位协方差的 multivariate Gaussian latent space即 ()。Normalizing Flow 在这里最关键的不是“能生成”而是可逆且可以精确计算 likelihood。给定 ID feature (l)令 (zf(l))通过变量替换公式因此可以直接使用 negative log-likelihood 训练 Flow直观理解就是Flow 学会回答“一个 box feature 在整个 ID 分布下到底有多正常”。训练一段时间后从 latent Gaussian 随机采样 ()再通过 () 回到原特征空间。由于 Flow 可逆生成的 () 还能直接计算 likelihood。大部分样本处于 ID 高密度区域但大量候选中也会出现靠近边界或位于边界外的低似然样本这些才是 FFS 真正需要的 synthetic outliers。四、如何选择有效 Outlier并完成 Energy Regularization4.1 Rejection SamplingFFS 默认使用 rejection sampling一次生成 (k) 个候选 ()再从最低 likelihood 区域挑选 (s) 个 ()且 ()。论文 Figure 3候选生成数量与最终选择数量对 FPR95 / AUROC 的影响固定只选一个最低似然样本时增加候选数量通常能找到更有效的异常点但候选过多最低似然样本可能离决策边界太远反而变成过于简单的异常。另一方面如果一次选择太多 outliers后续入选样本的 likelihood 会越来越高甚至落回 ID manifold。因此最好的异常并不是“越远越好”而是既覆盖决策边界又确实位于 outlier space。4.2 Projection Sampling论文还尝试基于 Langevin Dynamics 的 projection sampling。它先用真实 ID 中最低 likelihood 定义边界 ()再沿 log-likelihood 的反梯度更新直到 synthetic outlier 被推到近边界区域。不过实验发现它不如简单 rejection sampling因为 projection 强制样本集中在固定边界附近对更广的 outlier manifold 覆盖不足。4.3 Energy-based regularizationFFS 将 ID 与 synthetic outlier 的分类 logits 转成 EnergyID 应该低能量outlier 应该高能量。Energy 再进入二分类器用 BCE 构造 (。最终整体目标为其中 (保留原检测能力() 学习 ID 联合密度() 用 synthetic outliers 塑造 ID/OD 边界。五、实验结果与消融分析5.1 图像主实验默认模型为 Faster R-CNN RegNetX-4.0GFFlow 使用 Glow。PASCAL-VOC 2012 为 IDMS-COCO 和 OpenImages 为 OD指标包括 FPR95↓、AUROC↑ 和 ID mAP↑。论文 Table 1PASCAL-VOC 上的图像 OD 主实验FFS 在 COCO / OpenImages 上的 FPR95 为44.15 / 45.08VOS 为 47.77 / 48.33AUROC 为89.71 / 88.29ID mAP 为 51.8。论文按相对比例计算FFS 相比 VOS 的 FPR95 分别下降 7.58% 和 6.73%。训练时间也从 VOS 的 2.43 h 降至2.18 h。5.2 视频数据与 backbone 泛化论文 Table 2BDD100K / Youtube-VIS 视频 OD 主实验BDD100K→nuImages 时FFS 的 FPR95 / AUROC 为76.68 / 77.53STUD 为 79.75 / 76.55mAP 则为36.2高于 STUD 的 32.3。训练时间约 2.7 h而 STUD 约 11 h。Youtube-VIS→COCO 时FFS 的 FPR95 为 83.06高于 STUD 的 81.14但 AUROC76.37、mAP27.6高于 STUD 的 74.82 和 27.2。因此并不是所有单项指标都领先但同一框架可以统一处理图像与视频并显著降低训练时间。论文 Table 3ResNet-50 backbone 下的结果换用 ResNet-50 后PASCAL-VOC→COCO 的 FFS FPR95 为43.12VOS 为 49.67Youtube-VIS→COCO 时 FFS 为 81.90STUD 为 83.93说明收益不只来自默认 RegNetX backbone。5.3 “联合分布”是否真的是关键论文 Table 4VOS、VOS 与 FFS 对比作者构造了 VOS仍使用 class-conditional Gaussian但把候选 outlier 放到所有类别 Gaussian 下重新计算 likelihood只要它在其他类别下 likelihood 较高就拒绝。VOS 确实优于 VOSCOCO 上 FPR95 从 48.22 降到 45.59说明跨类别冲突确实存在但逐类别判断使训练时间达到7.38 h。FFS 则做到44.15 FPR95、89.71 AUROC、2.18 h。这组实验直接支持了论文最核心的设计与其事后排除每个类别的冲突不如直接学习联合 ID 分布。5.4 Flow、Loss 与超参数论文 Table 5NICE、RealNVP、Glow、GIN 四种 Flow 模型对比Glow 的 FPR95 / AUROC 为44.15 / 89.71优于其他 Flow因此作为默认结构。GIN 的 mAP 最高但 OD 检测更弱说明论文的主要目标仍是 outlier detection。论文 Table 6CE、JSD、Hinge 与 BCE regularization 对比BCE () 得到44.15 FPR95、89.71 AUROC、51.80 mAPHinge 为 51.32 FPR95CE 更达到 69.92。说明性能不仅来自 Flow 采样Energy surface 如何被正则同样关键。论文 Figure 5Flow 深度、子网络规模、batch size、() 与 projection sampling 消融作者最终使用 2 个 coupling layers每个 (s/t) 子网络含 2 个 fc layers、每层 2048 neurons。Flow 并非越深越好参数增多会增加训练时间并可能导致过拟合(\alpha) 也存在合适区间过强 regularization 会使性能下降。5.5 定性结果论文 Figure 4VOS 与 FFS 在 MS-COCO / OpenImages 上的 OD 检测可视化绿色框表示应该识别为 OOD 的目标。FFS 能识别出更多异常对象即使两种方法都误分类FFS 的 softmax confidence 往往更低。这个现象与 Figure 1 中更清晰的 likelihood separation 相互对应。六、总结与思考如果把 FFS 压缩成一句话它用 Normalizing Flow 把 VOS 的“每类独立建模”改成“所有 ID 类联合建模”从而生成对整个 ID manifold 都更可信的 synthetic outliers。这篇论文真正解决的是一个很具体的问题低 likelihood 到底是相对于哪个分布而言多个 class-conditional Gaussian 下“对 A 异常”可能只是“更像 B”而联合 Flow 将所有 ID 类放进同一个 density model 后低 likelihood 才更接近“远离整体 ID 分布”。论文没有单独的 Limitations 章节结尾将进一步验证其他 OD detector、扩展到 outlier-aware instance segmentation 和 active learning 作为未来方向。从研究思路上看FFS 最值得记住的是当真实未知样本不可得时与其直接猜未知长什么样不如先更准确地建模“已知整体长什么样”再从低密度区域反推出有价值的未知监督。
返回列表