ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

(论文速读)Unlocking ImageNet’s Multi-Object Nature:自动大规模多标签标注

(论文速读)Unlocking ImageNet’s Multi-Object Nature:自动大规模多标签标注 论文题目Unlocking ImageNet’s Multi-Object Nature: Automated Large-Scale Multilabel Annotation解锁ImageNet的多对象特性自动大规模多标签标注会议CVPR 2026摘要原始的ImageNet基准测试强制执行单标签假设尽管许多图像描述了多个对象。这会导致标签噪声并限制学习信号的丰富性。多标签注释更准确地反映了真实世界的视觉场景其中多个对象共同出现并有助于语义理解-使模型能够学习更丰富和更健壮的表示。虽然先前的工作(例如REAL[4]、ImageNetv2[26])已经改进了验证集但是还没有针对训练集的可伸缩的、高质量的多标签注释。为此我们提出了一种自动管道将ImageNet训练集转换为多标签数据集-没有人工注释。使用自监督视觉转换器我们执行非监督对象发现选择与原始标签对齐的区域来训练轻量级分类器并将其应用于所有区域以跨数据集生成连贯的多标签标注。我们的标签在定性评估中显示出与人的判断的强烈一致性并在量化基准上持续提高绩效。与传统的单标签方案相比使用我们的多标签监督训练的模型在整个体系结构中实现了一致更好的域内精度(在REAL上高达2.0 TOP-1精度在ImageNet-V2上高达1.5)并显示出更强的下游任务转移能力(COCO和VOC上分别高达4.2和2.3 MAP)。这些结果强调了准确的多标签标注对于提高分类性能和表示学习的重要性。项目代码和生成的多标签批注可在https//githorb.com/jchen175/MultiLabel-ImageNet上找到。解锁 ImageNet 的多对象本质自动化大规模多标签标注一、ImageNet 的原罪单标签假设ImageNet-1K 是计算机视觉领域最重要的基准数据集之一包含 1000 个类别、128 万张训练图片和 5 万张验证图片。然而它有一个长期被忽视的根本性缺陷每张图片只有一个标签。这个单标签假设与现实世界严重脱节。现实中一张照片往往同时包含多个有意义的对象——一只狗坐在公园长椅上一盘点心旁边放着茶壶水族馆里既有海葵又有珊瑚礁。先前研究ReaL 等重新人工标注后发现约 15% 的 ImageNet 图片至少包含两个有效类别。单标签假设的危害是双重的训练阶段标签集不完整甚至错误给模型传递了噪声或误导性监督信号限制了表征的丰富性。评估阶段模型如果正确识别出图中存在的次要对象反而会被惩罚因为评估协议只认可唯一的 ground-truth 标签。这也解释了 ImageNet-V2 相比原始 ImageNet 验证集存在 11–14% 准确率下降的现象——很大程度上是因为 ImageNet-V2 中多对象图片比例更高而非模型真正退化。【Figure 1——对比现有重标注策略MIIL / IN-Seg / ReLabel与本文方法的示例图。直观展示单标签与多标签标注的差异。】二、现有工作的局限既然问题早已存在为什么一直没被解决这篇论文梳理了现有工作的边界ImageNet-ReaL和Multilabelfy只改进了验证集的标签约 5 万张对 128 万张训练集无能为力。人工重标注 128 万张图片的成本极为高昂工业界普遍认为不可行。ReLabel用预训练分类器生成 15×15 的 patch 级软标签图训练时随机裁剪区域从对应位置获取软监督。效果优秀但每个裁剪区域的标签仍是归一化到 1 的单一软标签分布不能提供显式的图片级多标签集也没有实例级的区域-标签对应关系。ImageNet-SegmentsIN-Seg提供了 9K 张训练图片的像素级 mask但每张图仍只标注了一个对象。MIIL从 ImageNet-21K 的 WordNet 层级结构派生语义多标签但缺乏空间定位信息不知道哪个区域对应哪个标签。核心缺口目前没有任何公开的、完整的 ImageNet-1K训练集多标签标注数据集。三、本文方法三阶段自动化标注流程本文的核心贡献是一套全自动、无需人工参与的流程将 ImageNet-1K 训练集转化为多标签数据集。整个流程分三个阶段。【此处配图Figure 2——完整流程示意图包括 (a) 标注器训练、(b) 推断、(c) ReLabel 过滤效果、(d) 本文标注器与 ReLabel 的局部预测对比。】3.1 阶段一无监督目标发现首先需要在不使用任何标签的条件下定位图片中的多个对象区域。本文采用MaskCut来自 CutLER算法将其应用于 DINOv3 ViT 提取的 patch 级特征上。MaskCut 的核心思路是迭代归一化图割Normalized Cut将图片的 patch 特征构建成全连接相似度图用余弦相似度定义节点间的亲和度。求解广义特征值问题利用第二小特征值对应的特征向量将图分割为前景/背景。将已发现的前景 mask 排除对剩余区域重复步骤 1-2依次发现下一个对象。使用 CRF条件随机场后处理将粗粒度 mask 细化到像素级。为了提升覆盖率和鲁棒性作者对三代 DINODINOv1/v2/v3的多种骨干、分辨率、参数组合进行了系统搜索最终选出 4 种互补的配置组成集成在 ImageNet-Segments 验证集上按对象召回率IoU ≥ 0.5评估。4 种最优配置为DINOv3-B/patch_16/feat_v输入 768τ0.35N4不用 CRFDINOv2-G/patch_14/feat_v输入 672τ0.12N3用 CRFDINOv2-L/patch_14/feat_v输入 448τ0.12N3用 CRFDINOv1-B/patch_8/feat_k输入 480τ0.15N3用 CRF为什么不用 SAM作者对比了 SAMv2 的多种自动提示配置Figure 4发现 SAM 在不同图片上的输出极不稳定——有时过分割有时漏检关键对象且对超参数高度敏感难以找到一套在整个 ImageNet 分布上都可靠的固定配置。MaskCut 则凭借固定配置提供更稳定的实例级提案更适合大规模流水线处理。【此处配图Figure 4附录 A.3——SAMv2 两种配置与 MaskCut 的 mask 提案对比图。】3.2 阶段二局部标注器训练有了 mask 提案后需要给每个 mask 赋予类别标签并训练一个能泛化到所有 mask 的分类器。核心难点如果直接用图片的原始单标签例如 guinea pig监督所有 mask分类器会学会捷径——无论看到哪个区域都预测 guinea pig因为这个标签对每张训练图片都是正确的。Figure 2(c) 展示了这个问题用全局分类器EVA02对每个 mask 区域预测结果全部输出原始类别完全失去了区分不同对象的能力。解决方案利用 ReLabel 的 patch 级置信度图进行提案过滤。具体步骤为将 ReLabel 输出的 [15×15×5] 稀疏 top-5 logit 张量双线性上采样为全分辨率的像素级 logit 图。对每个 mask 提案计算其覆盖像素上的平均 logit 向量经 softmax 得到类别概率分布。只保留那些对图片原始标签的置信度超过阈值τ_sel0.75的 mask丢弃背景或无关区域。经过过滤后留下的 mask 都是已知与原始标签对齐的干净正样本。在这些样本上在冻结的 DINOv3 ViT-L/16 骨干之上训练一个 2 层 MLP 分类头隐层维度 1024。特征提取方式为将 mask 上采样至 patch 网格分辨率对前景 patch 的特征做加权平均池化得到 1024 维的区域表征。分类头用原始图片标签以交叉熵损失训练300 个 epochSGD Nesterov 动量cosine 学习率调度同时对前景 patch 引入 25% 的 dropout 增强鲁棒性。这样训练出的分类头能够基于局部区域视觉特征判断类别而不是记忆全局上下文因此能泛化到图片中其他未见过的对象区域。训练完成后该分类头在 IN-Val 上的 top-1 准确率达到 84.73%ReaL 上达到 88.61%。3.3 阶段三多标签推断推断阶段将训练好的标注器应用于全部128 万张训练图片的所有 mask 提案对每个 mask 提案提取对应区域特征经过分类头得到 1000 个类别的 softmax 概率分布。取 top-1 预测类别及其置信度。聚合同一图片所有 mask 的 top-1 预测去重保留最高置信度。可选地过滤低置信度预测τ0.5。最终标签策略采用Local-Soft Original保留每个 mask 的连续置信度分数而非硬阈值二值化并叠加原始 ImageNet 全局标签作为补充全局信号。【Figure 2(b)——推断阶段示意图展示一张图的多个 BBox 被分别分配不同类别pug-dog、water bottle、park bench。】以置信度 τ0.5 过滤后的统计结果附录 Table 5【此处配表Table 5附录 B.2——训练集重标注后每张图片标签数量分布k0/1/2/3/≥4 的比例及平均标签数。】数据表明20.5%的训练图片含有 2 个及以上标签整体平均每张图片 1.23 个标签。这一比例印证了单标签标注对训练集多对象场景的严重低估。四、与人工标注的对齐验证为了评估标注质量作者将流程应用于 ImageNet验证集与 ReaL由 19 个模型集成提名 人工审核的高质量多标签验证集包含 57,553 个标签覆盖 46,837 张图片进行细粒度对比。将模型的 softmax 输出以阈值 0.5 二值化后按与 ReaL 的重叠程度分为 5 组并对每组随机抽取 50 张图片共 250 张进行人工评估。【Figure 3——定性对比示例图展示本文方法在 (a) 纠正 ReaL 漏标/错标以及 (b) 代表性失败案例方面的表现。】【Figure 5附录 D.1——更详细的 5 组对比示例a-e 正确案例f 失败模式包括 ReaL 无标签、精确匹配、我们是超集、ReaL 是超集、部分重叠等五类。】关键发现对应附录 Table 7【Table 7附录 D.1——人工评估的详细分组统计含各组占比及本文方法的修复/遗漏率。】表7.在ImageNet验证集上我们的重新标记和REAL[4]之间的一致性的人工评估细目。基于对250幅采样图像的详细回顾我们估计了图像分成三类的比例(A)REAL没有提供标签(6.33%)(B)REAL的标签集与人确定的地面真实完全匹配(估计75.6%)以及(C)REAL遗漏或错误地标记了一个或多个基本真实类别(估计18.1%)。每组根据Real的注释的质量以及我们的方法是否成功地恢复丢失或错误的标签来进一步细分。百分比表示超过完整的50,000个ImageNet验证集的估计比例。橙色单元格表示Real的标记状态和注释分解绿色单元格表示我们的方法已修复或未修复。GT指的是我们人类验证的地面真相。ReaL 无标签6.3%这 3,163 张图中我们估计有64%包含有效的 ImageNet 对象——ReaL 的高精度过滤流程将其漏掉了因为当所有模型对原始标签一致同意时ReaL 不会发起人工审核。在这些图中我们的流程能正确恢复90%以上的缺失标签。精确匹配62.9%我们的自动流程与 ReaL 的人工多标签完全一致。在这些图片中94%的预测 mask 准确定位了目标对象验证了强空间定位能力。我们是 ReaL 超集13.1%我们额外预测了 ReaL 未包含的标签经人工核查其中74%确实有效——说明 ReaL 的高精度策略漏掉了相当数量的真实次要对象。ReaL 是我们超集7.7%ReaL 包含了我们未能预测到的标签主要原因包括ImageNet 类别歧义56%如同义词、部分-整体关系分割粒度不足18%小对象或遮挡物置信度过滤剪枝6%。部分重叠9.9%两者各有对方遗漏的标签说明自动方法和人工标注各有互补的覆盖优势。总体而言本文方法有效提升了标签覆盖率在消除 ReaL 的漏标方面表现出色为大规模数据集标注提供了可扩展的自动化路径。五、定量实验结果5.1 数据集与评估指标实验在以下数据集上展开ImageNet-1K128 万训练图、5 万验证图标准 top-1 准确率。ReaL47K 图的人工多标签验证集报告 top-1 和 mAP。ImageNet-V2INv210K 图的泛化测试集。INv2-MultilabelfyINv2-MLINv2 的人工多标签版47.9% 的图含多标签。ImageNet-SegmentsIN-Seg11K 公开验证集有像素级标注报告 mAP。Pascal VOC 20079,963 张图20 类迁移学习基准。MS COCO 2017118K 训练图80 类迁移学习基准。5.2 与各标签聚合策略的对比【Table 6附录 B.3——硬/软标签、有无全局信号的各种聚合策略对比ResNet-50 在 100 epoch 下的结果。】通过系统实验对比 Local-Hard、Local-Soft、加入全局信号原始标签或分类器预测等多种组合Local-Soft 优于 Local-Hard保留置信度连续分数比固定阈值二值化效果更好。叠加全局信号有益局部 mask 预测可能遗漏全局线索加入原始 ImageNet 标签作为全局信号平均提升约 0.2 top-1 准确率。Local-Soft Original 最优在所有评估集上平均提升0.96 top-1 准确率和 1.16 mAP相比原始单标签训练。5.3 ImageNet 分类主实验ResNet-50【Table 1——ResNet-50 在 IN-Val、ReaL、IN-Seg、INv2、INv2-ML 上的 top-1 准确率与多标签 mAP 对比包含 Original Label、Label Smooth、SCL、LL、ReLabel、ReLabelOur Mask、Ours 七组方法。】以 ResNet-50 为基准本文方法与以下基线比较方法ReaL top-1ReaL mAPINv2-ML mAP原始单标签84.087.173.0LL单正样本学习84.287.272.7ReLabel85.087.974.8本文Ours85.688.276.2关键结论单正样本学习方法LL、SCL对多标签指标提升有限甚至在 SCL 上出现大幅下降ReaL mAP 仅 82.2。ReLabel 在原始 IN-Val top-1 上最高78.9因其专门对单标签目标优化但在所有多标签指标上低于本文。本文方法在 ReaL、IN-Seg、INv2-ML 三个多标签数据集上的 mAP 均最高对 ReLabel 平均高出0.77 mAP。将 ReLabel 的软 patch 监督替换为本文的局部多标签目标ReLabel w/ Our Mask在多标签指标上进一步提升验证了空间定位标签的价值。多对象子组分析尤其能体现本文的优势【Table 2——按 ReaL 中每张图片的真实标签数 k 分组的 mAP 子组分析k1/2/3/≥4。】对于含 2 个及以上对象的图片本文方法相比单标签基线平均提升3.35 mAP相比 ReLabel 提升1.48 mAP充分验证了显式多标签监督对复杂场景的特殊价值。5.4 跨架构鲁棒性与迁移学习【Table 3——覆盖 ResNet-50、ResNet-101、ViT-S、ViT-B、ViT-L 五种架构在 ImageNet 各评估集和 COCO/VOC 迁移学习上的完整对比单标签 E2E、多标签 FT、多标签 E2E 三种模式。】实验涵盖两种训练模式端到端多标签训练E2E从头以多标签监督训练。多标签微调FT在标准单标签预训练模型上用多标签标注微调 20 个 epoch轻量级实用性强。域内提升ImageNet 评估微调模式下所有架构在多标签评估集上均有显著提升。最大提升案例ResNet-101INv2-ML mAP 5.04ReaL top-1 1.90ResNet-50INv2 top-1 1.24值得注意的是ViT-Base 和 ViT-Large 在原始 IN-Val单标签top-1 上微调后没有提升甚至轻微下降但在所有多标签评估集上依然有一致提升——这正好印证了单标签评估指标的局限性。迁移学习COCO 和 VOC多标签训练一致提升下游迁移性能方法COCO mAPVOC mAPViT-Large 单标签 E2E84.893.4ViT-Large 多标签 FT85.294.4ViT-Large 多标签 E2E86.495.0E2E 多标签预训练相对单标签预训练在 COCO 上平均提升2.0 mAP在 VOC 上平均提升1.7 mAP挑战了先单标签预训练再多标签微调的传统流水线。5.5 与 MIIL 的对比【Table 4——与 MIILImageNet-21K 语义多标签预训练的对比ViT-B/16 在 224 分辨率下的结果。】MIIL 依赖 ImageNet-21K 的语义层级多标签进行大规模预训练是强力基线。本文在不使用 21K 数据的条件下仅在 MIIL 基础上用本文标签微调多标签评估集上全面提升ReaL mAP 0.1IN-Seg mAP 0.4INv2-ML mAP 1.9。本文方法从头 E2E 训练不用 21K 预训练在 COCO/VOC 迁移上超过 MIIL1.9 mAPCOCO和 2.4 mAPVOC。作者将此归因于本文标签强调具体对象的存在性与真实世界多标签任务的本质更接近而 MIIL 的语义层级标签更抽象与 COCO/VOC 的对象级标注存在分布差异。5.6 特征多样性分析【Table 11附录 F.2——k-NN 熵评估ResNet-50 和 ViT-B多标签训练 vs 单标签训练在 ImageNet、VOC、COCO 三个数据集上的特征熵对比。】作者计算了倒数第二层特征的 k-NN 熵k3以衡量表征的多样性和神经坍缩程度。结果表明多标签训练在所有模型和数据集上均产生更高的特征熵说明多标签监督能有效防止表征坍缩促使模型学习更多元化、更具判别力的特征从而解释了其在迁移学习上的优势。六、消歧义类别处理ImageNet 的类别体系中存在 26 对详见附录 Table 8语义歧义的类别对如同义词sunglassvssunglasses, dark glassesReaL 中共现 153 次部分-整体car wheelvsgrille, radiator grille共现 84 次层级关系laptopvsnotebook computer共现 135 次本文提出两种后处理策略协出现先验传播从 ReaL 统计构建共现矩阵对预测的软标签向量做矩阵乘法将一个类别的置信度传播给其高频共现伴随类别。非对称阈值配对基于 ReaL 中的条件概率 P(b|a) 和 P(a|b) 推导类别特定阈值当某图片预测类别 a 且对 b 的置信度超过 τ_b 时自动补充 b 标签。【Table 9附录 E.3——两种歧义消解策略在 ResNet-50、ResNet-101、ViT-B 上的效果对比展示对多标签基线的进一步提升。】两种策略均带来一致提升。以 ResNet-50 为例非对称阈值配对使 ReaL top-1 再提升 0.27INv2 top-1 提升 0.32INv2-ML mAP 提升 0.68。由于这些后处理依赖 ReaL 的统计信息可能引入偏差论文主实验中未包含但提供于补充材料中作为可选增强。七、应用扩展除核心标注流程外该研究还展示了区域级分类头的三个扩展应用软标签训练替代品将本文分类头生成的 patch 级置信度图作为 ReLabel 的替代仅用 ImageNet-1K 数据训练却能在 300 epoch 下达到与 ReLabel依赖 ImageNet-21K 预训练教师网络持平的分类精度IN-Val 78.9ReaL 84.9且收敛更快。CutLER mask 质量过滤将本文分类头用于过滤 CutLER 无监督分割产生的伪标签 mask以置信度 τ0.5 排除 12% 的低质量 mask 后COCO 零样本分割 AP50 从 17.50 提升至 17.80AP 从 8.71 提升至 8.82说明该分类头可作为有效的后处理噪声过滤器。【Figure 6附录 F.5——交互式标注工具示意图对一张含哈士奇、相机、背包的图片给出各区域的类别预测与置信度。】交互式标注工具给定用户指定的任意边界框通过 ROI-Align 提取区域特征经分类头输出带置信度的类别排名列表。即使目标类别不在 ImageNet 1000 类中如登山靴分类头也能预测语义相近的类别跑鞋并给出较低置信度为下游数据标注提供便捷工具。八、总结与展望主要贡献回顾首个完整的 ImageNet-1K 训练集多标签标注全自动处理 128 万张图片无需人工参与提供实例级空间定位是迄今该规模下的首个此类工作。高质量标签与人工标注的 ReaL 高度对齐62.9% 精确匹配94% 正确空间定位并补充了 ReaL 因保守过滤策略漏掉的大量有效标签。持续且广泛的性能提升在 5 种主流架构ResNet-50/101、ViT-S/B/L和多种训练模式下均一致提升域内多标签评估性能最高 2.0 top-1和下游迁移性能最高 4.2 COCO mAP。局限性每个 mask 只预测一个类别在 ImageNet 类别边界模糊处同义词、部分-整体、层级类别容易产生漏标。对于极小、遮挡或多对象粘连的场景MaskCut 难以生成干净的分离 mask。当前超参数针对单标签训练优化大型 ViT 模型可能需要更长时间才能充分受益于多标签监督。更广泛的启示这项工作的意义不仅限于 ImageNet。它展示了自动化重标注这条路径的可行性遗留数据集不必永远保持静态通过无监督目标发现 局部分类器的组合可以持续提升大规模数据集的监督质量为未来的检测、多模态定位和基础模型预训练提供更丰富的训练信号。代码和标注数据已开源GitHub - jchen175/MultiLabel-ImageNet · GitHub
返回列表