
NeurIPS 2026噪声遇上长尾让稀有类别在少标注下获得更多学习机会真实视觉任务中的数据往往同时具有两个特点一方面大量类别之间存在明显的数据不均衡常见类别占据大量训练样本而稀有类别只占很小一部分另一方面图像本身还可能受到噪声、散射、低对比度、雨雪雾等复杂成像因素影响。对于依赖伪标签的半监督语义分割来说这两个问题会进一步相互叠加噪声降低预测置信度长尾类别本身又更难学习最终导致稀有类别更容易在伪标签筛选阶段被过滤。FTC-SegFeature-Threshold Dual Calibration针对这一问题从特征表示和伪标签筛选阈值两个层面进行校准。论文When Noise Meets Long-Tail: Feature-Threshold Dual Calibration for Robust Pseudo-Labeling已被NeurIPS 2026 Main Track接收。目前已经公开训练代码推理与评估代码FLSMD / FSSG / SUIM / ACDC 四个数据集配置四个数据集的验证列表统一的数据组织格式FSSG、FLSMD 整理后的数据入口SUIM、ACDC 官方数据入口与完整整理说明mIoU、per-class IoU 和 segmentation prediction 输出流程GitHubhttps://github.com/pingggg516/FTC-SegPaperhttps://arxiv.org/abs/2609.33668一、核心思路把被过滤的稀有目标重新带回训练图 1. FTC-Seg 通过特征与阈值双重校准缓解尾类伪标签被持续过滤的问题。在常见的半监督语义分割中模型首先对未标注图像产生预测再利用高置信度预测生成伪标签用这些伪标签继续训练模型。问题在于当噪声与类别长尾同时存在时低频类别往往会更早失去监督。一个典型过程是尾类样本较少→ 特征学习不足→ 预测置信度偏低→ 固定高阈值将其过滤→ 未标注数据无法继续提供尾类监督→ 尾类特征进一步退化图 1(a) 中可以看到模型实际上已经在稀有目标区域产生了预测但预测置信度未达到统一阈值因此这些区域在后续训练前直接被过滤。FTC-Seg 从两个位置进行干预Orthogonal Prototype ReconstructionOPR从特征层面改善目标与噪声背景之间的可分性使受到干扰的目标特征更容易被模型识别。Adaptive Threshold CalibrationATC不再对所有类别使用完全相同的固定阈值而是根据类别的学习状态与预测分布动态调整伪标签筛选门槛。两部分分别作用在特征质量 → 预测置信度 → 伪标签筛选这条链路的不同位置目标都是减少低频类别由于置信度不足而被持续排除的问题。二、跨场景验证声呐、水下光学与恶劣天气论文在FLSMD、FSSG、SUIM、ACDC四个公开数据集上进行实验覆盖三种明显不同的复杂成像条件Acoustic Speckle声学散斑Underwater Optical Scattering水下光学散射Adverse-weather Imaging恶劣天气成像实验使用2% 标注5% 标注10% 标注三种半监督设置并从整体分割性能、稀有类别表现和伪标签质量等多个角度进行分析。ACDC恶劣天气道路场景图 2. ACDC 恶劣天气道路场景的分割对比采用 2% 标注数据。Ours 为 FTC-SegGT 为人工标注。ACDC 包括FogNightRainSnow等复杂道路环境。这类场景中小目标、低频类别和远距离道路参与者容易受到天气和成像质量影响因此可以用于研究Robust Semantic SegmentationAdverse Weather PerceptionAutonomous DrivingRare Road-user SegmentationSemi-supervised Driving Scene UnderstandingSUIM水下光学场景图 3. SUIM 水下光学场景的分割对比采用 2% 标注数据。水下光学图像通常同时受到光线衰减散射低对比度色偏背景干扰等因素影响。因此这一设置可以用于Underwater VisionUnderwater RoboticsRobust SegmentationRare Underwater Object RecognitionLow-quality Image SegmentationSemi-supervised Underwater PerceptionFSSG / FLSMD前视声呐场景FSSG 和 FLSMD 均为 Forward-Looking SonarFLS语义分割数据。前视声呐图像通常具有Speckle Noise低纹理阴影目标轮廓模糊背景噪声强类别分布不均衡等特点。对应的研究方向包括Sonar Image SegmentationUnderwater Acoustic PerceptionMarine Object SegmentationMarine Debris SegmentationLow-texture Semantic SegmentationNoise-robust Underwater PerceptionPascal VOC进一步的控制实验除四个主要 benchmark 外论文附录还在Pascal VOC上构造了Long-tail onlyLong-tail Gaussian noise两种 controlled setting。这一实验主要用于进一步检查“噪声与长尾共同影响伪标签学习”这一现象是否只存在于声呐、水下光学或恶劣天气等特殊成像场景。三、哪些研究可以把 FTC-Seg 作为 Baseline 或对比方法FTC-Seg 的实验设置同时涉及半监督学习、少标注学习、类别长尾、成像退化、稀有类别学习、伪标签筛选和类别自适应阈值。因此除了完全相同的“Noise Long-tail”问题之外在多个相关研究方向中也可以作为对比方法。研究方向FTC-Seg 可以承担的对比角色重点比较内容半监督语义分割Teacher–Student Pseudo-labeling 类半监督方法mIoU、per-class IoU少标注学习在相同 2% / 5% / 10% 标注预算下比较未标注数据利用能力不同 label ratio 下的 mIoU长尾语义分割比较不同方法是否真正改善低频类别Tail IoU、Head/Tail Gap类别不均衡学习与 re-weighting、re-sampling、distribution alignment 等策略比较Head / Tail performance稀有类别识别检查新方法是否减少低频类别漏分割Tail Recall、Tail IoU伪标签学习比较不同伪标签生成与筛选策略Pseudo-label Accuracy、Filtered Rate自适应阈值方法与固定阈值、类别动态阈值策略进行比较Recall、Precision、Pseudo-label CoverageTeacher–Student SSLEMA Teacher–Student 框架下的半监督分割方法mIoU、Pseudo-label QualityDINOv2-based SegmentationDINOv2-S backbone 下的半监督分割方法精度、尾类表现、计算开销噪声鲁棒语义分割比较低质量图像和复杂成像条件下的稳定性Robust mIoU、Tail Performance恶劣天气分割ACDC 上比较雨、雪、雾、夜间场景mIoU、低频道路类别 IoU水下视觉SUIM 上比较散射、低对比度条件中的分割mIoU、Rare-object IoU声呐图像分割FSSG / FLSMD 上比较散斑噪声下的语义分割mIoU、Tail IoUPrototype-based Segmentation与 prototype learning / feature calibration 方法比较Feature Quality、Tail IoURobust Pseudo-labeling比较复杂成像条件下可靠伪标签保留能力Accuracy、Coverage、Filtered RateLong-tail Noise 联合鲁棒性直接分析两个因素共同存在时的性能退化Interaction、Tail Exclusion低置信度伪标签利用比较不同方法如何利用原本会被过滤的预测Recall、Precision、Coverage高效半监督分割同时比较性能和额外计算成本Params、FLOPs、FPS、mIoU可以进一步迁移的任务下面这些任务同样具有少标注、类别不均衡、稀有目标和复杂成像等特点也很适合将 FTC-Seg 作为对比方法或迁移基线。遥感语义分割遥感场景中经常同时存在稀有地物类别类别比例极度不均衡云雾与低质量成像低分辨率目标标注成本高因此可以进一步测试Semi-supervised Remote Sensing SegmentationLong-tail Remote Sensing SegmentationRare Land-cover SegmentationLow-quality Remote Sensing Segmentation工业缺陷分割工业视觉中常见正常类别远多于缺陷类别某些缺陷类型极少成像条件和光照变化像素级标注成本高对应可以进一步研究Few-label Defect SegmentationRare Defect SegmentationSemi-supervised Industrial InspectionLong-tail Defect Recognition医学稀有目标分割部分医学分割任务同样可能存在病灶区域比例低正负样本严重不平衡目标边界模糊图像噪声和低对比度标注成本较高在类似设置下也可以进一步测试特征校准与伪标签动态筛选的迁移表现。四、不只比较最终 mIoU也可以分析“尾类为什么学不好”论文除了最终语义分割结果之外还对伪标签过程进行了进一步分析。对应可以使用的指标包括整体性能mIoUPer-class IoU长尾类别表现Head-class IoUTail-class IoUTail RecallHead–Tail Gap伪标签质量Pseudo-label AccuracyFiltered RateCorrectly Kept GT RateRecallPrecision因此如果一个新的方法主要声称“改善了低频类别”可以进一步检查Tail IoU 是否真正提高Tail Recall 是否提高Head / Tail 差距是否缩小尾类伪标签是否仍然大量被过滤如果一个新的方法主要声称“产生了更可靠的伪标签”则可以进一步比较Pseudo-label AccuracyPseudo-label CoverageFiltered RateCorrectly Kept GT RatePrecision / Recall五、特征校准和阈值方法分别可以怎么比较FTC-Seg 的两个主要组成部分对应两类不同研究问题。OPRFeature / Prototype Calibration对于新的Prototype LearningFeature ReconstructionFeature DenoisingFeature CalibrationForeground–Background Separation方法可以比较mIoUTail IoUPseudo-label AccuracyTail Pseudo-label AccuracyParametersFLOPsFPS此外也可以分析 prototype 在训练过程中对应的 dominant foreground responses。ATCAdaptive Threshold对于新的Fixed ThresholdClass-specific ThresholdDifficulty-aware ThresholdDistribution-aware ThresholdConfidence CalibrationPseudo-label Selection方法可以进一步比较Tail RecallPrecisionTail IoUFiltered RatePseudo-label CoverageFTC-Seg 中 ATC 同时考虑类别当前的学习难度未标注数据预测分布与标注数据类别先验之间的偏差因此可以作为多种动态阈值方法的一个参考设置。六、跨模态和跨成像条件比较四个主要数据集来自明显不同的视觉环境数据集模态 / 场景主要问题FSSGForward-Looking Sonar散斑噪声、低纹理、长尾FLSMDForward-Looking Sonar散斑噪声、海洋垃圾、类别不均衡SUIMUnderwater Optical散射、低对比度、颜色退化ACDCRGB Driving SceneFog / Night / Rain / Snow因此同一套方法可以在声学感知 → 水下光学 → 常规 RGB 道路视觉三个差异较大的场景中进行比较。对于研究Cross-domain RobustnessCross-modality RobustnessDegraded-image SegmentationSensor-specific NoiseGeneral Robust Semantic Segmentation时也可以参考FTC-Seg将这些作为不同类型退化条件下的实验设置。七、计算开销除了分割性能论文同时报告ParametersFLOPsFPS在 DINOv2-S DPT 的实验设置中OPR 引入了可以忽略不计的额外参数和计算开销。ATC 主要作用于训练阶段ATC 不增加推理阶段额外计算。因此在研究Efficient SegmentationLightweight Semi-supervised LearningAccuracy / Complexity Trade-offRobustness / Efficiency Trade-off时也可以同时参考FTC-Seg比较计算成本。八、代码与数据开放代码、数据获取入口、数据格式整理方式、训练和推理说明均集中在同一个 GitHub 仓库中四个数据集统一采用dataset_root/ ├── Images/ └── Masks/配置文件包括configs/ ├── ACDC.yaml ├── FLSMD.yaml ├── FSSG.yaml └── SUIM.yaml数据路径统一在对应 YAML 文件中设置data_root:/path/to/dataset_root九、四个数据集的下载与整理数据集应用场景下载入口项目中的准备方式FSSG前视声呐目标分割百度网盘下载已整理为项目读取格式FLSMD前视声呐海洋垃圾与目标分割百度网盘下载已整理为项目读取格式SUIM水下光学图像分割官方下载提供 mask 转换、对齐和目录整理说明ACDC雾、夜间、雨、雪道路场景官方下载提供数据筛选、标注与目录整理说明FSSGFSSG 已按照项目的数据加载格式进行整理。下载后按照配置文件设置数据根目录即可接入数据加载流程data_root:/path/to/FSSGFLSMDFLSMD 同样已经整理为项目可以读取的目录格式。按照对应配置文件设置data_root:/path/to/FLSMD即可使用。SUIMSUIM 使用官方数据。官方下载https://irvlab.cs.umn.edu/resources/suim-dataset项目 README 中整理了使用的 train / validation 数据范围RGB mask 转 class-ID mask 的规则特殊 mask 对齐处理图像格式转换最终Images//Masks/目录格式详细说明SUIM 数据整理说明ACDCACDC 使用官方数据rgb_anon_trainvaltest.zipgt_trainval.zip覆盖fognightrainsnow四种 adverse conditions。官方下载https://acdc.vision.ee.ethz.ch/downloadREADME 中说明了使用哪些 train / val 文件如何选择labelTrainIds图像与 mask 如何整理哪些数据不参与实验validation split 如何使用详细说明 ACDC 数据整理说明十、数据集原始来源与引用使用对应数据集时需要同时遵循原始发布方的许可要求并引用对应数据集工作。FSSGPaperCTFS: Collaborative Teacher Framework for Forward-Looking Sonar Image Semantic Segmentation with Extremely Limited LabelsOriginal Dataset Release Projecthttps://github.com/pingggg516/CTFSFSSG 仅限非商业研究使用使用时请注明数据来源并引用对应论文。FLSMDDataset PaperThe Marine Debris Dataset for Forward-Looking Sonar Semantic SegmentationThe Marine Debris Forward-Looking Sonar DatasetsOriginal Datahttps://zenodo.org/records/15101686FTC-Seg 中提供的数据副本主要用于统一项目格式原始数据许可仍以原发布方为准。SUIMPaperSemantic Segmentation of Underwater Imagery: Dataset and BenchmarkDatasethttps://irvlab.cs.umn.edu/resources/suim-datasetACDCCitationhttps://acdc.vision.ee.ethz.ch/citationDataset Homepagehttps://acdc.vision.ee.ethz.ch/十一、训练流程1. 安装环境按照 GitHub 中的 Installation 安装项目依赖。2. 下载 DINOv2-S BackboneREADME 中给出了 DINOv2 ViT-S/14 预训练权重的下载方式。权重保存至pretrained/dinov2_small.pth3. 准备半监督训练列表训练需要分别指定labeled.txt unlabeled.txt分别对应有标注训练数据无标注训练数据每一行包含Images/example.png Masks/example.png4. 训练训练入口python train.py\--configconfigs/FSSG.yaml\--labeled-id-path /path/to/labeled.txt\--unlabeled-id-path /path/to/unlabeled.txt\--save-path ./exp/FTC-Seg/FSSG_exp具体参数可以根据数据集标注比例BackboneOPR 设置ATC 设置进行调整。完整说明Training5. 训练输出实验目录中会保存exp/FTC-Seg/FSSG_exp/ ├── train.log ├── events.out.tfevents.* ├── latest.pth └── best.pth其中train.log记录训练过程和验证结果events.out.tfevents.*TensorBoard 日志latest.pth最近一次 checkpointbest.pth验证集表现最好的 checkpoint十二、推理与评估训练完成后可以使用python inference.py进行推理和评估。对应输出目录包括inference_results/ ├── console.log ├── progress.jsonl ├── result.json └── predictions/其中result.json包含mIoUper-class IoUevaluation settingspredictions/用于保存 segmentation prediction masks。完整说明Inference十三、不同研究方向可以重点比较哪些指标半监督语义分割可以比较mIoUper-class IoU2% / 5% / 10% label ratio不同 unlabeled-data utilization strategy长尾分割可以进一步比较Tail IoUTail RecallHead IoUHead / Tail Gap伪标签方法可以进一步比较Pseudo-label AccuracyFiltered RateCorrectly Kept GT RateRecallPrecision自适应阈值方法可以比较Fixed ThresholdDifficulty-aware ThresholdDistribution-aware ThresholdClass-specific ThresholdCombined Threshold Calibration以及不同策略对以下的影响Tail RecallPrecisionIoUPseudo-label Coverage鲁棒语义分割可以在下述退化条件下进行比较Acoustic SpeckleUnderwater ScatteringAdverse WeatherSynthetic CorruptionFeature / Prototype 方法可以同时比较Overall mIoUTail mIoUPseudo-label QualityParametersFLOPsFPS十四、项目地址GitHubhttps://github.com/pingggg516/FTC-SegPaperhttps://arxiv.org/abs/2609.33668关键词半监督语义分割、少标注学习、长尾语义分割、类别不均衡、稀有类别识别、伪标签学习、自适应阈值、鲁棒语义分割、噪声鲁棒视觉、恶劣天气分割、水下视觉、声呐图像分割、DINOv2、Teacher–Student、Pseudo-Labeling、Semantic Segmentation、Robust Segmentation、Long-tail Learning