ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

可解释的、无监督的联合去噪与增强方法——面向真实低光照场景——阅读笔记(1)——ICLR 2025

可解释的、无监督的联合去噪与增强方法——面向真实低光照场景——阅读笔记(1)——ICLR 2025 原文标题INTERPRETABLE UNSUPERVISED JOINT DENOISING AND ENHANCEMENT FOR REAL-WORLD LOW-LIGHT SCENARIOS摘要现实世界中的低光照图像常遭受复杂的退化问题如局部过曝、亮度低、噪声以及光照不均匀。有监督方法往往会过拟合到特定场景而无监督方法虽然泛化性更好但由于缺乏参考图像难以对这些退化进行建模。为了解决这一问题我们提出一种可解释的、无参考的联合去噪与低光照增强框架适用于现实场景。我们的方法基于成对的子图像推导训练策略这些子图像具有不同的照度和噪声水平且基于物理成像原理和视网膜理论。此外我们利用离散余弦变换DCT在 sRGB 空间中进行频域分解并引入一种隐式引导的混合表示策略可有效分离复杂的复合退化。在骨干网络设计方面我们开发了由隐式退化表示机制引导的视网膜分解网络。大量实验证明了我们方法的优越性。代码将在https://github.com/huaqlili/unsupervised-light-enhance-ICLR2025上发布 。1.引言低光照图像增强是计算机视觉和图像处理领域的一个重要研究方向。这类图像固有的低信噪比特性会对下游任务产生不利影响如目标检测 Rashed - et al, 2019、图像分割 Wang et al, 2022 以及人脸识别 Serengil Ozpinar, 2020。此外低光照增强在夜间摄影 Jin et al, 2022; 2023、天文观测 Chen et al, 2021 和自动驾驶 Li et al, 2024 等领域的广泛应用凸显了其在低级视觉任务中的关键重要性。现实世界中的低光照增强面临诸多挑战需要同时处理亮度、对比度、伪影和噪声等问题。在过去几十年里传统方法如伽马校正 Huang et al, 2012、直方图均衡化 Lee et al, 2013 以及基于视网膜理论的方法 Land McCann, 1971 已被开发出来。然而这些方法聚焦于一维亮度问题难以应对复杂的现实场景且其手工设计的先验在不同条件下往往缺乏泛化性。近年来基于学习的低光照增强方法取得了显著进展。然而这些方法通常依赖于配对数据如 Zhang et al, 2021; Cai et al, 2023; Wu et al, 2022; Xing et al, 2024; Bai et al, 2024 或非配对数据如 Jiang et al, 2021; Yang et al, 2023这使得收集大规模数据集颇具挑战。此外参考图像与亮度图像之间的差异会干扰模型拟合因此开发高效的无参考方法至关重要。图1与当前最优方法 Liang 等人2023和 Ma 等人2022在 SIDD 数据集上的对比表明我们提出的方法在真实成像原理的指导下在降噪、图像增强和色彩保真度方面均取得了最佳性能。为应对上述挑战我们提出一种基于现实世界物理模型的无参考联合去噪与增强方法。具体而言我们引入基于邻域像素掩码的自监督图像去噪方法以及结合随机伽马调整和视网膜理论的自监督增强策略。通过获取具有不同光照和噪声水平的子图像对该框架能够应对低光照条件导致的复杂退化问题。此外我们利用离散余弦变换DCT对反映各种退化的物理先验进行建模并设计一个全局学习编码器从这些先验中提取隐式退化表示。在骨干网络设计中我们开发由隐式退化表示机制引导的视网膜分解网络。这种方法使我们能够在频域中分离和处理复杂退化而非按顺序处理特征如先前的方法那样。大量实验表明与当前的先进方法相比我们的方法具有显著优势。本文的主要贡献如下通过对原始低光照图像进行预处理生成具有不同光照和噪声水平的配对子图像然后进行视网膜分解推导并验证了一个物理合理的无监督联合去噪和增强框架。我们利用离散余弦变换DCT对捕捉复杂复合退化的物理先验进行建模并设计了一个全局学习的编码器从这些先验中提取隐式退化表示。我们开发了一种混合先验注意力 Transformer 网络集成退化特征以重建反射图同时自适应增强光照。在多个真实世界数据集上进行的大量实验表明与先进方法相比我们的方法在多个指标上实现了更优的性能 。2.相关工作2.1 自监督 / 无监督低光照图像增强自监督和无监督低光照增强的发展遵循两种主要方法无参考学习和无配对学习。Zero - DCEGuo 等人2020引入了一种基于曲线的无参考增强迭代方法后经 Zero - DCELi 等人2021改进以实现更高效率。像 RUASLiu 等人2021和 SCIMa 等人2022这类方法为该策略配备去噪模块以处理复杂退化问题。然而这些方法在可解释性以及对复杂退化的建模方面往往存在不足。相比之下无配对学习利用来自相同场景或不同光照条件的低光照和正常光照图像对。基于生成对抗网络GAN的方法如 EnlightenGANJiang 等人2021和 NeRCoYang 等人2023采用循环网络进行域间双向图像变换学习。PairLIEFu 等人2023利用视网膜理论处理来自同一场景、具有不同退化的低光照图像。尽管这些方法展现出强大的生成能力但其性能可能因不一致的正常光照参考以及归一化光照分布的难度而受到限制。2.2 图像处理中的频域分析DCTconvCheiński 和 Wawrzyński2020将卷积与逆离散余弦变换IDCT相集成形成一种新颖的层有助于网络剪枝。Xie 等人2021引入一种感知频率的动态网络在图像超分辨率中利用离散余弦变换DCT以降低计算成本。为改善内容保留Cai 等人2021采用傅里叶频谱一致性约束进行图像翻译。近来频域处理备受关注。Zou 等人2024表明退化主要影响振幅谱而 FSILiu 等人2023设计了一个频 - 空交互网络以解决显示器下相机图像恢复问题。Zou 等人2022采用小波变换分离频域信息使用多分支网络恢复高频细节。WINNetOu 等人2024结合小波 - 基于学习的方法构建具有强泛化能力、可解释的网络。FCDiffusionGao 等人2024利用 DCT 对特征图进行滤波在不同频段实现可控生成 。3.方法3.1 理论基础3.1.1 视网膜理论Retinex Theory传统的 Retinex 图像增强算法Land McCann,1971;Wei 等人,2018模拟人类视觉对亮度和颜色的感知。它将图像分解为光照分量和反射分量。该结论可通过以下公式表示其中表示逐元素乘法。反射分量 R 由物体的固有属性决定而光照分量 L 代表光照强度 。然而传统 Retinex 算法未考虑由不均衡光照分布或低光照条件下真实世界暗场景产生的复杂退化问题且这种质量损失会随着图像增强进一步放大。因此我们将噪声干扰项 N 添加到反射分量中作为理论分析的基础在大多数低光照场景中N 被建模为零均值泊松噪声。3.1.2 自监督去噪中的邻域像素掩码Neighboring Pixel Masking in Self-Supervised Denoising图像去噪是图像恢复领域中一个经典的不适定问题这意味着对于同一含噪场景存在多种潜在解决方案 。以往的图像去噪模型Zhang 等人,2017;Goyal 等人,2020通常需要含噪图像和对应清晰图像的配对输入以有效训练网络其中代表需要优化的参数。但在实际场景中获取配对图像往往具有挑战性甚至不可能。因此一系列自监督和无监督方法应运而生仅使用含噪图像进行训练。N2NLehtinen 等人2018的理论基础源于点估计即估计一系列观测值的真实值。目标是找到一个值 z 使到所有观测值的距离之和最小以此作为估计值 。当使用损失进行估计时用另一个具有相同均值的观测值 z 替换 x 不会改变结果。将这一理论点估计框架扩展到训练神经网络回归器时网络的优化目标可转换为这意味着在训练去噪网络时若用含零均值噪声的含噪图像替换清晰图像使用 L2 损失的优化结果将与用含噪 - 清晰图像对训练的结果等效。这一假设构成了我们工作的基础。3.2 整体架构Overall Architecture基于上述理论基础我们表示低光照图像其中 N 代表零均值噪声分布。我们的目标是生成同一场景、具有不同噪声观测的图像确保噪声保持零均值且去噪后的真实情况在这些图像中一致。在无正常光照参考图像的场景下我们提出通过邻域掩码 \(\mathcal{D}\) 过程生成两个 1/4 分辨率的子图像 。具体而言原始图像 I 被划分为多个 2×2 像素块从每个块中随机选取两个相邻像素分配到两个子图像的对应区域。生成的子图像可数学表述为其中和代表服从相同分布的噪声分量和像素值高度相似和对应相同光照条件。先前的研究Fu 等人2023表明若能获取同一场景在不同光照条件下的图像可利用深度学习分解对应的反射率 R 理论上反射率和应相同 。为生成不同光照下的监督信号我们对应用伽马校正得到。我们避免直接对原始图像 I 应用伽马校正因为噪声 N 几乎在相同水平被保留使网络学习恒等映射。在得到增强图像后鉴于相对于像素值较小我们对其进一步进行泰勒级数展开其中代表伽马增强因子当接近 1 时。原始等式可进一步重写为进而得到两个子图像的最终表达式在此公式中和共享同一真实反射率因处于同一场景同时和代表不相同的零均值噪声分布 。此外第一幅和第二幅图像涵盖不同光照条件。因此通过简单约束相等我们可构建一个自监督的联合去噪与增强网络DENet。图2我们提出方法的流程如下首先利用像素掩码和基于伽马的非线性增强对低光照全分辨率图像 I 进行预处理生成具有不同光照和噪声水平的子图像。接着这些子图像被输入 Decompose-Net该网络采用 Transformer 架构融合混合退化表示并通过交叉注意力注入引导嵌入。随后LCnet 对光照图进行增强处理。如图 2 所示DENet 的整体架构主要分为四个组件频率 - 光照表示编码器FIcoder、反射图提取网络REFnet、光照图提取网络LUMnet和光线校正网络LCnet 。REFnet 和 LUMnet 用于从子图像和中提取反射图和光照图。在 LUMnet 中每个 Transformer 块分为自注意力计算模块和门控模块。REFnet 需要反射图提取的退化表示以特征标记的形式与特征进行交叉注意力计算如图 3 所示 。LCnet 使用 Transformer 处理其特征然后应用全局平均池化。池化后的特征通过两个线性层缩放为一维增强因子以校正光照图随后与反射图相乘生成最终校正图像。图3展示了由多头交叉注意力引导的混合先验退化表示。经处理后特征图呈现出更清晰的分层结构且噪声显著降低。3.3 频率 - 光照先验编码器FIcoder 主要用于从光照和频域先验中获取退化表示然后通过 REFnet 中的交叉注意力机制与特征图集成。多先验的融合增强了模型在多样且复杂退化场景下的泛化能力。如图 4 所示光照先验代表图像的亮度信息而四个频域先验频率从低到高分别捕捉色度、语义、边缘轮廓和噪声强度信息。图4五种图像先验的可视化结果。它们分别对应色度、语义信息、边缘轮廓和噪声强度。首先我们提取光照先验即子图像在通道维度上的均值代表图像的整体亮度水平。对于频率先验我们使用逐通道二维离散余弦变换2D DCT将空间域图像 I 转换为频域对应物 F 。DCT 域中的不同光谱带对输入图像的不同视觉属性退化表示进行编码分析。为获取四个频率带的频谱图我们定义四个掩码其中t 代表手动设置的带宽超参数。我们将掩码应用于频谱特征图 F 根据不同频率带进行滤波。通过对这些滤波后的图执行逆离散余弦变换IDCT得到对应的空间域特征图像。最后我们通过基于卷积网络的光照 - 频率先验编码器将和进行组合。该编码器基于分离退化特征构建隐式表示。在训练过程中FIcoder 处理输入子图像和生成对应的退化表示和。3.4 损失函数在模型训练期间DENet 执行以下计算在推理阶段我们输入原始分辨率的低光照图像 I 将分解后的反射分量 R 与校正后的光照 L 相乘得到最终增强结果。该方法的损失函数主要分为两方面1视网膜分解损失Retinex Decomposition Loss此损失约束视网膜分解确保得到的反射图和光照图与基本物理假设一致2自监督增强损失Self - supervised Enhancement Loss此损失通过对亮度、对比度、饱和度等因素施加约束调节增强图像确保增强效果符合预期视觉质量。我们采用的视网膜分解损失主要分为两部分第一部分是如前所述主要约束从和得到的反射图和之间的距离第二部分是对光照图施加平滑约束并确保分解图的乘积等于原始图像。这两种损失的表达式如下其中和分别代表 FIcoder 从子图像和提取的退化表示。表示光照图的梯度。我们添加正则化项以对齐梯度并测试原始尺度图像。通过范数将掩码测试结果与子图像反射图进行比较确保和在不同尺度上的一致性增强泛化性和训练稳定性。对于自监督增强损失我们设计了两个组件一致性损失和增强损失增强前后的图像被划分为 K 个块。其中代表位置 i 周围的相邻块。和分别表示对应位置第 i 个块内的平均像素值。损失对块的平均亮度和图像整体色度施加约束其中代表增强图像中 p 通道的平均强度值E 代表与自然感知一致的曝光标准。和分别代表相应的权重因子。最后端到端网络的整体损失可描述为其中和分别代表相应的权重因子。4.实验4.1 实现细节为确保公平性所有实验在训练 100 个轮次epoch后终止。我们统一将初始学习率设为并在 RTX 3090 GPU 上开展所有实验。训练期间图像被随机裁剪为 256×256 的 patches像素值归一化到 (0, 1) 范围批次大小设为 1。我们在四个基准数据集上进行测试LOLv1Wei 等人2018、LOLv2 - realYang 等人2021、SICECai 等人2018和 SIDDAbdelhamed 等人2018。有关数据集的详细信息包括对应的训练集和测试集划分可查阅补充材料。4.2 基准测试结果LOl 数据集上的实验结果如表 1 所示我们的模型优于大多数对比的无配对和无参考方法在多个指标上取得最高分数。定性视觉对比结果见图 5。无配对方法受益于正常光照条件下拍摄的参考图像学习必要的光照特征更轻松。然而这些方法在曝光不足的局部区域处理不佳会出现如暗区死黑等问题。表1在 LOLv1 与 LOLv2 图像集上的 PSNR↑、SSIM↑、LPIPS↓ 得分。每个指标下的最优结果用红色标出次优结果用蓝色标出。图5在 LOL 数据集上典型无监督增强方法Yang et al., 2021的可视化对比。肉粉色框标注了显著差异区域。同时EnlightGAN、ZeroDCE 和 Clip - LIT 能成功增强过暗区域。但由于缺乏合适的去噪机制它们在增加曝光时易引入噪声。我们的方法利用光照先验和频域分解有效补充多维光照信息解决局部过曝、欠曝和噪声等复杂退化问题。SICE 和 SIDD 数据集上的实验结果如表 2 所示。选定的 SICE 测试集包含低、中、高三种低光照退化程度的图像。我们使用统计指标评估模型在不同光照条件下的泛化能力定性对比结果见图 6。RUAS 和 EnlightGAN 均存在局部过曝和强烈对比度失真等问题这源于其网络结构中缺乏可解释的光照反馈设计。Nerco 会在某些图像区域产生伪影凸显出生成模型在图像增强任务中的不可控性。相比之下我们的方法展现出恰当的对比度、准确的色度、低噪声和丰富的细节。表2在 SICE 图像集上的 PSNR↑/SSIM↑/LPIPS↓ 得分以及在 SIDD 图像集上的 BRSIQUE↓/CLIPIQA↓ 得分。各项指标的最优结果以红色标示次优结果以蓝色标示。图6在 SICE 数据集上Cai et al., 2018典型无监督增强方法的可视化对比。肉粉色框标出了显著差异区域。SIDD 数据集上的定性对比结果见图 7。我们评估模型在高噪声水平和复杂噪声模式的具有挑战性的低光照场景中的增强能力。我们的方法在两个无参考统计指标 BRISQUE 和 CLIPIQA 上表现最佳表明增强后的图像更接近自然图像失真更少。从视觉结果看我们的方法在面对现实世界复杂噪声场景时展现出鲁棒性能有效增强光照同时控制噪声强度。相比之下其他方法要么缺乏专门的去噪设计要么未从感知角度处理噪声且无相应的可解释性理论分析导致结果欠佳。图7在 SIDD 数据集Abdelhamed et al., 2018真实低光照图像上的可视化对比。4.3 消融实验去噪设计Denoiseing Design在前述章节中我们设计了一种结合邻域掩码和伽马增强的混合机制构建具有不同光照和噪声水平的图像对用于联合去噪和增强训练。在设置 1set1中我们移除掩码机制使用不同光照的原始分辨率图像进行训练在设置 2set2中我们应用完整的预处理机制但省略公式 14 中的正则化项。我们在 LOLV1 和 LOLv2 - Real 数据集上实施这些设置定量结果见表 4视觉对比见图 8。结果表明移除该策略的任何部分都会降低性能结合两种策略对于实现最优去噪结果是必要的。在 set1 中噪声强度显著突出主要是因为分解网络在学习光照图时生成恒等映射在 set2 中图像在欠曝区域丢失细节这源于下采样导致的局部语义损失。混合先验设计Hybrid Prior Design表 3 和图 9 呈现了对混合先验进行消融实验的结果。先验分为三部分光照先验、高通滤波先验和低通滤波先验分别捕捉亮度、噪声和颜色信息。当所有先验都被移除时结果变差而包含光照先验时有显著提升约 0.6 dB。在完整版本基础上移除高频或低频分量会对性能产生不利影响表明结合多种有效线索可取得最佳结果。表3关于三种物理先验贡献的消融实验结果。最佳与次佳结果分别用红色和蓝色突出显示。光线校正网络LCnetLCnet 的设计旨在构建一个光照自适应模块调整光照图以实现最高的感知质量。我们移除了 LCnet采用类似于 PairLIE 的参考调整策略。视觉结果如图 8 所示。若没有自适应策略对于同一场景中具有不同低光照退化的图像难以实现一致的增强结果会导致局部区域过曝。表4针对去噪设计贡献的消融实验其中 NM 表示邻域掩码neighborhood masking。最佳与次佳结果分别用红色和蓝色突出显示。图8左侧LCnet 自适应能力的可视化实验。右侧去噪设计消融实验的可视化结果。伽马增强因子Gamma Enhancement Factor对于预训练期间应用于图像的伽马增强操作我们探究了何种增强因子能带来最佳性能。我们用通过公式调节。结果如图 9 所示在为 1.2 到 1.9 的范围内增强效果起初呈上升趋势随后下降。值较低时增强后的图像与其他子图像在光照差异上不足而这对模型分解至关重要值较高时增强不符合框架推理期间的假设导致更复杂的非线性噪声变化对模型性能产生负面影响。因此在每次迭代中我们在 (1.3, 1.7) 范围内随机采样增强因子为模型提供更广泛的特征处理选项。控制因子的具体选择标准详见补充材料。图9左侧在 LOLv1 数据集上PSNR 随伽马增强因子的变化曲线。右侧不同物理先验的消融实验结果。5 结论本文应对低光照图像增强与去噪的挑战尤其针对复杂的现实场景。我们提出一种无参考框架结合通过邻域像素下采样实现的自监督去噪以及基于视网膜感知理论的随机伽马调整增强。为解决现有方法在处理频域退化方面的局限我们引入基于 sRGB 空间离散余弦变换DCT的滤波模块以实现多频率分离以及动态离散序列融合 Transformer 来整合频域先验。在真实世界数据集上的实验表明我们的方法优于现有先进技术为低光照增强与去噪提供了稳健的解决方案 。
返回列表