原文标题:INTERPRETABLE UNSUPERVISED JOINT DENOISING AND ENHANCEMENT FOR REAL-WORLD LOW-LIGHT SCENARIOS
摘要
现实世界中的低光照图像常遭受复杂的退化问题,如局部过曝、亮度低、噪声以及光照不均匀。有监督方法往往会过拟合到特定场景,而无监督方法虽然泛化性更好,但由于缺乏参考图像,难以对这些退化进行建模。为了解决这一问题,我们提出一种可解释的、无参考的联合去噪与低光照增强框架,适用于现实场景。我们的方法基于成对的子图像推导训练策略,这些子图像具有不同的照度和噪声水平,且基于物理成像原理和视网膜理论。此外,我们利用离散余弦变换(DCT)在 sRGB 空间中进行频域分解,并引入一种隐式引导的混合表示策略,可有效分离复杂的复合退化。在骨干网络设计方面,我们开发了由隐式退化表示机制引导的视网膜分解网络。大量实验证明了我们方法的优越性。代码将在https://github.com/huaqlili/unsupervised-light-enhance-ICLR2025上发布 。
1.引言
低光照图像增强是计算机视觉和图像处理领域的一个重要研究方向。这类图像固有的低信噪比特性会对下游任务产生不利影响,如目标检测 (Rashed - et al, 2019)、图像分割 (Wang et al, 2022) 以及人脸识别 (Serengil & Ozpinar, 2020)。此外,低光照增强在夜间摄影 (Jin et al, 2022; 2023)、天文观测 (Chen et al, 2021) 和自动驾驶 (Li et al, 2024) 等领域的广泛应用,凸显了其在低级视觉任务中的关键重要性。
现实世界中的低光照增强面临诸多挑战,需要同时处理亮度、对比度、伪影和噪声等问题。在过去几十年里,传统方法如伽马校正 (Huang et al, 2012)、直方图均衡化 (Lee et al, 2013) 以及基于视网膜理论的方法 (Land & McCann, 1971) 已被开发出来。然而,这些方法聚焦于一维亮度问题,难以应对复杂的现实场景,且其手工设计的先验在不同条件下往往缺乏泛化性。
近年来,基于学习的低光照增强方法取得了显著进展。然而,这些方法通常依赖于配对数据(如 Zhang et al, 2021; Cai et al, 2023; Wu et al, 2022; Xing et al, 2024; Bai et al, 2024) 或非配对数据(如 Jiang et al, 2021; Yang et al, 2023),这使得收集大规模数据集颇具挑战。此外,参考图像与亮度图像之间的差异会干扰模型拟合,因此开发高效的无参考方法至关重要。
| 图1:与当前最优方法 Liang 等人(2023)和 Ma 等人(2022)在 SIDD 数据集上的对比表明,我们提出的方法在真实成像原理的指导下,在降噪、图像增强和色彩保真度方面均取得了最佳性能。 |
为应对上述挑战,我们提出一种基于现实世界物理模型的无参考联合去噪与增强方法。具体而言,我们引入基于邻域像素掩码的自监督图像去噪方法,以及结合随机伽马调整和视网膜理论的自监督增强策略。通过获取具有不同光照和噪声水平的子图像对,该框架能够应对低光照条件导致的复杂退化问题。此外,我们利用离散余弦变换(DCT)对反映各种退化的物理先验进行建模,并设计一个全局学习编码器,从这些先验中提取隐式退化表示。在骨干网络设计中,我们开发由隐式退化表示机制引导的视网膜分解网络。这种方法使我们能够在频域中分离和处理复杂退化,而非按顺序处理特征,如先前的方法那样。大量实验表明,与当前的先进方法相比,我们的方法具有显著优势。
本文的主要贡献如下:
- 通过对原始低光照图像进行预处理,生成具有不同光照和噪声水平的配对子图像,然后进行视网膜分解,推导并验证了一个物理合理的无监督联合去噪和增强框架。
- 我们利用离散余弦变换(DCT)对捕捉复杂复合退化的物理先验进行建模,并设计了一个全局学习的编码器,从这些先验中提取隐式退化表示。
- 我们开发了一种混合先验注意力 Transformer 网络,集成退化特征以重建反射图,同时自适应增强光照。
- 在多个真实世界数据集上进行的大量实验表明,与先进方法相比,我们的方法在多个指标上实现了更优的性能 。
2.相关工作
2.1 自监督 / 无监督低光照图像增强
自监督和无监督低光照增强的发展遵循两种主要方法:无参考学习和无配对学习。Zero - DCE(Guo 等人,2020)引入了一种基于曲线的无参考增强迭代方法,后经 Zero - DCE++(Li 等人,2021)改进以实现更高效率。像 RUAS(Liu 等人,2021)和 SCI(Ma 等人,2022)这类方法为该策略配备去噪模块,以处理复杂退化问题。然而,这些方法在可解释性以及对复杂退化的建模方面往往存在不足。相比之下,无配对学习利用来自相同场景或不同光照条件的低光照和正常光照图像对。基于生成对抗网络(GAN)的方法,如 EnlightenGAN(Jiang 等人,2021)和 NeRCo(Yang 等人,2023),采用循环网络进行域间双向图像变换学习。PairLIE(Fu 等人,2023)利用视网膜理论处理来自同一场景、具有不同退化的低光照图像。尽管这些方法展现出强大的生成能力,但其性能可能因不一致的正常光照参考以及归一化光照分布的难度而受到限制。
2.2 图像处理中的频域分析
DCTconv(Cheiński 和 Wawrzyński,2020)将卷积与逆离散余弦变换(IDCT)相集成,形成一种新颖的层,有助于网络剪枝。Xie 等人(2021)引入一种感知频率的动态网络,在图像超分辨率中利用离散余弦变换(DCT)以降低计算成本。为改善内容保留,Cai 等人(2021)采用傅里叶频谱一致性约束进行图像翻译。近来,频域处理备受关注。Zou 等人(2024)表明退化主要影响振幅谱,而 FSI(Liu 等人,2023)设计了一个频 - 空交互网络以解决显示器下相机图像恢复问题。Zou 等人(2022)采用小波变换分离频域信息,使用多分支网络恢复高频细节。WINNet(Ou 等人,2024)结合小波 - 基于学习的方法,构建具有强泛化能力、可解释的网络。FCDiffusion(Gao 等人,2024)利用 DCT 对特征图进行滤波,在不同频段实现可控生成 。
3.方法
3.1 理论基础
3.1.1 视网膜理论(Retinex Theory)
传统的 Retinex 图像增强算法(Land & McCann,1971;Wei 等人,2018)模拟人类视觉对亮度和颜色的感知。它将图像分解为光照分量
和反射分量
。该结论可通过以下公式表示:
其中表示逐元素乘法。反射分量 R 由物体的固有属性决定,而光照分量 L 代表光照强度 。然而,传统 Retinex 算法未考虑由不均衡光照分布或低光照条件下真实世界暗场景产生的复杂退化问题,且这种质量损失会随着图像增强进一步放大。因此,我们将噪声干扰项 N 添加到反射分量中,作为理论分析的基础:
在大多数低光照场景中,N 被建模为零均值泊松噪声。
3.1.2 自监督去噪中的邻域像素掩码(Neighboring Pixel Masking in Self-Supervised Denoising)
图像去噪是图像恢复领域中一个经典的不适定问题,这意味着对于同一含噪场景,存在多种潜在解决方案 。以往的图像去噪模型(Zhang 等人,2017;Goyal 等人,2020)通常需要含噪图像和对应清晰图像
的配对输入,以有效训练网络:
其中代表需要优化的参数。但在实际场景中,获取配对图像往往具有挑战性,甚至不可能。因此,一系列自监督和无监督方法应运而生,仅使用含噪图像进行训练。
N2N(Lehtinen 等人,2018)的理论基础源于点估计,即估计一系列观测值的真实值。目标是找到一个值 z ,使到所有观测值的距离之和最小,以此作为估计值 。当使用
损失进行估计时,用另一个具有相同均值的观测值 z 替换 x 不会改变结果。
将这一理论点估计框架扩展到训练神经网络回归器时,网络的优化目标可转换为:
这意味着在训练去噪网络时,若用含零均值噪声的含噪图像替换清晰图像
,使用 L2 损失的优化结果将与用含噪 - 清晰图像对训练的结果等效。这一假设构成了我们工作的基础。
3.2 整体架构(Overall Architecture)
基于上述理论基础,我们表示低光照图像,其中 N 代表零均值噪声分布。我们的目标是生成同一场景、具有不同噪声观测的图像,确保噪声保持零均值,且去噪后的真实情况在这些图像中一致。在无正常光照参考图像的场景下,我们提出通过邻域掩码 \(\mathcal{D}\) 过程生成两个 1/4 分辨率的子图像 。具体而言,原始图像 I 被划分为多个 2×2 像素块,从每个块中随机选取两个相邻像素,分配到两个子图像的对应区域。生成的子图像可数学表述为:
其中,和
代表服从相同分布的噪声分量,
和
像素值高度相似,
和
对应相同光照条件。
先前的研究(Fu 等人,2023)表明,若能获取同一场景在不同光照条件下的图像,可利用深度学习分解对应的反射率 R ,理论上反射率和
应相同 。为生成不同光照下的监督信号,我们对
应用伽马校正,得到
。我们避免直接对原始图像 I 应用伽马校正,因为噪声 N 几乎在相同水平被保留,使网络学习恒等映射。在得到增强图像
后,鉴于
相对于像素值较小,我们对其进一步进行泰勒级数展开:
其中,代表伽马增强因子,当
接近 1 时,
。原始等式可进一步重写为
,
,进而得到两个子图像的最终表达式:
在此公式中,和
共享同一真实反射率(因处于同一场景),同时,
和
代表不相同的零均值噪声分布 。此外,第一幅和第二幅图像涵盖不同光照条件。因此,通过简单约束
相等,我们可构建一个自监督的联合去噪与增强网络(DENet)。
| 图2:我们提出方法的流程如下:首先,利用像素掩码和基于伽马的非线性增强对低光照全分辨率图像 I 进行预处理,生成具有不同光照和噪声水平的子图像。接着,这些子图像被输入 Decompose-Net,该网络采用 Transformer 架构,融合混合退化表示,并通过交叉注意力注入引导嵌入。随后,LCnet 对光照图进行增强处理。 |
如图 2 所示,DENet 的整体架构主要分为四个组件:频率 - 光照表示编码器(FIcoder)、反射图提取网络(REFnet)、光照图提取网络(LUMnet)和光线校正网络(LCnet) 。REFnet 和 LUMnet 用于从子图像和
中提取反射图
和光照图
。在 LUMnet 中,每个 Transformer 块分为自注意力计算模块和门控模块。REFnet 需要反射图提取的退化表示,以特征标记的形式与特征进行交叉注意力计算,如图 3 所示 。LCnet 使用 Transformer 处理其特征,然后应用全局平均池化。池化后的特征通过两个线性层缩放为一维增强因子,以校正光照图,随后与反射图相乘,生成最终校正图像
。
| 图3:展示了由多头交叉注意力引导的混合先验退化表示。经处理后,特征图呈现出更清晰的分层结构,且噪声显著降低。 |
3.3 频率 - 光照先验编码器
FIcoder 主要用于从光照和频域先验中获取退化表示,然后通过 REFnet 中的交叉注意力机制与特征图集成。多先验的融合增强了模型在多样且复杂退化场景下的泛化能力。如图 4 所示,光照先验代表图像的亮度信息,而四个频域先验
,频率从低到高,分别捕捉色度、语义、边缘轮廓和噪声强度信息。
| 图4:五种图像先验的可视化结果。它们分别对应色度、语义信息、边缘轮廓和噪声强度。 |
首先,我们提取光照先验,即子图像在通道维度上的均值,代表图像的整体亮度水平。对于频率先验,我们使用逐通道二维离散余弦变换(2D DCT),将空间域图像 I 转换为频域对应物 F 。DCT 域中的不同光谱带对输入图像的不同视觉属性退化表示进行编码分析。为获取四个频率带的频谱图,我们定义四个掩码:
其中,t 代表手动设置的带宽超参数。我们将掩码
应用于频谱特征图 F ,根据不同频率带进行滤波。通过对这些滤波后的图
执行逆离散余弦变换(IDCT),得到对应的空间域特征图像
。
最后,我们通过基于卷积网络的光照 - 频率先验编码器,将和
进行组合。该编码器基于分离退化特征,构建隐式表示
。在训练过程中,FIcoder 处理输入子图像
和
,生成对应的退化表示
和
。
3.4 损失函数
在模型训练期间,DENet 执行以下计算:
在推理阶段,我们输入原始分辨率的低光照图像 I ,将分解后的反射分量 R 与校正后的光照 L 相乘,得到最终增强结果。
该方法的损失函数主要分为两方面:1)视网膜分解损失(Retinex Decomposition Loss):此损失约束视网膜分解,确保得到的反射图和光照图与基本物理假设一致;2)自监督增强损失(Self - supervised Enhancement Loss):此损失通过对亮度、对比度、饱和度等因素施加约束,调节增强图像,确保增强效果符合预期视觉质量。
我们采用的视网膜分解损失主要分为两部分:第一部分是,如前所述,主要约束从
和
得到的反射图
和
之间的
距离;第二部分是
,对光照图施加平滑约束,并确保分解图的乘积等于原始图像。这两种损失的表达式如下:
其中,和
分别代表 FIcoder 从子图像
和
提取的退化表示。
表示光照图的梯度。我们添加正则化项
以对齐梯度并测试原始尺度图像。通过
范数将掩码测试结果与子图像反射图进行比较,确保
和
在不同尺度上的一致性,增强泛化性和训练稳定性。
对于自监督增强损失,我们设计了两个组件:一致性损失和增强损失
:
增强前后的图像被划分为 K 个块。其中,代表位置 i 周围的相邻块。
和
分别表示对应位置第 i 个块内的平均像素值。损失
对块的平均亮度和图像整体色度施加约束,其中
代表增强图像中 p 通道的平均强度值,E 代表与自然感知一致的曝光标准。
和
分别代表相应的权重因子。最后,端到端网络的整体损失可描述为:
其中,和
分别代表相应的权重因子。
4.实验
4.1 实现细节
为确保公平性,所有实验在训练 100 个轮次(epoch)后终止。我们统一将初始学习率设为,并在 RTX 3090 GPU 上开展所有实验。训练期间,图像被随机裁剪为 256×256 的 patches,像素值归一化到 (0, 1) 范围,批次大小设为 1。
我们在四个基准数据集上进行测试:LOLv1(Wei 等人,2018)、LOLv2 - real(Yang 等人,2021)、SICE(Cai 等人,2018)和 SIDD(Abdelhamed 等人,2018)。有关数据集的详细信息,包括对应的训练集和测试集划分,可查阅补充材料。
4.2 基准测试结果
LOl 数据集上的实验结果如表 1 所示,我们的模型优于大多数对比的无配对和无参考方法,在多个指标上取得最高分数。定性视觉对比结果见图 5。无配对方法受益于正常光照条件下拍摄的参考图像,学习必要的光照特征更轻松。然而,这些方法在曝光不足的局部区域处理不佳,会出现如暗区死黑等问题。
| 表1:在 LOLv1 与 LOLv2 图像集上的 PSNR↑、SSIM↑、LPIPS↓ 得分。每个指标下的最优结果用红色标出,次优结果用蓝色标出。 |
| 图5:在 LOL 数据集上,典型无监督增强方法(Yang et al., 2021)的可视化对比。肉粉色框标注了显著差异区域。 |
同时,EnlightGAN、ZeroDCE 和 Clip - LIT 能成功增强过暗区域。但由于缺乏合适的去噪机制,它们在增加曝光时易引入噪声。我们的方法利用光照先验和频域分解,有效补充多维光照信息,解决局部过曝、欠曝和噪声等复杂退化问题。
SICE 和 SIDD 数据集上的实验结果如表 2 所示。选定的 SICE 测试集包含低、中、高三种低光照退化程度的图像。我们使用统计指标评估模型在不同光照条件下的泛化能力,定性对比结果见图 6。RUAS 和 EnlightGAN 均存在局部过曝和强烈对比度失真等问题,这源于其网络结构中缺乏可解释的光照反馈设计。Nerco 会在某些图像区域产生伪影,凸显出生成模型在图像增强任务中的不可控性。相比之下,我们的方法展现出恰当的对比度、准确的色度、低噪声和丰富的细节。
| 表2:在 SICE 图像集上的 PSNR↑/SSIM↑/LPIPS↓ 得分,以及在 SIDD 图像集上的 BRSIQUE↓/CLIPIQA↓ 得分。各项指标的最优结果以红色标示,次优结果以蓝色标示。 |
| 图6:在 SICE 数据集上(Cai et al., 2018),典型无监督增强方法的可视化对比。肉粉色框标出了显著差异区域。 |
SIDD 数据集上的定性对比结果见图 7。我们评估模型在高噪声水平和复杂噪声模式的具有挑战性的低光照场景中的增强能力。我们的方法在两个无参考统计指标 BRISQUE 和 CLIPIQA 上表现最佳,表明增强后的图像更接近自然图像,失真更少。从视觉结果看,我们的方法在面对现实世界复杂噪声场景时展现出鲁棒性,能有效增强光照,同时控制噪声强度。相比之下,其他方法要么缺乏专门的去噪设计,要么未从感知角度处理噪声,且无相应的可解释性理论分析,导致结果欠佳。
| 图7:在 SIDD 数据集(Abdelhamed et al., 2018)真实低光照图像上的可视化对比。 |
4.3 消融实验
去噪设计(Denoiseing Design):在前述章节中,我们设计了一种结合邻域掩码和伽马增强的混合机制,构建具有不同光照和噪声水平的图像对,用于联合去噪和增强训练。在设置 1(set1)中,我们移除掩码机制,使用不同光照的原始分辨率图像进行训练;在设置 2(set2)中,我们应用完整的预处理机制,但省略公式 14 中的正则化项。
我们在 LOLV1 和 LOLv2 - Real 数据集上实施这些设置,定量结果见表 4,视觉对比见图 8。
结果表明,移除该策略的任何部分都会降低性能,结合两种策略对于实现最优去噪结果是必要的。在 set1 中,噪声强度显著突出,主要是因为分解网络在学习光照图时生成恒等映射;在 set2 中,图像在欠曝区域丢失细节,这源于下采样导致的局部语义损失。
混合先验设计(Hybrid Prior Design):表 3 和图 9 呈现了对混合先验进行消融实验的结果。先验分为三部分:光照先验、高通滤波先验和低通滤波先验,分别捕捉亮度、噪声和颜色信息。当所有先验都被移除时,结果变差,而包含光照先验时,有显著提升(约 0.6 dB)。在完整版本基础上,移除高频或低频分量会对性能产生不利影响,表明结合多种有效线索可取得最佳结果。
| 表3:关于三种物理先验贡献的消融实验结果。最佳与次佳结果分别用红色和蓝色突出显示。 |
光线校正网络(LCnet):LCnet 的设计旨在构建一个光照自适应模块,调整光照图以实现最高的感知质量。我们移除了 LCnet,采用类似于 PairLIE 的参考调整策略。视觉结果如图 8 所示。若没有自适应策略,对于同一场景中具有不同低光照退化的图像,难以实现一致的增强结果,会导致局部区域过曝。
| 表4:针对去噪设计贡献的消融实验,其中 NM 表示邻域掩码(neighborhood masking)。最佳与次佳结果分别用红色和蓝色突出显示。 |
| 图8:左侧:LCnet 自适应能力的可视化实验。右侧:去噪设计消融实验的可视化结果。 |
伽马增强因子(Gamma Enhancement Factor):对于预训练期间应用于图像的伽马增强操作,我们探究了何种增强因子能带来最佳性能。我们用通过公式
调节
。结果如图 9 所示,在
为 1.2 到 1.9 的范围内,增强效果起初呈上升趋势,随后下降。
值较低时,增强后的图像与其他子图像在光照差异上不足,而这对模型分解至关重要;
值较高时,增强不符合框架推理期间
的假设,导致更复杂的非线性噪声变化,对模型性能产生负面影响。因此,在每次迭代中,我们在 (1.3, 1.7) 范围内随机采样增强因子,为模型提供更广泛的特征处理选项。控制因子的具体选择标准详见补充材料。
| 图9:左侧:在 LOLv1 数据集上,PSNR 随伽马增强因子的变化曲线。右侧:不同物理先验的消融实验结果。 |
5 结论
本文应对低光照图像增强与去噪的挑战,尤其针对复杂的现实场景。我们提出一种无参考框架,结合通过邻域像素下采样实现的自监督去噪,以及基于视网膜感知理论的随机伽马调整增强。为解决现有方法在处理频域退化方面的局限,我们引入基于 sRGB 空间离散余弦变换(DCT)的滤波模块以实现多频率分离,以及动态离散序列融合 Transformer 来整合频域先验。在真实世界数据集上的实验表明,我们的方法优于现有先进技术,为低光照增强与去噪提供了稳健的解决方案 。