原文链接:ieeexplore.ieee.org/document/11031107/
author={Song, Mengke and Li, Luming and Yu, Xu and Chen, Chenglizhao}
摘要
显著目标检测旨在识别图像中最引人注目的区域,并将显著目标与其背景区分开来。目前的SOD方法主要使用区分方法,这种方法对于清晰的图像效果很好,但在对象和背景之间具有相似颜色和纹理的复杂场景中很难实现。为了解决这些局限性,我们引入了基于扩散的显著对象检测模型(DiffSOD),该模型利用扩散框架中的噪声-图像去噪过程,增强了RGB和RGB-D图像中的显著检测。与直接合并RGB和深度信息的传统基于融合的SOD方法不同,我们将RGB和深度分别视为不同的条件,即外观条件和结构条件。这些条件作为扩散NET架构内的控制,指导去噪过程。为了便于指导,我们使用了两个专门的控制适配器:外观控制适配器和结构控制适配器。此外,在处理低质量的深度图时,传统的去噪UNET模型可能会遇到困难,可能会在去噪过程中引入有害的线索。为了减轻低质量深度图的影响,我们引入了质量感知过滤器。这种过滤器只选择性地处理高质量的深度数据,确保去噪过程基于可靠的信息。在基准数据集上的对比评估表明,DiffSOD显著超过现有的RGB和RGB-D显著检测方法,平均性能分别提高1.5%和1.2%,从而为基于扩散的密集预测模型在视觉显著检测中建立了新的基准。
Introduction
视觉显著检测1(VSD)是一项计算机视觉任务,旨在识别图像或视频中视觉上最明显的区域或对象。显著对象检测(SOD)是VSD中的一项特定任务,其重点是区分显著对象及其背景。它复制了人类视觉系统的选择性注意机制,该机制本能地将注意力集中在场景中最相关或最突出的部分。这项任务对于下游的视觉应用是至关重要的,例如图像检索[1]、群体活动识别[2]和分割[3]。
近年来,随着深度学习技术的引入,显著目标检测领域取得了显著的进步[4]。最先进的(SOTA)方法,包括RGB和RGB-D显著检测,主要采用了“区分”的观点。这些方法侧重于进行像素级的区分二值显著分类,目的是直接在像素级区分“显著”区域和“非显著”区域。然而,据观察,这些基于歧视的模型在处理复杂场景和背景噪声时面临挑战。背景噪声对超氧化物歧化方法的影响主要表现在几个方面。首先,背景噪声可能与显著对象共享相似的颜色、纹理或其他视觉特征,这使得传统的基于特征的方法难以区分显著对象和背景。其次,在某些情况下,背景中的噪声元素可能会错误地吸引模型的注意力,从而降低识别实际显著目标的准确性。第三,由于背景噪声的多样性和复杂性,单纯依靠判别性学习的SOD模型可能难以在看不见的噪声背景下保持良好的泛化性能。如图1-A(图顶部)所示,在具有背景噪声的复杂场景中,这些模型可能将黑色铸铜柱(黄框)的主干归类为显著,而将柱的末端(红框)视为不显著。这些方法通常依赖于学习区分特征或使用复杂的神经网络结构来将像素分类为显著或不显著。尽管它们在某些情况下显示出了令人振奋的结果,但它们在处理噪声图像和背景干扰方面的有效性有限。
与现有的基于判别的方法相比,本文的目的是增强模型对复杂背景噪声的适应能力。受最近扩散模型[5]、[6]在各种生成性任务中的成功应用的启发,我们提出了一种新的“噪声-图像去噪”方法来优化视觉显著检测。去噪扩散框架通过迭代去噪逐步细化特征,增强了视觉显著检测,使其对噪声和复杂背景具有鲁棒性。与单步方法不同,该方法利用上下文信息更好地将显著对象从模糊区域中分离出来,从而提高了准确性和在具有挑战性的场景中的适应性。如图1-A(下图)所示,即使在复杂背景噪声的干扰下,我们的方法也能很好地执行。为了实现这一点,我们采用了现有的噪声图像去噪模型,通过迭代去噪过程将随机噪声掩模转换为显著图。这允许该模型在每次迭代时逐渐改进显著预测,有效地将显著对象与背景噪声区分开来。然而,传统的遵循随机去噪过程的噪声图像去噪模型在实现我们的目标方面提出了挑战。这些模型中的随机去噪过程缺乏控制,这可能导致生成质量较差的显著图。因此,我们的观点是设计一个针对显著条件的受控扩散模型,其中我们提出的条件调节从噪声到显著过程中的潜在显著特征。这使得我们的模型能够将“基于歧视”的视角转变为“图像去噪”视角。
在我们的研究中,我们介绍了两个主要的创新,这两个创新通过噪声到图像的去噪过程来增强显著图的生成。我们用两个关键条件(图1-B)来指导这一过程:外观条件和结构条件。这些适配器由两个专门的适配器管理。外观控制适配器(SECIII-D.1)检查图像的视觉方面,以帮助有效地区分突出对象和复杂背景。结构控制适配器(第另一方面,III-D.2)使用深度数据更精确地勾勒出突出对象的形状。这些适配器共同确保更可控的去噪过程,产生准确和连贯的显著图。此外,在处理低质量的深度图时,传统的去噪UNET模型可能会遇到困难,为了解决这个问题,我们引入了质量感知过滤器(SEC)。III-C)方法。这将选择性地只处理符合我们质量标准的深度数据,例如高质量的深度图,从而保持我们显著检测方法的稳健性和可靠性。总而言之,我们的贡献可以概括为:
·我们引入了一个有洞察力的视角,倡导将视觉显著方法转变为“噪声到图像去噪”方法。这种视角挑战了传统的“区分”观点,并为视觉显著检测开辟了新的可能性。
·为了控制从噪声到突出的过程,我们建议利用两种类型的条件-外观和结构,这是通过两个专门的适配器实现的。
·我们提出了一种质量感知过滤器,选择性地使用高质量的深度数据,防止低质量的输入削弱检测过程,并确保可靠的显著结果。
·实验结果表明,DiffSOD在RGB和RGB-D SOD基准数据集上都达到了最好的性能,这证明了它的有效性。有关代码、数据集和结果的信息,请访问以下网址:https://githeb.com/mengkeSong/DiffSOD
图1.当面对有背景噪声的场景时,现有的判别分类和我们的噪声图像去噪方法的显著结果比较。B.DiffSOD的图解。该模型学习迭代去噪过程,将随机分布的显著模式转换为具有两种条件的显著图,以指导去噪过程,并学习质量感知过滤器,以滤除低质量的深度图。
II. RELATED WORK
A. CNN-Based Visual Saliency Detection Models
视觉显著检测可以分为两种类型:RGB/RGB-D显著目标检测(SOD)。近年来,基于CNN的图像显著目标检测方法取得了显著进展。这些方法[7]、[8]、[9]、[10]利用CNN强大的特征表示能力来捕获低级和高级视觉信息。各种CNN结构,如VGGNet[11]、ResNet[12]和DenseNet[13],已经被用来从图像中提取可区分的特征。此外,一些技术[14]将深度学习与传统方法相结合,进一步提高了图像显著目标检测的性能。某些著作[15]、[16]引入了注意机制,以学习更具区别性的特征,包括空间和通道注意以及像素化上下文注意。其他方法[17]、[18]探索了使用循环网络逐步完善显著图的方法。此外,多任务学习已被用于整合注视预测、图像捕获和边缘检测,从而提高了SOD的性能。
颜色(RGB)和深度数据的集成,称为RGB-D SOD,由于深度传感器的可用性和它们提供的额外几何信息,已经得到了相当大的关注。基于CNN的RGB-D SOD方法[19],[20],[21],[22],[23],[24]已被证明在准确捕捉颜色和几何之间的相互作用方面是有效的。传统的方法[25]、[26]通常通过中间融合策略来融合RGB和深度特征。这使他们能够更好地对颜色对比度和深度间断之间的复杂关系进行建模,从而提高检测性能。一些方法利用深度线索来产生空间或通道注意力,以增强RGB特征。采用动态卷积、图神经网络和知识提取等方法进行多模式特征融合。此外,交叉注意机制被用来促进RGB和深度线索之间的长范围交叉通道交互作用。
然而,目前的许多显著检测方法严重依赖于CNN结构,这限制了它们捕获长期依赖关系的能力。某些技术旨在整合全局和局部信息以实现准确的显著区域检测。例如,张等人。[27]提出了一个框架,从两个模式考虑了全球立场和地方细节的互补性,产生了有利的结果。然而,这些方法在充分利用特征之间的有利关系方面仍然面临挑战。
B. Transformer-Based Visual Saliency Detection Models
作为张{等人}。[27]首先提出了一种用于机器翻译的Transformer编解码器体系结构,该架构通过多次堆叠多头自关注和逐点前馈层来捕捉长范围的全局依赖关系,越来越多的工作将Transformer模型引入到各种计算机视觉任务中,并取得了良好的效果。对于视觉显著检测任务,最近的一些作品[28]、[29]、[30]、[31]、[32]、[33]、[34]、[35]也采用了Transformer结构。有些人首先使用CNN来提取图像特征,然后利用Transformer合并远程依赖关系[29]、[36]。其他人将CNN和变压器结合到混合体系结构中[33]。此外,一些人使用纯基于Transformer的模型来学习特征表示[28]、[37]。
这些基于CNN/Transformer的模型主要专注于区分,学习在像素级别区分显著和非显著区域。虽然它们可以在相对简单的场景中取得令人印象深刻的表现,但这些基于歧视的模型在面对包含背景噪声和分心的复杂场景时往往会遇到困难。为了解决这一局限性,我们的研究提出了另一种方法:从基于判别的分类转变为噪声图像去噪框架。这一新颖的框架结合了先进的技术和显著条件,以增强显著图的生成过程。通过采用这一观点,我们的目标是克服复杂场景带来的挑战,提供更有效的解决方案。
C. Diffusion-Based Models in Computer Vision
扩散模型是一种强大的生成模型,它使用前向高斯扩散过程对噪声图像进行采样,然后使用后向生成过程对其进行细化。扩散模型由于能够捕获高层语义信息,在图像合成[38]、图像编辑[39]和图像超分辨率任务[40]等领域显示出巨大的潜力。已有多项工作探索了图像扩散模型在不同领域的应用。MedSegDiff[6]提出了第一个基于DPM的医学分割模型,MedSegDiff-V2[41]在此基础上使用Transformer进一步提高了性能。在DiffCOD[42]中,该模型学会了将地面真相掩膜转换为随机分布的扩散过程。CamDiff[43]使用潜在扩散模型来合成伪装场景中的显著对象,而DiffusionDepth[44]学习迭代去噪过程来细化深度图。
然而,目前还没有研究证明扩散模型在SOD任务中的有效性。在本文中,我们建议使用扩散模型对输入的RGB(或深度)进行去噪,作为条件显著精化过程,而不是采用它作为典型的产生头。据我们所知,这是首次将扩散模型引入到超氧化物歧化任务中。
III. THE PROPOSED METHOD
A. Method Overview
我们方法的关键见解是通过噪声到图像的去噪过程来增强显著图的生成。图2说明了基于去噪扩散的视觉显著检测模型的方法流水线。我们的方法包括三个主要部分:1)去噪(SEC.III-B)、2)质量感知过滤器(SECIII-C)和3)控制适配器(SECIII-D)。该模型以随机噪声掩码ZT开始,采用最先进的去噪NET(例如,[45]),其迭代地精炼显著图。这一过程由两个专门的控制适配器精心指导-外观控制适配器,由RGB图像特征通知,以及结构控制适配器,由深度信息塑造,确保显著图准确地勾勒出对象轮廓。质量感知过滤器(QAF)是该模型的组成部分,选择性地仅结合高质量的深度图,从而增强了显著检测的保真度。接下来,我们将详细介绍每个组件。
图2。我们提出的基于扩散的视觉显著检测模型被巧妙地构造来处理RGB和RGB-D SOD任务。该模型从质量感知过滤器(A部分,SEC)开始III-C),它只严格处理高质量的深度图,以确保后续去噪过程的稳健性和可靠性。此外,为了提高去噪阶段的精度,实现了两个专门的控制适配器(B部分和C部分)。这些适配器通过利用“外观”和“结构”条件来指导去噪过程,这些条件在SEC中有详细介绍。III-D.1和SECIII-D.2。值得注意的是,RGB SOD任务中特别排除了涉及A部分和C部分的结构条件,以优化任务特定的加工效率。在测试过程中,当使用RGB-D数据作为输入时,如果深度图质量较低,网络将忽略深度,仅依靠RGB进行预测。
B. Preliminaries: Denoising UNet
在这项工作中,我们从噪声到图像的角度来处理视觉显著检测,并将其描述为扩散模型。具体地说,我们重新制定了包括RGB SOD和RGB-D SOD的SOD,作为一个扩散模型,它利用了去噪的UNET体系结构,类似于[5],由一个编码器和一个解码器组成(如图2所示-“E”和“D”)。
扩散模型由两个基本过程组成:前向噪声过程和后向扩散过程。在训练阶段,(对于每个步骤t)迭代地训练前向噪声过程,以用作后向扩散过程的先验。在测试阶段,后向扩散过程与前向噪声过程相反,并产生期望的图像作为输出。前向噪声处理,表示为Q(·),在高斯空间N(·)内从噪声方差调度βS将噪声引入期望图像分布Z0。该过程产生潜在的噪声样本Zt。对于每个迭代步骤t,∈0,1,.。。,T,前向噪声过程可以表示为:
其中,q(·)表示前向噪声过程,z0表示期望图像分布,zt表示潜在噪声图像。前向噪声处理将噪声引入由N(·)表示的高斯空间内的期望图像分布。我就是去噪的形象。αS表示单步S的信号保持率,定义为1−βS,其中βS是在每一步引入的噪声方差。αt是αS从0步到t步的累积乘积,表示到t步的总信号保留率。αt·z0缩放信号分量,而(1−‘αt)·i表示噪声分量的方差,显示信号和噪声如何通过扩散步骤演变。
基于前向扩散过程的后向扩散过程旨在反转噪声的影响,以迭代地从潜在噪声样本恢复期望的图像分布,表示为zt。该迭代过程涉及从高斯分布N(µθ(zt,t),−(zt,t))中采样表示为pθ(ztσθ1|zt)的每个迭代。网络预测高斯分布的均值和方差。在每个迭代步骤t∈0,1,.。。,T,前向噪声过程可以用以下公式来描述:
我们将显著检测重新表述为显著条件引导的去噪过程。作为常规扩散模型中的潜在噪声显著分布zt的稳健性条件引导去噪显著检测器输入c,并且输出期望的显著图z0,噪声到显著的过程可以表示为:
其中,模型µθ(zt,t,c)被训练来将潜在的zt细化为zt−1。为了加快去噪过程,我们使用了来自ddim[46]的改进的推理过程,其中它将设置为0,以使预测输出具有确定性。
C. Quality-Aware Filter
在典型的基于CNN/Transformer的多通道视觉显著检测任务[47]、[48]中,例如RGB-D SOD,深度图提供了增强RGB图像的基本空间细节。这些深度图的质量对于提高显著预测精度至关重要。深度传感器质量的变化可能会导致噪声或模糊的深度图,这阻碍了RGB-D模型的学习过程,并降低了整体性能。由于缺乏评估深度数据的精确度和清晰度的机制,常规的去噪UNT模型往往难以应对这一挑战,在不区分高质量和低质量深度图的情况下,统一对待所有输入。因此,这些模型可能会无意中将错误的深度线索合并到显著检测过程中。
基于现有的基于融合的RGB-DSOD方法专注于评估和优化深度图质量[19],[20],我们引入了质量感知过滤器(QAF)方法。该方法动态地选择高质量的深度图,确保结构条件(SEC。III-D.2)只包含可靠的深度数据,从而过滤掉可能影响模型性能的较低质量的输入。从屏蔽自动编码器架构(例如,[45])中获得灵感,如图2-A部分所示,我们的QAF采用自监督策略来重建原始深度图,基于相对于原始深度的重建误差来评估其质量。
图3重建结果的可视化(Sec.III-C)。“D”:深度贴图,“MASTED D”:用一定的遮罩比例(这里的遮罩比例是20%)遮罩的深度贴图,“Restst”。D“:重建的深度图。
该实现包括将原始深度图分割成小块。随机掩码被应用于一些块,随后是重建深度图的编解码器过程。有关方法的更多细节,请参阅[45]。在训练阶段,只使用高质量的深度图来提高模型的重建能力。这些结果的可视化如图3所示。
我们的方法是基于这样的假设:高质量的原始深度图将产生低重建误差,而低质量的深度图将导致高误差。DiffSOD模型中深度信息的使用由重建损失的大小决定,公式如下:
其中,Lreconst表示重建损失,余弦相似度用作度量。变量DINPUT和DTARGET分别指原始和重建的深度贴图。超参数σ被设置为定义深度图的可接受质量阈值,其有效性在表IV中的消融分析中进行了讨论。二元指示符∆决定了深度信息在DiffSOD模型中的使用:∆=1表示在去噪过程中包括深度图,而∆=0表示排除深度图。
总之,通过仅使用来自现有数据集(如Kitti[49]和NYU Depth[50]数据集)的高质量深度图来预先训练模型,该模型有效地学习了深度图应该包含的结构信息。在测试过程中,无论输入深度图的质量如何,预先训练的模型都会使用该结构知识来指导重建。当输入质量较高时,重建损失较小;当输入质量较低时,重建损失较大。通过重建损失的变化,该模型可以间接评估输入深度图的质量,同时也证明了该模型对处理不同质量的深度图的适应性。
请注意,QAF是一个预处理阶段,在去噪过程开始之前进行预训练。在QAF存在的情况下,如果深度图的质量较低,则省略结构条件,并且在去噪过程中仅利用外观条件(即,RGB)。
D. Control Adapter
在深度学习中,特别是在用于图像生成任务的扩散模型中,在生成过程中采用了一个“控制适配器”来引入附加的控制信息。这些附加信息将指导模型生成具有特定样式或功能的图像。例如,在条件生成任务中,控件适配器帮助模型基于所提供的条件信息(例如类别标签或文本描述)来生成满足特定要求的图像。
基于这一思想,我们提出了用于视觉显著检测任务的控制适配器的概念,包括两种特殊类型:响应外观条件(即RGB图像特征)的外观控制适配器和利用结构条件(即深度信息)的结构控制适配器。通过集成这两个适配器,我们的目标是实现对显著生成过程的精确控制。外观和结构控制适配器的详细信息如图2-B部分和C部分所示。我们现在将对这些适配器进行更详细的描述。
1)外观控制适配器:自然图像固有的视觉复杂性需要微妙的解释才能有效地生成准确的显著图。因此,如图2-B部分所示,我们利用剪辑图像编码器(例如,CLIP VIT-B/32)来提取外观条件嵌入。因为Clip对大量图像和文本描述的训练使其具备了理解和表达跨视觉和文本领域的复杂语义概念的能力。这种深刻的语义理解使剪辑嵌入对于需要复杂解释可视内容的任务特别有益。
正如前面提到的,我们的方法的目的是从噪声掩模中预测所需的显著图,在其嵌入和剪辑图像编码器产生的初始外观条件之间形成域间隙。与噪声到显著过程中的显著分布相比,该高级初始出现条件特征具有不同的特征分布。这种差异可能导致对潜在显著特征的混淆和不正确的表示。
图4.语义引导注入(等式)的图解5和等式6)。通过分层FFT、共同注意机制和逆FFT将语义条件与噪声相结合。
为了弥补这一差距,我们提出了一种创新的解决方案,称为语义引导注入(SGI),它有效地结合了初始外观条件嵌入和扩散嵌入。如图4所示,SGI使我们的方法能够学习潜在噪声和初始出现条件特征之间的相互作用,从而得到更稳健的潜在显著特征的表示。SGI由两个共享相同结构的模块组成。每个块包括一个离散傅里叶变换(FFT(·))、两个共同注意模块、逐个元素乘法和一个逆傅立叶变换(IFFT[·])。将快速傅立叶变换(FFT)引入外观控制适配器的主要动机是增强显著特征和噪声特征之间的对准和交互,从而更好地指导模型在去噪和显著预测过程中。
在第一个块中,给定噪声嵌入zT和嵌入c0的初始出现条件,我们首先沿空间维度执行FFT(·)以将zT和c0转换到频域:
其中,FFT(·)表示离散傅立叶变换,ZT和C0是ZT和C0的频域中的特征。在获得频率表示后,我们利用两个共同注意模块。具体地说,嵌入C0作为关键字(K),噪声嵌入Zt作为查询(Q),允许我们在两个嵌入的特征之间执行交叉注意操作,确保初始出现条件和潜在噪声特征之间的有效交互。然后使用逐个元素的乘法组合这些特征以产生调制表示。接下来,应用逆FFT(IFFT)将调制的频率表示f(ZT,C0)转换回空间域。在应用层规格化之后,使用多层感知器进一步细化结果,导致更新的外观条件嵌入c0:
其中IFFT[·]表示逆傅立叶变换。
在第二个块中,c0被用作查询(Q),嵌入的噪声zT用作关键字(K)和值(V)。在应用层归一化和FFT后,嵌入通过两个共同注意模块进行处理,类似于第一个块,确保噪声与更新后的条件嵌入之间的对准。然后通过逐元素乘法对输出特征进行调制,通过逆FFT将其转换回空间域,并再次进行归一化。最后,应用另一个MLP产生最终的变换嵌入C_1作为精化的外观条件,并通过交叉注意注入到去噪UNET模型中的所有编解码块中,有效地指导去噪过程。
2)结构控制适配器:与传统的基于交叉模式融合的RGB-D SOD方法[16]、[51]不同,我们的噪声到图像去噪技术引入了一种新型的结构控制适配器,灵感来自ControlNet[52],如图2-C部分所示。该适配器利用结构和深度信息的集成来精确定义去噪过程中显著对象的轮廓。
我们的方法不是像ControlNet那样直接向输入噪声添加条件,而是使用特征金字塔网络(FPN)作为特征提取的骨干。该主干处理输入结构条件--具体地说,深度图--以提取多尺度特征嵌入。这些特征嵌入捕捉了场景的粗略和精细细节,这对于有效的去噪至关重要。
多尺度特征嵌入过程开始于将每个特征级别(MFi)上采样到统一尺度。然后对每个上采样特征应用卷积运算。我们利用简单的特征层级联(C),然后使用多个卷积层来产生结构化条件CONS:
其中,Conv表示3×3卷积运算,Up表示上采样运算。D是输入结构条件,即深度。
在建立主干和特征嵌入后,我们确定了去噪UNET(SEC)的初始权重。III-B),并复制编码器(E)结构和权重,创建E。该复制编码器在解码阶段综合了结构信息,提高了去噪结果的细节和准确性。为了实现这一点,我们确保去噪UNET中的所有其他元素保持不变,同时将解码器第i块的输入修改为:
这里,m表示编码器最后一块的输出。该输出与结构控制适配器CONS的输出组合,然后提供给解码器的第一块。CONS是至关重要的,因为它调整解码器的能力,以准确地呈现突出对象的轮廓。变量di−1指的是来自解码器的第(i−1)个块的输出,并且用作后续块的输入。术语e_j和e__j分别表示来自原始编码器E和复制编码器E_的第j个块的输出。函数零(·)表示零权重卷积层,该层用于将结构控制信息增量地合并到主要的去噪UNET框架中。
E. Loss Functions
扩散过程q(zt|z0)和去噪过程pθ(zt−1|zt)分别定义在方程中。1和等式。2.可训练参数主要是上面定义的条件去噪模型µθ(zt,t,c)和显著特征。去噪国际技术委员会的目标被定义为:
DiffSOD是通过加权总和组合损失来训练的,总损失LTotal可以由以下公式定义:
其中α1和α2是超参数。LBCE是二进制交叉熵损失。