☰
解耦多模态对抗自编码器:在不完全多模态神经图像下婴儿年龄预测中的应用
2026/10/8 2:13:17 网站建设 项目流程

摘要

得益于不同成像方式提供的互补信息,结构磁共振成像(sMRI)和功能性磁共振成像(fMRI)数据的有效融合,有望提高婴儿年龄预测的准确性。然而,与sMRI的形态特征相比,婴儿期fMRI测量的功能连接性较为不成熟且噪声较大,因此用于婴儿脑部分析的sMRI和fMRI融合极具挑战性。在传统的多模融合策略中,添加fMRI数据用于年龄预测的风险较高,会产生更多噪声而非有用特征,导致准确性低于单纯使用sMRI数据。为解决这一问题,我们开发了一个新模型,称为解缠多模对抗自编码器(DMM-AAE),基于多模脑MRI进行婴儿年龄预测。具体来说,我们将自编码器的潜在变量解码为通用码和特定码,分别表示模态间共享和互补的信息。然后,交叉重建要求和共比距离比损失作为正则化设计,以确保解缠的有效性和彻底性。通过布置相对独立的自编码器来分离模态,并在交叉重构要求下采用解缠来整合它们,我们的DMM-AAE方法有效限制了可能的跨模态干扰,实现有效的信息融合。利用潜变量纠缠,进一步提出了一种新策略,并嵌入DMM-AAE中,以解决多模态神经图像的不完备性问题,该方法也可作为缺失模态补值的独立算法使用。通过从sMRI中提取六种皮层形态测量特征,从fMRI中提取脑功能连接性作为预测变量,利用不完全多模态神经图像在婴儿年龄(出生后35至848天)预测中验证了所提DMMAAE的优越性。基于DMMAAE预测的平均绝对误差达到37.6天,优于最先进的方法。总体而言,我们提出的DMM-AAE可作为多模态数据预测的有前景模型。

引言

基于神经影像的年龄预测对于大脑发育分析和神经发育障碍的早期发现非常重要[1]。“按年龄”与预测的“脑年龄”之间的差异可视为偏离正常发育或衰老轨迹的一个指标。例如,结合神经影像数据的预测年龄可用于检测创伤性脑损伤后加速萎缩[2]以及精神分裂症[3]、2型糖尿病[4]和HIV疾病[5]导致的加速脑部衰老[5]。此外,脑年龄预测还被用来帮助识别可能对人类大脑的环境和生活方式相关影响,例如因高等教育、更多自我报告的体育活动[6]和长期冥想实践而导致的脑龄更年轻[6],以及中年相关的脑年龄增加[8]。由于不同神经影像模式能相互补充,研究人员开始结合多模态成像来预测脑年龄。例如,为了捕捉认知障碍,结合了从rs-fMRI中提取的功能连接性和sMRI中的皮层形态特征,用于预测大脑年龄[9]。在[10]中,结合了T2加权、T1加权、扩散加权和液体减弱分流回收(FLAIR)扫描进行年龄预测,强调了使用多模态生物标志物研究正常衰老的重要性。

尽管已有许多基于单模态或多模态神经影像进行年龄预测的研究,但由于图像采集和处理困难,关于婴儿年龄预测的研究却很少。另一方面,出生后的前两年是大脑结构[11]、[12]和功能[13]最关键且最具活力的产后发展期,这些发展在很大程度上影响了后续的认知和行为发展。因此,理解其潜在模式并识别出生后头两年大脑发育的重要生物标志物至关重要。尽管已有一些对婴儿大脑测量指标[11]、[12]、[14]的定量分析并发现了许多有见地的结果,但他们所采用的传统组级比较方法不足以精确识别个体层面的异常大脑发育[15]。与组级研究相比,个体化年龄预测是理解和建模受试者特定大脑发育的更好方法。尽管在老年人群中发现多模态MRI数据可以提升年龄预测准确率[9]、[10],但目前尚不清楚该方法在婴儿中是否仍然有效。据我们所知,目前尚无基于多模态神经影像的婴儿年龄预测研究。为了填补这一关键空白,并通过多种成像方式识别婴儿大脑发育的潜在生物标志物,本文重点利用sMRI和fMRI数据预测出生至两岁受试者的年龄。

然而,考虑到fMRI空间分辨率较低且噪声水平高,以及其衍生的功能连接性尚未成熟且发生剧烈变化,传统多模态融合策略直接融合fMRI和sMRI数据是不可行的,也无效[10]、[16]。这些策略甚至可能降低仅使用sMRI特征的准确性,而sMRI已被验证为预测婴儿年龄的稳健生物标志物[17]。作为多模数据融合中最流行的基于模型的方法之一,自编码器(AE)[18]利用潜在变量实现信息组合。然而,传统自编码器总是将不同模态的共享信息和互补信息混合到单一潜在变量中,其中一种模态的信息可能成为阻碍重建另一模态的噪声。因此,有效融合sMRI和fMRI数据的主要挑战是减少融合过程中不同模态之间的负面影响。为解决该问题,我们提出了一个解缠多模态对抗自编码器(DMM-AAE)模型,用于联合进行多模态潜变量学习和年龄预测器构建。该模型的核心思想是将每种模态的潜在变量解码为共同和具体的编码,分别表示模态的共享和互补信息。为了实现解缠,要求从不同模态获得的共同码应尽可能相似,而具体码之间应尽可能多地差异。因此,我们定义了交叉重建要求,要求每个模态必须通过其自身的特定代码和任何模态的共同代码来重建,以确保从不同模态获得的共同码的相似性。此外,公共码间距离与特定码间距离的比值被定义并引入模型,称为共同-特定码比损耗,强化了特定码之间的差异与共同码之间的共性。最后,结合两种模态获得的共同编码和特定编码来预测年龄,并将该过程与潜在表征学习整合为统一框架。此外,为了处理缺失模态,采用现有模态的通用且特定编码来迭代地推断缺失模态的潜在变量。该补补策略嵌入DMMAAE中,但也可以作为缺失模态补补的独立算法使用。

总结来说,1)我们采用潜变量解缠策略构建了一个深度DMM-AAE模型,不仅有效限制了模态间可能的干扰,还能从sMRI和fMRI数据中获取融合信息;2)我们设计了交叉重构要求和共比-特定距离比作为正则化,以确保解缠的有效性和合并信息的完整性;3)我们将多模态神经影像数据融合和年龄预测整合为统一框架,以确保学习与年龄相关的潜在表征;4)我们提出了一种插补算法,利用解缠潜变量所代表的共享信息和特定信息。

相关工作

婴儿年龄预测

有两项研究利用神经影像数据预测婴儿年龄。第一项研究的受试者年龄在5至590天之间[19]。它依赖于通过高斯尺度空间差分变换获得的sMRI特征,而这些特征在解释婴儿大脑的神经生物学变化方面较为可行。其他研究[17]则聚焦于出生至2岁的受试者,使用sMRI进行。[17]中的扫描是在不同时间点(1、3、6、9、12、18和24个月)拍摄的。这种特定的采样策略可能会对样本分布造成扭曲,并在建模从脑MRI特征到时间年龄的连续映射时产生偏差。与[19]和[17]相比,我们的研究:1)通过多模态神经图像(即sMRI和fMRI)预测婴儿年龄;2)使用年龄分布相对连续的受试者,从而形成具有更高泛化能力的模型;3)提供可解释的婴儿大脑发育多模态生物标志物;4)设计了一个多模态融合的新模型,该模型可推广至其他研究。

多模态融合

多模态数据融合的可用策略可归纳为两类:模型无关和基于模型[20]。模型无关的融合不依赖于特定的机器学习方法,通常分为:早期融合和晚期融合[18]。早期融合是最常用的方法,将不同模态的特征串接为输入,随后采用任何回归模型。晚期融合使用单模态决策值,将它们与某些融合机制(如平均、投票或加权)整合[18]。大多数基于多模态神经影像的年龄预测研究采用了这种模型无关的融合[10]、[16][21],但这并不能有效利用多模态之间的相关信息。这个问题将我们转向基于模型的融合,通过具体模型构建来解决融合模态。在基于模型的方法中(例如多核学习、图形模型和神经网络[20]),自编码器是最流行的多模态数据融合模型之一。它也可以分为早期和晚期融合策略。早期融合AE,如图1(a)所示,将模态1和模态2串接起来,实现编码和解码,在输入阶段混合信息。晚期融合的AE如图1(b)所示,每种模态都有自己的编码器和解码器,单模潜在变量被串接在一起,用于重建两种模态并进行预测。虽然能够学习互补信息,但早期和晚期融合的AE并不区分两种模态之间的互补信息与共享信息。如果一种模态包含大量噪声,由此推导出的潜在变量可能会阻碍对另一种模态的准确重建和潜变量学习。与现有的多模融合方法不同,我们的模型通过解开并表示两种模态之间的互补和共同信息来实现融合。

用于模态融合预测的不同类型的双模态深度自编码器(AE)。(a) 早期融合AE:将模态1和模态2的特征作为编码器的单一输入,并利用获得的潜在变量进行预测。(b)晚期融合AE:各模态拥有各自的AE,同时将潜在变量串接进行预测。E,E1 和E 2 是编码器。G,G1 和 G2 是解码器。P是预测头。

解耦表示学习

解缠表示是一种将特征编码为具有不同含义的因素的技术。解缠表示学习的生成模型在计算机视觉领域展现出巨大潜力[22]。半监督式解缠方法要求对底层因素的明确了解和实因子标签作为指导[23],这些方法表现优越,但在实际应用中存在困难。无监督解缠方法以变分自编码器(VAE)框架为主流,通过对变分后验与先验的KullbackLeibler(KL)散度施加额外惩罚来学习解缠表示[24]。虽然基于VAE的解缠表示学习有效,但它旨在将特征分解为独立的因素,这并不符合我们要求在模态间表示共享和互补的信息。通过为分解的因素赋予特定意义来解开潜在变量,是另一种解缠表示学习。[25]中的研究属于此类类型,与我们的工作最为相关,我们提出了一种自编码器模型,以探索两个域的共享内容和唯一内容。我们的DMMAAE模型与[25]有三个不同之处。1)目标和解缠所表示的信息完全不同。[25]中的工作侧重于图像到图像的转换,强调在导入第二域的特定内容的同时,去除第一个领域的特定内容。因此,[25]中描述的共享内容和独特内容是基于域名的。然而,我们的研究聚焦于个体化多模融合,我们所建模的共享和互补信息是个体特定的。2)相关数据的特性导致了[25]和本研究中自编码器的不同架构。3)为确保解缠而设计的约束完全不同。与[25]中的零损失和对抗损失相比,我们模型中设计的共同特异距离比损失和交叉重建损失基于受试者,且更适合多模态融合。

表1:受试者人口统计(男:月份;年龄分布由均值±标准差)表示

材料

我们利用来自UNC/UMN婴儿连接组项目的高质量MRI数据集,验证了我们提出的DMM-AAE模型在婴儿年龄预测中的有效性[26]。我们使用了178名足月出生受试者,接受了326次结构性MRI扫描和171次功能性MRI扫描,年龄范围从35天到848天不等。这些扫描的人口统计信息见表I。T1加权图像采用以下参数拍摄:208张矢状切片,TR/TE = 2400/2.24毫秒,采集矩阵=320×320,分辨率=0.8 × 0.8 × 0.8 立方毫米。采用以下参数拍摄T2加权图像:208张矢状切片,TR/TE = 3200/564毫秒,采集矩阵=320×320,分辨率=0.8 × 0.8 × 0.8 立方毫米。所有结构图像均通过成熟的婴儿专用计算流程预处理[27]、[28][29],包括共注册、强度不均匀性修正、颅骨剥离、小脑切除、组织分段、半球分离、拓扑修正及内外表面重建。每个皮层表面通过对齐到北卡罗来纳大学4D婴儿皮层表面图集(https://www.nitrc.org/projects/infantsurfatlas/)[31],将其划分为360个兴趣区域(ROI)[30]。四种形态特征类型,即局部脑回指数(LGI)、平均凸性、平均曲率和皮层厚度,是通过平均每个ROI内所有顶点的对应值得到的。另外两种特征类型,即表面积和皮层体积,则通过对每个ROI内所有顶点的对应值加总得到。在自然睡眠期间获得了高分辨率静息状态fMRI数据(rs-fMRI,时间分辨率=0.8秒,空间分辨率=2毫米各向同性)。除了人类连接组项目流程中的传统处理步骤外,我们特别采用了以下策略。(1) 功能信号的一次性重采样和去噪均在原生图像空间完成。这种方法避免了多次插值和平滑功能信号,否则通常会导致捕捉详细功能模式时的歧义。(2)基于深度学习的噪声成分去除,实现快速且稳健的fMRI去噪。提取了中表面所有fMRI时间序列顶点。随后,选择相同的360 ROI构建功能连通图,方法是计算每对ROI在时间序列间的Pearson相关系数。进行了Fisher的r-z变换以改善泛函连通性的正规性。

所提出方法的网络结构

方法

解缠多模态对抗自编码器

DMM-AAE的框架如图2所示,详见下文。

1)特征选择:对于一个小型数据集,实际中2160个结构特征(360 ROI上的6种特征)和64620个功能特征(360 × 360功能连接矩阵的上部三角形元素)的维度极高,这对训练效率低下且易受过拟合影响。因此,在训练神经网络模型之前,必须先进行特征选择。根据与归纳模型的关系,特征选择方法可分为滤波器方法、包装法和嵌入方法[32]。由于滤波器方法独立于归纳算法且通常更快,因此选择它作为特征选择策略。在此,随机森林作为特征选择方法,是因为它即使在高度相关的高维数据中,在特征选择上的表现更优[33]。在特征选择后,分别选择两种模态的m1和m2特征进行预测。我们的数据表现为 (X1, X2, Y ) = {(x11, x21, y1), · · · , (x1n, x2n, yn), · · · , (x1N , x2N , yN ))}, x1n ∈ Rm1 和 x2n ∈ Rm2 分别是第一模态和第二模态的第n个特征向量;yn ∈ R 是对应的输出值(在我们的研究中,是年龄)。N 是实例数。

2)编码:对于每种模态,我们使用多层感知器神经网络作为其相应编码器 Ei 。编码器的输出称为潜在变量,记作zin,i = 1, 2, n = 1, 2, ·,N。当我们提到与单个数据点相关的项时,索引n将被省略。

3)潜在变量解缠:Ei 生成基于第 i 模态输入特征向量 zi = Ei(第1习)的条件下 zi 。为了更好地学习两种模态的综合信息,应将共享信息与互补信息分开。这里,zi被解分为两部分:Com(zi)和Spec(zi)。Com(zi) 是表示模态间共享信息的共同码,而 Spec(zi) 是表示区分两种模态的互补信息的特定码。解缠的基本要求是:

• Com(zi)和Spec(zi)的连接等于zi;

• Com(z1) 和 Com(z2) 应尽可能相似;

• Spec(z1) 与 Spec(z2) 尽可能区分。

4)交叉重建:对于每种模态,我们采用多层感知器神经网络作为其对应的解码器Gi。传统上,由于 zi = [Com(zi), Spec(zi)] 是 习 的潜在变量,直接要求从 zi 重构 ,这表示原始输入与 Gi (Com(zi), Spec(zi))得到的重构之间的相似性。另一方面,由于Com(zi)是模态间共享的信息,它也应提供重建其他模态的信息。因此,为了进一步提升解缠效果,我们引入了跨模态重建要求:

每个Spec(zi)都被强制重构x_i,连同任一Com(z j), i, j = 1, 2。也就是说,x_i和Gi(Com(z j), Spec(zi))的相似性也被要求。

5)年龄预测:由于每种模态的潜在变量已解开为共同编码Com(Ei (习 ))和特定编码Spec(Ei (x_i)),合并信息形成M(x1, x2),

其中 Common1,2 = ∑2 i=1 ωi Com(Ei (x_i )),μi 决定了两个单峰公共码的合并公共码的比值。在我们的实验中,ω1 = ω2 = 0.5。然后设计多层感知器神经网络作为回归器P,预测婴儿年龄从M(x1, x2)开始。

在我们的方法中,这两种模态分别使用各自的对抗自编码器(AAE)[34]来隔离任何可能的干扰,并在交叉重构要求下采用纠缠以实现信息融合。作为AAE中一个重要元素,多层感知器神经网络被取为共享判别子D,用以对潜在向量zi施加对抗正则化,zi试图区分zi是否遵循预定的先验分布。Ei、Gi、D和P都用权重参数化,并与以下损失一起学习。

6)对抗损失:设p(zi)为对潜在变量施加的先验分布,q(zi |x)为编码分布,p(x |zi)为译码分布。AAE 是一种生成模型,通过训练具有正则化潜空间的自编码器学习数据分布 pd(x),这需要聚合后的后验分布 q(zi ) = ∫ xq(zi |x ) pd (x)dxi 与预定义的先验 p(zi) 匹配。 这种潜空间上的正则化通过判别子D的对抗过程实现,导致一个minEi maxD Li adv问题,其中

编码器确保聚合后的后验分布欺骗判别对抗网络D,使之误以为潜在向量zi来自潜在向量p(zi)的先验分布,而D则试图区分q(zi)和p(zi)。尽管p(zi)可以是一个任意先验,但本研究中对潜变量zi施加了传统的高斯先验分布,即p(zi)= N(zi |μi (x_i),σi (x_i))。[35]中的同样重新参数化技巧也被用于编码器网络的反向传播。由于两种不同模态的潜在变量选择了高斯先验分布,它们共享相同的判别子D。除AAE外,VAE也能对潜变量施加先验分布。VAE利用KL散度惩罚来强制潜在变量的聚合后验来模拟先验分布,而AAE则使用对抗判别器来实现这一点。与VAE相比,AAE在捕获数据流形和施加复杂先验分布且没有精确泛函形式方面可能更胜一筹。AAE在各种应用场景中可能更为通用。因此,在我们的研究中,AAE被选用来对潜变量施加先验分布。

7)共比-特定距离比损失:LDisen 的定义遵循潜变量解缠的基本要求:

8)回归损失:采用L2范数作为回归损失:

9)重建损失:重建损失基于交叉重建要求定义。由于神经影像数据可能不完整,重建损失不会从缺失数据中计算。

10)总体优化目标:最后,优化Ei、Gi、D和P的目标函数写为:

其中λ1、λ2和λ3为权衡参数,Ladv E = ∑2 i=1 Exi ∼pd (x_i) log(1−D(Ei (x_i)))。整个模型及其正则化被称为解缠多模对抗自编码器(DMM-AAE)。DMMAAE 首先更新其判别网络 D,以区分真实样本(使用先验生成)与生成样本(由编码器 Ei 计算的潜在向量)与 LD,然后更新编码器 Ei 、解码器 Gi 和预测器 P,分别为 LE,G,P,I = 1, 2。

缺失模态的数据插补

我们的DMM-AAE也具备应对缺失模态情景的能力。当多模数据不完整时,DMM-AAE可以通过下文所述的嵌入式策略推断缺失的模态。假设某些实例缺少模态M1,Comi 和 Speci 是 Mi 的共同码和特定码,i = 1, 2。Com2 = Com(E2(x2))可以直接用于补值Com1,因为训练的目标是最大化两种模态中获得的共同码之间的相似性。在插补中引入时间指数,作为调整Spec2在Spec1补补中参与度的变量。在训练的早期阶段,Spec2 = Spec(E2(x2))被用作缺失模态的学科特定信息来源,并作为Spec1推算的主要来源。随着训练进行,当模态1的解码器G1,可以生成更可靠的重建数据,Spec2在补值中参与较少。在DMM-AAE的训练中,可以选择时间指数t作为训练历元,并与DMM-AAE的训练历元一起变化,即t0=1,最大Iter等于DMM-AAE的训练历元数。在测试阶段,t0始终被设定为固定值,比如我们实验中的100,而第6步的xˆ1是最终的推算值,无需进一步迭代,即最大I ter = t0。因此,在测试过程中,Spec2只保留一小部分内容,以保留部分学科特定的信息。补值过程如图3所示,算法1也有详细说明。

缺失模态的插补过程。

年龄预测评估

为评估所提DMM-AAE模型的有效性并分析特征的相对重要性,进行了20次嵌套的10折交叉验证。方程(9)中定义的损失函数权衡参数通过最小化内交叉验证得到优化预测的平均绝对误差(MAE)范围为 λ1 ∈ {0.04, 0.05, 0.06}, λ2 ∈ {2, 4} 和 λ3 ∈ {0.02, 0.03}。这些范围是通过实证结果确定的,相关内容可见补充材料。预测结果通过外部交叉验证评估,保持训练阶段对测试数据的盲点。在交叉验证中,针对同一受试者的纵向扫描,我们保证训练数据中的扫描时间比测试数据更早。年龄预测模型通过三个指标评估,即MAE、平均相对绝对误差(MRAE)以及预测年龄与实际年龄之间的相关系数(r)。值得注意的是,MRAE是绝对误差的平均值除以相应的年代年龄,并以百分比表示。对于r,95%置信区间通过自举法获得的2.5百分位和97.5百分位相关系数计算,样本为1000个样本。在计算置信区间r时,20次10重交叉验证也采用了相同的自助样本,该区间保证了自助分析不会偏向任何特定的交叉验证。

年龄预测的特征重要性分析

对年龄预测贡献最大的特征可以被视为婴儿大脑发育的生物标志物。在我们提出的模型中,RF(随机森林)选择特征子集进行预测,过程独立于所选预测变量。因此,特征的重要性分析分为两部分:被RF选择的频率和DMM-AAE神经网络中的置换重要性。

1)通过RF(随机森林)选择频率:作为特征选择方法,RF通过袋外(OOB)估计来估算特征的重要性[33]。为了评估每个变量的重要性,允许在OOB样本中排列变量的值。在RF中,原始样本与受扰外样本在所有树上的准确率差异被取平均,作为重要性估计。在每个折叠中,将训练一个射频模型,并在训练集中估计每个特征的重要性。然后,选择估计重要性高于阈值的特征(在我们的实验中,经过一些实证测试后设定为10⁻6),用于训练DMM-AAE模型,用于该折叠测试数据中的年龄预测。在20次10折交叉验证迭代中,每个特征被选中的频率代表了该特征的相对重要性。如果形态特征和功能连接特征的选择频率分别高于90%和50%,则被视为贡献特征。形态特征和功能连接性特征重要性分析中不同的频率阈值基于它们选择频率分布的不同,如图7(a)所示。

2)置换重要性DMM-AAE:基于训练良好的DMM-AAE模型,置换重要性[36]被用于衡量每个特征对年龄预测的贡献,因其模型无关性而简单。特征f的置换重要性(PI)定义为

其中Errororig和Errorperm是基于原始数据集和新数据集(f值被洗牌)的预测误差(在我们的研究中由MAE评估)。对特征f进行洗牌意味着随机重新组织数据集中f值的顺序,其他特征保持固定。由于该过程破坏了 f 与年龄之间的关系,模型误差的增加表明模型对该特征的依赖性。因此,如果洗牌f的值后会变成P I(f)>1,则该特征是“重要”的。在每个折叠中,每个选定特征的置换重要性通过方程(10)测量测试数据,并重复五次。因此,经过20次10折交叉验证后,每个特征获得了1000个PI值。对1000个PI值实施了单尾单样本t检验,以确定每个特征的平均PI值是否显著大于1。阈值选为 Bonferroni 修正后 p < 0.05(即未校正的 p < 0.05/66780)[37]。

结果

与最先进方法的比较

我们比较了所提出的DMM-AAE模型,采用七种模型无关性、两种基于模型和两种基于AAE的多模态回归方法:1)随机森林(RF(早期)),其中“早期”指早期融合,将sMRI和fMRI特征连接成一个向量作为输入;2)支持向量回归(SVR(早期));3)高斯过程回归(GPR(早期));4)偏最小二乘回归(PLSR(早期));5)PLSR(晚1),其中“晚1”指的是基于PLSR模型的单峰预测年龄被GPR模型融合;6)PLSR(晚2),其中“晚2”指的是基于PLSR模型的单模预测年龄被平均化融合;7)PLSR(混合型),其中“混合型”指的是从PLSR(早期)和PLSR(晚期1)获得的预测年龄与平均机制融合;8)多核学习(MKL)[38],即在学习回归前,分别在sMRI特征和fMRI特征上实现两个不同的核;9)不完全多源融合(iMSF)[39],根据数据源的可用性进行样本划分,并通过稀疏回归学习共享特征集;10)对抗自编码器(AAE(早期)),其中sMRI和fMRI特征作为编码器的输入,潜变量用于年龄预测;11)具有潜在变量融合的对抗自编码器(AAE(晚期)),将单模潜在变量合并进行年龄预测。为了保持比较公平,我们将多模融合和年龄预测整合进一个统一框架中,分别针对早期和晚期,设计时与DMM-AAE相同。缺失模态的值通过零补完成。

我们实验中使用的DMM-AAE架构如图4所示。DMM-AAE采用Pytorch实现,并以固定的学习率0.001通过Adamax优化。批次数量定为150。潜变量的维度为120,而通用代码和特定代码的维度分别设为50和70。潜在空间的维度、共同代码和具体空间代码是基于一些实证测试设定的。这些维度的设置如何影响最终预测准确性,可见补充材料。AAE(早期)和AAE(晚期)在比较公平性上与DMM-AAE共享相同的架构。比较结果总结于表二。图5展示了预测年龄与年代年龄的散点图,基于四种代表性方法:SVR(早期)、AAE(晚期)、MKL和DMM-AAE。模型无关的聚变和传统的基于模型的聚变在年龄预测方面表现相似。九种方法获得的MAE范围为50.9至78.5天;MRAE约为19%至34%;平均相关系数r范围为0.932至0.944。基于AAE的方法显示了性能提升,显示出年龄相关潜在变量学习的益处。我们的模型DMM-AAE表现优于所有基线方法,分别将MAE和MRAE降低至37.6天和11%,同时将95%置信区间r的中点提升至0.964。PLSR的性能因聚变类型而异。PLSR(早期)和PLSR(晚2)之间的MAE相差24.9天。由于“晚2”意味着基于PLSR模型的单模预测年龄被平均融合,可以推断PLSR(晚期2)与PLSR(早期)相比,可能是由于fMRI数据表现差,导致fMRI噪声较高。为了进一步展示详细的预测表现,基于DMM-AAE的MAE及所有竞争方法的评估被划分为不同的年龄段,并见表III。这些方法在不同年龄段表现不同,尤其是在出生后第一年内的年龄段。SVR(早期)在前两年的所有年龄段表现稳定,成为“18∼24M”时期的最佳回归者。除“18∼24M”外,DMM-AAE在所有年龄段的表现总是更优。特别是,我们提出的DMM-AAE在前两个时期的优越性更为明显:“<3M”和“3∼6M”。DMM-AAE分别将“<3M”和“3∼6M”处的MAE缩短为19.1天和20.9天,而其他方法在这两个时间点的平均MAE分别为44.6天和39.3天。可以发现,DMM-AAE获得的预测误差随着时间推移而变大,尤其是在1岁以后的年龄段。这种预测误差模式可能是由于大脑结构发育相对停滞[17],个体变异性较高,且在第二年更易受环境影响,这使得大脑年龄的区分变得更加困难。

多模态与单模态的比较

为分析多模态融合的影响,图6展示了使用单模态(即sMRI或fMRI)和多模态数据(即sMRI+fMRI)不同模型的性能比较。对于多模回归方法PLSR(早期)、PLSR(晚期1)、PLSR(晚期2)和PLSR(混合)等,其对应的单模回归模型相同,即原始单模回归PLSR。DDM-AAE对应的单模回归模型是经典AAE,因为当只有一种模态时,解缠策略、交叉构造损失和共比-特定距离比损失均被禁用。因此,单模回归模态与DDM-AAE、AAE(早期)和AAE(晚期)是相同的。从图6中,仅用sMRI获得的预测MAE大约为42.4∼70.8天,而fMRI数据获得的MAE则高达75.4∼110.7天。在SVR、PLSR(早期)、PLSR(晚期2)、AAE(早期)和AAE(晚期)中,sMRI+fMRI的准确率低于sMRI。即使使用射频(早期)、GPR(早期)、PLSR(晚1)和PLSR(混合),sMRI+fMRI的性能也仅略有提升,相比使用仅提供sMRI数据。研究显示,在传统的多模融合方法中,fMRI数据往往会引入更多噪声而非有用的信号,导致准确率低于单用sMRI数据。使用DMM-AAE时,sMRI数据获得的MAE从42.4天缩短至37.6天。

与插补缺失模态的相关方法比较

插补是一类程序,旨在用估计值填补缺失值。我们通过与以下最先进方法进行比较,验证了我们提出的算法1作为独立补缺方法在缺失模态补全方面的作用:

1)零插补。缺失值用零填充。由于所有特征在插补过程前都归一化为z分数(即减去均值并除以标准差),该方法等价于用观察值的平均值填充缺失特征值。

2)k-最近邻(KNN)插补[40]。缺失值填充k个最近邻样本的加权均值,权重由邻近样本的均方差决定。经过多次实证测试,我们设k=3。

3)迭代SVD [41]。缺失值由一组相互正交的表达式模式通过迭代低秩SVD分解线性组合填充。4)双比例器 [42]。缺失值的补算被视为矩阵补全问题,通过配合核范数正则化矩阵近似和最大边距矩阵分解实现。相关的矩阵分解问题通过快速交替最小二乘算法求解。

在这里,KNN、IterativeSVD 和 BiScaler 都由 Fancyimpute (https://pypi.org/project/fancyimpute/) 以默认参数值实现。在缺失模态之后,补充时,PLSR因其性能优于其他回归算法(如表二所示)而被选为年龄预测方法。通过对数据实施20次十折交叉验证,基于五种补值和PLSR回归的年龄预测比较结果见表IV。我们提出的插补算法优于其他基线方法,进一步证明了解开潜在变量的有效性。

特征重要性分析

图7(a)显示了特征选择频率的分布。对于sMRI特征,其选择频率的平均值接近0.6。然而,功能连接的平均选择频率低至0.02。由于sMRI和fMRI特征是独立选择的,功能连接的低选择频率并非源于sMRI数据的干扰,而是自身的不稳定性。至于图7(b)所示所选特征的置换重要性,结构特征与功能连接特征的PI值分布之间无显著差异。结构特征和功能连接特征的PI值的均值相似且大于1。图8总结了特征的重要性以及从形态学和功能连接性角度对投资回报率贡献最大的因素。关于选择频率,前三种重要的形态特征类型是“皮层厚度”“皮层体积”和“表面积”。结构特征诱导的贡献最大的ROI分布在大脑的双侧。眼窝额叶皮层和颞极的“皮层厚度”以及前额叶皮层和眶额叶皮层的“表面积”被100%选择。尽管功能连接特征的平均选择频率低至0.02,但两条功能连接(一条位于左初级感觉皮层与右下顶叶皮层之间,另一条连接右中扣带皮层与右钡盖)仍以高达90%的频率参与预测年龄。特征的重要性与置换重要性进一步讨论。从形态学角度看,最具贡献的投资回报率是满足以下条件的:1)选择频率高于90%;2)PI > 1的单尾t检验p值在Bonferroni修正后小于0.05。如图8(a)所示,贡献最大的ROI是左侧三叉神经节背区、初级视觉皮层、第二视觉区、右眼窝额叶皮层和左前额叶皮层。从功能角度看,最有贡献的投资回报率和功能连接性特征满足以下要求:1)选择频率高于50%;2)私家侦探> 1.由于所有函数连通性得到的p值在Bonferroni修正后均大于0.05,故未考虑PI >1的单尾t检验的p值。如图8(b)所示,右鹞皮层、右初级感觉皮层、右初级运动皮层和双侧中扣带皮层被发现为最重要的ROI。

图8。功能的重要性。其特征类型中选择频率高于阈值(0.7、0.75、0.80、0.85、0.90和0.95)特征的百分比通过分组直方图显示于(a)。满足以下要求的形态学贡献回报率(ROI)如1)选择频率大于0.90,2)检验“PI>1”的p值小于0.05,均见(a)。满足以下要求的贡献最大的功能连接性和投资回报率(ROI)见(b):1)选择频率大于0.50,2)其置换重要性大于1。为简化起见,子图(b)中的连接性图中,每个脑半球的180个ROI根据地理接近度和功能相似性被分为22个部分[30],其中L和R分别代表左半球和右半球。两个部分之间的功能连通性被测量为相关ROI之间连通性的最大值。

图9。基于t-SNE的可视化:(a)DMM-AAE获得的无年龄预测模块的潜在变量,(b)DMM-AAE获得的潜在变量,以及(c)原始特征集。

讨论

DMM-AAE在不完全多模态神经图像下对婴儿年龄预测的表现

1)潜在变量的解缠解决了fMRI数据可能引入的噪声问题:如图6所示,使用多模数据并不总能保证仅用单模数据时表现优于其他数据。不当融合可能导致性能比仅使用sMRI的模型更差。我们提出的DMM-AAE安排相对独立的自编码器来分离模态,并在交叉重构要求下采用纠缠来整合。通过共同编码构建模态之间的联系和区分它们的特定编码,我们的DMM-AAE方法有效结合信息并限制模态间可能的干扰。

2)根据拟议的损失确保潜在变量的解缠:图10展示了DMM-AAE训练和测试过程中损失在迭代过程中的变化。结果显示,共识相似度损失(共同码之间的距离)减少,而特定相似度损失(特定码之间的距离)按预期增加,这表明两种模态的共同码变得更相似,而它们的特定码在迭代中逐渐区分彼此。这一结果验证了在管理潜在变量解缠过程中,公共比值损失的可行性。随着交叉重建损失的减少,解缠的有效性进一步得到保障。此外,AAE(Late)是DMM-AAE的一种版本,既不包含潜在变量解缠,也不限制共同特异比损失和交叉重建损耗。如表二所示,DMM-AAE优于AAE(Late)的事实证明了潜变量解缠及其结合的新正则化的优越性。

3)多模态神经图像的不完全性通过DMMAAE中嵌入的补值策略很好地处理:由于缺失模态补值算法嵌入DMM-AAE以处理不完整的神经影像数据,进行了比较以证明其有效性。原始数据集被分为完整部分(无模态缺失)和未完整部分(缺失一个模态)。随后,AAE(早期)、AAE(晚期)和DMM-AAE所获得的年龄预测表现被拆分为完整和不完整两部分。记录了这两个数据部分的绝对误差的平均值、标准差和中位数,并对20次10折交叉验证进行了平均值。比较结果见表V。对于早期和晚期的AAE,不完整数据的MAE比完整数据大四天。然而,DMMAAE 对不完整数据的表现同样重要,有时甚至比完整数据更好,后者验证了DMM-AAE中嵌入的补补策略很好地处理了缺失的模态问题。为了进一步分析基于DMM-AAE的推算数据,我们通过随机删除5%的sMRI生成了合成数据集。表VI中报告了五次十折交叉验证所得特征与推值特征之间的MRAE和RMSE(均方根误差)。结果显示,DMM-AAE仍然优于其他四种最先进的缺失数据补值方法。 4)年龄相关潜在变量通过年龄预测与潜在变量学习的整合来学习:作为一种流行的无监督、非线性高维数据可视化技术,t分布随机邻居嵌入(t-SNE)[43]直观地展示了数据在高维空间中的排列情况及其是否良好分离。在我们的研究中,由于多模态神经影像数据融合和年龄预测已被整合进一个统一框架,我们使用t-SNE来评估DMM-AAE获得的潜在变量是否与年龄相关。DMM-AAE或无年龄预测模块的DMM-AAE获得的原始数据和潜在变量通过t-SNE可视化(初始化=PCA,随机状态=500,困惑度=5),如图9所示。没有年龄预测模块的DMM-AAE意味着预测变量被排除在基本模型之外,因此年龄回归损失从DMM-AAE的全部目标中被移除。它表明,DMM-AAE获得的潜变量按年龄排列得当,而DMM-AAE未嵌入年龄预测的潜变量在图中分散且完全无年龄相关性。因此,DMMAAE 实现了在统一框架中学习年龄相关潜在变量,并有潜力提供年龄相关脑发育指数。

早期脑发育的重要生物标志物

1)皮层厚度被识别为脑发育的重要生物标志物:皮层厚度被确定为大脑发育的重要生物标志物:预测模型包含六种形态特征(LGI、平均凸性、平均曲率、皮层厚度、表面积和皮层体积),而皮层厚度作为年龄预测中选择频率最高的预测因子。由于某一位置大脑皮层的厚度很可能反映了皮层神经元的组织结构,而不仅仅是指笛卡尔搜索空间内灰质组织的密度,皮层厚度可能比其他指标更能揭示大脑结构与智力[44]、正常发育、衰老和脑部疾病[45]的关系。我们的结果进一步支持皮层厚度在脑发育监测中的优越性。

2)发现重要的投资回报和功能连接可能揭示出生后头两年的大脑发育模式:在年龄预测中,早期视觉皮层(皮层厚度)的重要性揭示了其区分大脑发育状态的能力,这与角皮层皮层厚度相对分布的显著变化相符(从出生时较厚的区域转变为相对薄的区域)1岁时)和舌回(从出生时较厚的区域转变为1岁时的无显著区域)[46]。与形态学相关的贡献最大的ROI分布在大脑的双侧,而向右不对称则表现在功能连接相关的贡献最大者中。这一事实可能表明,差异在于大脑早期的结构和功能发育轨迹。此外,主要功能区与高阶功能区之间连接的重要性可能意味着这些区域之间日益高效的连接在前两年将得到显著加强。

局限性和未来展望

尽管AAE已被验证为多模态神经影像融合的有效模型,但一些流行的自编码器类型,如变分自编码器(VAE),可能对我们的研究有用。尤其是基于VAE模型的解缠表示学习[47],试图区分对不同生成因素变化敏感的潜在单元,具有极大潜力扩展我们当前的研究。此外,不同的脑部结构、不同sMRI特征(如皮层髓鞘形成、T1白灰对比)、不同功能特征(如低频波动幅度、区域均质性)以及更多模式(如扩散MRI)都可以考虑提升婴儿年龄预测的准确性。此外,我们提出的DMM-AAE主要框架聚焦于两种模态的融合。虽然将通用代码和特定代码的概念推广到三种或更多模态并不难,但我们未来的工作中应进行更具体的设计。最后,嵌入式特征选择方法未来也将被研究,因为它同时整合了建模与特征选择,并且特征选择与模型归纳之间有更好的协调。

总结

本文提出了一种解缠多模态对抗自编码器,以解决基于多模态神经影像的婴儿年龄预测中信息融合效果不佳的问题。结合交叉重建和共比比调控,引入了潜变量解缠策略,利用多种模态之间的相关性,避免模态纠缠产生的噪声。结合sMRI和fMRI数据,实验结果验证了我们模型相对于多种心态方法的优越性。我们提出的DMM-AAE作为多模态数据预测的有前景模型,并有望研究正常与异常大脑发育。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询