Nature Microbiology|MetaCAT实现宏基因组高质量微生物基因组重建及结直肠癌宿主性状关联
2026/9/14 21:40:18 网站建设 项目流程

摘要

从宏基因组鸟枪测序数据中恢复高质量(high-quality, HQ)微生物基因组,是准确刻画微生物群落并解析其与宿主性状关系的核心前提。现有分箱(binning)方法在准确性与可扩展性方面常受限制。作者提出MetaCAT(Metagenome Clustering and Association Tool),该框架集成了从宏基因组数据恢复微生物基因组及其与宿主性状关联分析的全流程。MetaCAT采用稀疏加权狄利克雷过程高斯混合模型(Sparse Weighted Dirichlet Process Gaussian Mixture Model, SWDPGMM),联合k-mer频率与测序覆盖度进行高效分解,并引入序列长度信息优化参数估计;同时提供微生物单核苷酸多态性(single-nucleotide polymorphism, SNP)识别与宏基因组全关联分析(metagenome-wide association study, MWAS)专用工作流。在多项基准数据集上,MetaCAT在分箱精度与计算效率方面均优于现有方法。基于结直肠癌(colorectal cancer, CRC)队列的宏基因组数据,MetaCAT发现了既往未被识别的标记物种及与CRC显著相关的微生物SNP。该工具为微生物群落规模化 profiling 与宿主—微生物互作研究提供了可扩展的分析平台。

Keywords:宏基因组分箱;高质量微生物基因组;SWDPGMM;k-mer频率;测序覆盖度;微生物SNP;宏基因组全关联分析;结直肠癌


文献信息

  • Liu, C.-C., Dong, S.-S., Guo, J., Xu, Z., Wang, C., Li, Y.-X., Meng, L.-L., Yang, X.-C., Li, M., Fu, K., Guo, Y., & Yang, T.-L. (2026). MetaCAT enables reconstruction of high-quality microbial genomes and their association with host traits from metagenomic data.Nature Microbiology. https://doi.org/10.1038/s41564-026-02472-7
  • 收稿:2025年5月21日;接受:2026年7月31日;在线发表:2026年9月1日
  • 期刊:Nature MicrobiologyIF=18.7,JCR Q1,中科院生物学/微生物学1区Top)
  • 代码:https://github.com/liu-congcong/MetaCAT

研究总结

MetaCAT宏基因组基因组重建与关联分析

方法框架

核心分箱模块SWDPGMM

单拷贝基因种子半监督聚类

kmer与覆盖度稀疏亲和图

代表基因组与丰度模块

微生物SNP识别模块

MWAS宿主性状关联模块

主要结果

CAMI模拟数据重建近完整与高质量基因组领先

大样本IMG环境数据效率与覆盖率优势

结直肠癌队列重建两万余高质量基因组

鉴定135个丰度差异物种及共现网络

MWAS发现98个CRC相关微生物SNP

独立队列复现91个SNP及非同义功能位点


背景介绍

宏基因组鸟枪测序广泛用于解析微生物群落组成、功能潜能及其与宿主健康状态的关联。从组装片段中恢复基因组,可提供分类学、相对丰度与微生物遗传变异信息,并进一步支撑宿主表型关联分析。尽管组装算法持续发展,但从复杂样本中获得完整、低污染的高质量基因组仍具挑战:组装产物常碎片化为大量短序列,需要通过分箱将同源序列聚合为基因组。

CONCOCT、MetaBAT2、VAMB、Binny、SemiBin2、COMEBin、TaxVAMB及MetaDecoder等方法主要依赖k-mer频率与覆盖度特征。多数方法以固定或按样本数设定的权重融合两类特征,未充分考虑序列自身签名及长度对特征方差的影响;同时,序列长度信息未被系统利用,可能导致短序列在k-mer频率与覆盖度空间中估计不稳定。另一方面,微生物SNP与宿主性状的MWAS已被证明可补充物种丰度分析,但现有分箱流程缺乏从基因组重建、SNP判读到宿主关联的一体化方案。

针对上述瓶颈,作者构建MetaCAT。其核心分箱模块以SWDPGMM对复杂数据集进行概率分解,利用单拷贝基因(single-copy genes, SCG)种子估计基因组数量K,基于k-mer与覆盖度构建多组稀疏亲和图并进行半监督标签传播;对大规模数据先用子集初始化SWDPGMM再全量聚类。下游集成代表基因组筛选、相对丰度分析、SNP calling与MWAS,形成从序列到宿主关联的闭环。


重要结果

结果1:MetaCAT框架与五模块工作流

MetaCAT由五个模块构成。核心分箱模块首先依据SCG种子估计K,构建基于k-mer与覆盖度的多组稀疏亲和图;在各图上以标签传播获得种子划分,采用SCG评分模型选择最优权重与分区。对K≥200或序列数n≥500,000的数据集,以最优分区初始化SWDPGMM,先用≥2 kb序列子集拟合,收敛后载入全量序列;对K<200且n<500,000的数据集,则直接以最优权重建构稀疏序列亲和图并传播标签。分箱输出进入代表基因组选择模块,基于分类与两两相似度确定研究目录;丰度模块估计各样本代表基因组相对丰度并筛选差异物种;SNP模块对各样本进行基因型调用;关联模块以回归模型检验微生物SNP与宿主表型关联。

Figure 1 图例:展示MetaCAT总体框架。图1a与1b为核心分箱模块,含SCG种子选择、稀疏亲和图构建、半监督划分与SWDPGMM全量聚类;图1c为代表基因组选择,基于分类与基因组相似度输出目录;图1d为丰度分析,估计相对丰度并识别标记物种;图1e为微生物SNP调用流程;图1f为MWAS流程,将微生物基因型与宿主表型关联。


结果2:基准模拟数据集上近完整与高质量基因组恢复优势

在CAMI基准的九套复杂数据集(包括气道、胃肠、高复杂度、海洋、口腔、植物相关、高菌株多样性、皮肤、泌尿生殖等)上,MetaCAT共恢复1,684个近完整(near-complete, NC)基因组与1,979个高质量(HQ)基因组,优于COMEBin(1,521 NC、1,843 HQ)与Binny(1,389 NC、1,739 HQ),也高于TaxVAMB、SemiBin2、MetaDecoder、VAMB、MetaBAT2与CONCOCT。八套数据集中MetaCAT的NC与HQ数量均最高;植物相关数据集因植物与真菌污染较重,TaxVAMB recluster的NC(89)与HQ(99)高于MetaCAT(63 NC、75 HQ),但剔除短序列后MetaCAT可获85 NC、102 HQ。以NC召回≥0.95计,MetaCAT预测的1,684个NC中有1,548个达标,超过COMEBin全部1,521个NC总量。

Figure 2 图例:图2a与2b按数据集汇总各方法恢复的NC与HQ基因组数量;图2c以COMEBin为参照展示MetaCAT在NC召回阈值下的增量;图2d与2e为CAMI气道数据集运行时间与上机资源对比,MetaCAT在GPU配置下完成聚类耗时最短,峰值内存低于多数深度学习或大模型分箱方法。


结果3:大样本真实环境数据集的效率与覆盖度

在IMG真实环境数据集上,以CheckM2评估完整度与污染度。采用HQ阈值(precision≥0.90、recall≥0.70)时,MetaCAT恢复8,993个HQ基因组;NC阈值(precision≥0.95、recall≥0.90)下获5,291个NC,高于COMEBin的5,141个,较SemiBin2(4,173)与MetaDecoder(4,036)分别提升26.79%与31.10%;完整度阈值提高至0.95后,MetaCAT获3,804个,仍较COMEBin(3,710)多94个。按生态系统划分,MetaCAT在生物反应器、模拟、植物、陆地与废水五类中NC表现最佳,在 aquatic 与真菌类中次于COMEBin。IMG平台上COMEBin近三个月完成全部分析,MetaCAT不到10小时完成。8,993个HQ基因组中109个细菌/古菌门、2,016个属可接受注释,但68.99%的HQ基因组无物种级解析;5,291个NC中仅1,333个达物种级、对应505个物种,74.81%缺物种注释,提示环境微生物未知多样性仍大量存在。

Figure 3 图例:图3a与3b分别为NC与HQ阈值下各方法在IMG数据的基因组恢复数量;图3c以Mash距离比较MetaCAT与其他方法重叠基因组的质量分层,按污染与完整度分为G1、G2、G3组;图3d展示5,291个NC基因组的门级分类构成,突出大量未定名或未达物种级基因组。


结果4:结直肠癌队列高质量基因组目录与差异物种

作者整合5个CRC宏基因组队列共715人,包括293例CRC、89例腺瘤与333例健康对照(CTR)。MetaCAT共恢复21,836个HQ基因组,涵盖19个细菌/古菌门;其中21,833个归入538属、21,683个归入1,548种。以GTDB-Tk注释后,按物种取最高评分基因组为代表,再从未分类基因组中以Mash距离>0.05迭代补充83个,最终形成1,631个代表基因组,平均完整度93.90±7.40%、污染1.57±1.91%。门级组成以Bacillota复合支系(含Bacillota、Bacillota_A/B/C)占60.94%为主,Bacteroidota占17.04%,Actinomycetota占10.79%。物种丰富度在CTR与CRC间无显著差异(P=5.27×10-1),但多样性在CRC组轻度下降(P=7.50×10-3);Bray–Curtis NMDS与PERMANOVA显示两组群落结构显著分离(P=9.99×10^-4)。差异分析共获135个显著物种,其中20个在CRC富集、115个耗减(Bonferroni P≤0.05)。Lachnospiraceae多数物种耗减,Clostridium_Q symbiosum与Enterocloster bolteae富集;Faecalibacterium尤其F. prausnitzii亚种耗减;Escherichia coli与Bacteroides fragilis等富集。共现网络显示CRC组20个富集物种的节点度均高于CTR(符号检验P=1.91×10^-6)。

Figure 4 图例:图4a为1,631个代表基因组完整度与污染度分布;图4b为门级组成比例;图4c与4d分别为物种丰富度与多样性在CTR/CRC间比较;图4e为NMDS群落结构投影;图4f与4g为CRC和CTR组中135个差异物种的SparCC共现网络,蓝节点为CRC富集、橙节点为耗减,红/蓝边分别表示正/负相关性。


结果5:微生物SNP与结直肠癌MWAS及独立复现

对715个样本比对至1,631个代表基因组,按位点主要等位基因频率定义个体基因型。全群体共识别9,361,554个SNP,经CTR/CRC覆盖阈值过滤后保留5,942,411个进入关联分析。 logistic回归以相对丰度、年龄、性别、体质指数为协变量,并基于个体间SNP遗传距离矩阵取前5个主成分校正人群分层。结果发现98个SNP分布于6个细菌物种,达到Bonferroni校正显著(P≤0.05对应阈值8.41×10^-9);其中4个物种在物种丰度上无显著组间差异,说明SNP层面可补充丰度分析未捕获的关联。独立复现队列166人(76 CRC、84 CTR、6其他)中,除1个未达覆盖阈值的SNP外,97个方向一致,91个P≤0.05复现。功能注释锁定11个位于已知蛋白编码区的SNP,包括Clostridium_Q symbiosum葡聚结合蛋白(glucan-binding protein, GBP)非同义SNP(I37V,P=9.39×10^-10)与Roseburia hominis IS110转座酶非同义SNP(V219I,P=6.18×10^-11)。GBP变异可能影响β-葡聚识别与膳食多糖响应,IS110转座酶变异可能涉及基因组重排、耐药或肠道适应。

Figure 5 图例:图5a为SNP遗传距离矩阵主成分投影,区分中外CRC队列人群结构;图5b为MWAS QQ图;图5c为曼哈顿图,按代表基因组坐标展示SNP关联强度,红虚线为Bonferroni阈值;图5d为发现与复现队列效应量一致性;图5e按基因型区间展示CRC比例;图5f与5g分别比较GBP与IS110转座酶非同义SNP主要等位基因型对应的物种相对丰度在CTR/CRC间差异。


方法学参考

大规模

小规模

宏基因组组装片段

长度过滤与特征提取

kmer四核苷酸频率维度压缩PCA

多样本覆盖度均值方差

单拷贝基因种子识别

构建多权重稀疏亲和图

kmer概率模型长度相关权重

覆盖度Bhattacharyya系数

标签传播半监督种子分区

SCG评分选最优权重与K

K与序列规模判断

SWDPGMM子集初始化全量聚类

稀疏图全量标签传播

质量评估完整度污染度

代表基因组筛选与GTDB注释

相对丰度与差异物种检验

reads比对代表基因组SNP调用

主要等位频率基因型矩阵

遗传距离矩阵主成分校正

logistic回归MWAS与复现验证

可供参考的关键方法:第一,SWDPGMM以序列长度wi作为高斯协方差缩放因子,理论上将单位长度序列均值建模为同高斯分布,长序列估计方差按1/wi缩减,可缓解短序列k-mer与覆盖度不稳定;第二,k-mer模型采用四核苷酸、按序列长度对回归估计权重,覆盖度相似度采用有界对称的Bhattacharyya系数而非非对称KL散度;第三,SCG种子集合扩充至120个(细菌65、古菌16特化、39共享),以HMMER比对Pfam,结合出现频率阈值筛选,提高K估计鲁棒性;第四,亲和图仅保留每节点前10高权边,多权重0.10–0.90网格搜索并由SCG评分选优;第五,MWAS以连续主要等位频率替代二倍体0/1/2基因型,以SNP遗传距离前5主成分校正人群分层,适合微生物非固定倍性场景。


总结

MetaCAT针对宏基因组分箱准确性、计算效率与微生物遗传变异关联三重问题,提供了统一框架。分箱层面,SWDPGMM结合k-mer与覆盖度、引入长度加权与SCG半监督初始化,在CAMI模拟与IMG真实环境中均实现NC/HQ恢复数量领先;在CAMI气道等数据上较COMEBin、SemiBin2、TaxVAMB显著降低运行时间,并在大样本IMG分析中以不到10小时替代近三个月的COMEBin流程。环境应用显示,大量HQ与NC基因组缺乏物种级注释,说明未知微生物多样性仍需高效分箱工具支撑。

在CRC应用中,MetaCAT从715个样本恢复两万余HQ基因组与1,631个代表基因组,差异物种分析重现Lachnospiraceae与Faecalibacterium耗减、E. coli与B. fragilis富集等已知信号;MWAS进一步发现98个CRC相关微生物SNP,其中GBP与IS110转座酶非同义SNP具有明确功能解释,且91个在独立队列复现。结果说明物种丰度差异与菌株内SNP分别提供互补信息,丰度未变物种仍可能通过遗传变异参与宿主表型。

该框架的局限在于未设专门非微生物污染剔除模块,高植物/真菌污染数据需预过滤或提高最短长度;未来可将分类引导、污染识别与更精细的人群混杂校正纳入分箱—关联一体化流程。总体而言,MetaCAT为环境宏基因组目录构建与临床微生物组遗传关联研究提供了可扩展、可复现的方法学基础。


参考文献

  1. Liu, C.-C., Dong, S.-S., Guo, J., Xu, Z., Wang, C., Li, Y.-X., Meng, L.-L., Yang, X.-C., Li, M., Fu, K., Guo, Y., & Yang, T.-L. (2026). MetaCAT enables reconstruction of high-quality microbial genomes and their association with host traits from metagenomic data.Nature Microbiology. https://doi.org/10.1038/s41564-026-02472-7
  2. CAMI基准数据:https://data.cami-challenge.org/participate
  3. IMG数据:https://img.jgi.doe.gov
  4. CRC原始宏数据:ENA项目PRJEB10878、PRJEB27928、PRJEB6070、PRJEB7774;SRA项目PRJNA429097;NODE项目OEP001340
  5. MetaCAT代码与处理后数据:https://github.com/liu-congcong/MetaCAT
  6. Nature Microbiology期刊主页:https://www.nature.com/nmicrobiol/(2026 IF=18.7,JCR Q1)

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询