猪T2T基因组组装:从端粒到端粒的完整图谱与育种应用
2026/9/9 8:56:43 网站建设 项目流程

最近圈子里都在传这篇猪T2T基因组组装的高引论文,张龙超、王金勇、刘娣、李明洲、印遇龙、王立贤等几个团队联合,率先把猪的T2T基因组做了出来,发在iMeta上。做基因组组装的人应该都清楚,T2T全称是Telomere-to-Telomere,意思是一条染色体从端粒到端粒,中间一个碱基都不缺,完整地拼出来。这个标准在人和模式生物上用了二十多年才刚跑通,而猪作为农业动物也做到了,这背后不只是测序平台升级这么简单,还意味着T2T组装正在从“技术炫技”变成“服务育种的应用工具”。这篇文章,咱们就围绕这个标题拆一拆:T2T到底难在哪,猪的T2T为什么有特殊价值,以及如果你自己也想做类似工作,实操层面该怎么入手、怎么避坑。

1. 从标题看门道:这不是一篇普通的高引论文

1.1 作者团队的特殊组合说明什么

细看作者名单你会发现一个很有意思的现象:张龙超、王金勇、刘娣、李明洲、印遇龙、王立贤,这些人都是猪遗传育种和动物科学领域里的重量级学者,但严格来说,他们不全是以基因组学算法开发出身的纯生信团队。过去T2T组装这种事情,基本是专门做基因组学和生物信息学的团队在推进,育种家更多是等结果、用结果。现在一线育种团队直接牵头,把T2T组装当成自己研究体系的一部分来做,说明这套技术已经不只存在于方法学论文里,而是开始真正进入猪遗传改良的日常工具箱。

育种专家亲自操盘还有一个纯生信团队替代不了的优势:他们非常清楚什么样的样本代表性强、什么样的性状位点对产业重要、组装结果最终要回答哪些生物学问题。联合团队内部各司其职,测序和组装的人负责把技术路线跑通,育种团队负责定义应用场景和验证方向,这种搭配和国内团队这几年做大型基因组项目的成熟打法高度一致。也从侧面说明,T2T基因组不是拿来发一篇论文就完事的展示品,而是后续大量功能研究和育种应用的地基。

1.2 为什么偏偏是iMeta这本期刊

iMeta是2022年创刊的一本新刊,主打微生物组、生物信息学、多组学等交叉方向,但它并不局限于传统基因组学领域的框架,更强调方法创新、数据资源和流程的可复用性。一个重要的T2T基因组选择放在iMeta,实际是在传递一种信号:这项工作的意义不只是“我们又多了一个物种的完整基因组”,而是希望把数据、方法流程和验证体系变成整个行业都能参考、复用的公共资源。

这个定位很关键。同样一个重磅基因组数据,如果放在传统期刊上,很多时候停留在“我们发了数据”这个层面,审稿人和读者更关心结论;但放在强调方法交流和可复现性的平台上,大家会更关注数据怎么用、流程怎么跑、质控怎么定。尤其对下游做育种和功能基因组研究的团队来说,他们最需要的不是一个新闻标题,而是一套可以照着做的操作手册。国内基因组学研究这些年已经从“把序列测出来”进化到“让同行能把数据直接拿去用”,这个趋势本身就是研究范式成熟的信号。

2. T2T到底难在哪:从碎片化参考基因组到零Gap

2.1 过去参考基因组卡在什么地方

以前用二代测序做参考基因组,读长只有150bp左右。基因组里恰恰有很多区域是由长片段重复序列组成的:着丝粒附近有大量卫星DNA,rDNA区域有几百个拷贝串联排列,端粒则是TTAGGG这个六碱基重复成千上万次。这些区域里的具体碱基组成几乎一样,短读长产生之后,组装算法根本没法判断这一段应该放在哪里、后面的重复单元顺序是什么,结果就是拼接中断,产生一个个gap,最终组装出来的序列里全是大段的未知碱基N。

三代测序的早期版本解决了部分问题,PacBio的第一代长读长可以跨过一些重复区域,但单碱基错误率偏高,组装完的结构里还是有不少错误。真正的T2T阶段,是把“全基因组没有N”当作硬指标,这意味着两个前提必须同时满足:读长要足够长,能把整段重复区域覆盖住;准确性要足够高,否则最后一步想修正都不知道该以谁为准。人类参考基因组从2001年的工作草图走到2022年的完整T2T版本,用了二十多年;猪能在这个技术成熟后的窗口期直接补课到位,这本身就是方法迭代加速度的一种体现。

2.2 T2T的技术底座:HiFi和超长读长缺一不可

现在做哺乳动物级别的T2T组装,标配是两种长读长数据:PacBio HiFi和Oxford Nanopore的Ultra-long超长读长。这两者各有分工,缺一不可。

HiFi的本质是把同一段DNA多次测序后做一致性纠错,单条读长大概在10到25kb之间,读长不算极致,但准确性很高,通常能做到99.9%以上。它解决的核心问题是“这段序列的碱基到底是什么”,也就是说,能把重复区域里每一个字母都尽量读准。ONT超长读长的优势在长度,经常能出100kb以上、偶尔到Mb级别的read,读长越长,跨越重复区段的概率就越大,组装图里就越容易把重复单元之间的连接关系理清楚。它的缺点也很明显,单条read错误率偏高,所以实践中不会单独用ONT做最终结果,而是把ONT和HiFi组合起来,HiFi提供准确的碱基序列,ONT负责搭骨架、跨重复。

这条技术路线的底层逻辑,可以理解成拼拼图和搭桥的关系。HiFi像是一块块印刷清晰的小拼图,你知道每块的图案,但拼到长段完全相同的区域时会迷茫;ONT像是一座座可以架得很远的桥,先靠这些桥把大结构固定住,再用HiFi把桥之间的细节填满。两者结合,才有可能把以前硬啃不下来的高重复区域真正闭合。

2.3 猪基因组组装难上加难的三重挑战

有人可能会问,人类T2T都做完了,照着人类的路子做猪不就行了吗?实际没那么简单。猪虽然不是最难组装的物种,但比人类T2T多了好几重额外的麻烦。

第一重是基因组结构和染色体数的差异。家猪是二倍体,染色体数2n=38,也就是有19对常染色体再加X和Y。每条染色体的两端都要拿到完整的端粒序列,每条着丝粒区域都要完整重建,逐条染色体检查工作量很大。

第二重是样本杂合度。人类T2T项目选择了CHM13细胞系,这个细胞系的背景几乎完全纯合,等于用了“几乎只有一个模板”的样本,组装器可以安心拼一条单倍型。猪是常规繁殖动物,如果随便取一头商品猪,父母来源不同,基因组杂合度会很高,组装器在遇到杂合区域时容易分不清该保留哪条单倍型,搞不好就拼出一堆冗余的“双份”序列。所以实际做猪T2T时,样本选择极其关键,通常会优先考虑高度近交的个体、封闭群个体或细胞系,从源头降低组装难度。

第三重是应用导向的压力。猪的许多经济性状相关基因,比如生长、肉质、抗病相关候选区域,有些恰好落在结构变异高发的复杂区段。这些区域在旧参考基因组里几乎是一团乱麻,只有T2T级别的完整序列才能把调控元件、转座子插入位置、结构变异边界全部摊开来看。所以这个项目由育种专家牵头不是偶然,因为最终要回答的,就是这些复杂区段跟生产性状之间的因果关系。

3. 猪有了T2T,能解决哪些真问题

3.1 育种视角:从群体关联到功能位点

以前做全基因组关联分析,主要靠SNP芯片或全基因组重测序数据。测序数据拿到手之后,第一步是跟参考基因组比对,短读段在重复区域和结构变异区域是比对不上或者比对得模棱两可的。也就是说,过去很长一段时间里,GWAS实际上是在“能看见的地方”找信号,基因组里那些最复杂的区域一直是盲区。很多跟重要经济性状真正相关的功能变异,因为处在重复或高度多态的区域,被系统地漏掉了。

T2T参考基因组把每条染色体从头到尾完整铺开之后,局面就不一样了。结构变异、转座子插入、串联重复的拷贝数差异,都有可能被系统检测到。猪的选育工作关注的肉质、繁殖力、抗病性这些复杂性状,背后往往就是多个结构变异和调控序列在起作用。有了完整参考,育种家可以更直接地定位因果突变,把标记从“跟因果位点连锁的替代标记”升级成“因果变异本身”。这对基因组分型芯片的设计也有直接帮助,芯片上的探针可以优先放在高度可信、有功能注释的序列附近,减少无效位点,提高分型效率。

3.2 医学模型视角:猪为什么是特殊存在

猪不光是餐桌上的经济动物,也是生物医学研究里很特殊的模型。它和人类在心血管、皮肤、消化代谢等系统的解剖和生理上有不少相似之处,器官大小也接近人类,所以异种移植、代谢疾病、创伤修复这些领域一直有人拿猪做实验。异种移植这几年讨论热度尤其高,因为器官短缺问题现实存在,而猪被认为是最有可能的供体来源之一。但异种移植面对的,不光是免疫排斥一个难题,还有一个底层问题:猪基因组里那些内源性逆转录病毒位点到底分布在哪些位置,侧翼序列是什么,哪些可以被基因编辑安全地清除或者失活。这往深了说,就需要用到完整基因组层面的信息。

另外,做基因编辑时设计gRNA,要评估脱靶风险。如果参考基因组里存在大量N或者错误组装,脱靶预测的结果就不够可靠。T2T级参考基因组把端粒、着丝粒、重复区都补全了,等于给基因编辑和后续的模型猪构建提供了一张更准确的底图,sgRNA的脱靶评估、编辑位点的选择,都会比旧参考基因组时代扎实得多。

3.3 方法论扩散:其他物种的T2T路线图

这些团队把猪T2T做出来,影响不会只停留在猪这一个物种上。从方法学的角度看,它验证了一个关键问题:大型家养动物的基因组,也能达到人类参考基因组级别的完整度。牛、羊、鸡等经济动物同样有复杂重复区域难以组装的痛点,也都有各自的经济性状问题和医学模型需求。猪T2T组装过程中积累的样本处理方案、HiFi与ONT数据比例、组装参数、质控流程,完全可以变成一套复用的路线图。

国内多个团队合作推进大型基因组项目,这几年的趋势越来越明显:测序平台提供数据支持,高校和科研院所负责方案设计和深度分析,育种团队负责功能验证和产业转化。这种模式的价值在于把技术门槛持续压低。将来如果有一个新物种想做T2T,不需要再从零开始试错,直接参考猪或者人类的成熟流程,结合自身基因组特点调参就行。整个领域的起点,会因为前面有人把路蹚出来了而大大提高。

4. 想复现这类工作?实操层面的关键环节

4.1 样本与建库:成败常常在测序之前

做基因组项目,最容易出问题也最容易被低估的环节,就是样本和DNA准备。T2T对DNA分子量的要求比普通基因组项目高得多。如果你用常规酚氯仿抽提或者某些柱式提取试剂盒,能得到浓度不错的DNA,但大片段已经被打断,后续ONT超长读长根本没有用武之地。读长再好的测序平台,也架不住进样的是碎成小片段的DNA。

实际操作中,我建议优先用低熔点琼脂糖包埋法来处理新鲜组织、血液或细胞,这种方法对DNA片段的保护效果公认比较好;也可以用专门的HMW DNA提取试剂盒。DNA提完之后,一定要跑脉冲场电泳或者等效的方法确认大片段完整性,别只看Qubit浓度就觉得万事大吉。另外有一点需要特别提醒:反复冻融的样品、保存时间过长的组织或血液,对DNA是不可逆的损伤。拿到样本后尽快处理,比用任何后续技巧都更有效。再有就是样本本身的纯合度,如果实验设计允许,尽量选近交系、封闭群个体或细胞系,这一步能从源头上把组装难度降下一大截。

4.2 组装流程与参数选择的经验值

样本条件准备好之后,下一步就是测序策略。我见过的常见设置是:PacBio HiFi覆盖度30到50x,ONT超长读长覆盖度20到30x,有的项目会再加一些Hi-C数据,用于辅助染色体级别的排序和验证。覆盖度太低不行,尤其ONT就算读长能做得很长,整体覆盖度不够的话,重复区域的桥接信息还是不够;覆盖度太高也不是越爽越好,因为计算成本和时间会明显上升,边际收益却逐步下降。

软件选择方面,hifiasm是目前比较主流的选择,近几年的版本提供了T2T模式。一个基础命令大概长这样:

hifiasm -t 64 --t2t -o pig_t2t hifi_reads.fastq.gz ont_reads.fastq.gz

这条命令会把HiFi和ONT数据同时交给hifiasm,跑完后在输出目录里找primary contig文件。如果对流程熟悉,也可以尝试verkko,它更侧重于利用ONT超长读长和HiFi自动构建二倍体分辨率的T2T组装,只是对计算资源的要求往往更激进。用哪个工具看个人习惯,我更关心的是组装完成之后的polish环节。hifiasm的输出已经很准,但根据我的经验,额外做一轮基于HiFi数据的polish仍然值得,常见用NextPolish或者其他一致性校正工具。这一步能够显著降低小插入缺失错误,对后续基因注释和变异检测都有直接好处,花费的时间成本完全划算。

4.3 质检指标怎么看:别只盯着N50

常规基因组项目里,大家习惯看N50。但在T2T项目里,如果组装真的做到了完整,contig的N50可能直接等于或者接近染色体长度,这时候N50反而失去了区分度,必须换一套评估思路。

我一般按优先级看这几项:第一,序列里剩余的gap数,也就是N的数量,理想值是0;第二,端粒序列检出数量,哺乳动物端粒通常是TTAGGG重复,完整T2T应该在几乎所有染色体两端都能检出端粒信号;第三,着丝粒区域的重建情况,如果能识别出物种特异的卫星DNA或者相关motif,并且看到它们出现在每条染色体预期的位置上,说明最难啃的区域真的啃下来了;第四,BUSCO完整率,哺乳动物级别的T2T通常要做到97%以上,越接近100%越好;第五,QV值,代表单碱基准确度,通常希望大于50。这五项都达标了,才敢放心地说这是个能用于下游生物学分析的基因组资源。

5. 易踩的坑与排查经验

5.1 污染源与重复序列干扰

组装过程中,最坑的一类问题就是污染。如果样本里混入细菌、真菌或者培养细胞里其他物种的DNA,组装时会多出很多来源不明的小contig;线粒体DNA还会在核基因组里形成核线粒体片段,也就是NUMT,干扰判断。更麻烦的是,污染序列有时长得跟目标序列很像,比如某些共生菌的GC含量和重复特征跟宿主接近,自动化流程根本分不出来。

处理思路分两步:组装前,用k-mer分布做一次初筛,如果发现明显异常的深度峰,就要警惕污染或者样本混匀问题;组装后,再做一次物种来源检查,把明显异源的contig挑出来,必要时直接重新建库测序。宁可多花一周时间把样本条件理清楚,也不要带着污染数据硬跑,因为后续所有分析都会在错误的地基上叠加错误。

5.2 常见问题速查表

问题表现可能原因排查建议
组装结果里大量小contig样本污染或异源DNA混入先做k-mer和blast分类学检查,确认后重新建库
ONT读长明显偏短DNA片段化严重或文库制备问题检查HMW DNA完整性,必要时重新提取DNA
HiFi和ONT结果互相冲突样本杂合度高或混样检查样本来源,优先提高纯合度,或考虑分单倍型组装
着丝粒区域始终拼不上覆盖度不足或重复单元太长增加ONT超长读长覆盖度,尝试调整hifiasm参数
BUSCO完整率差组装错误或polish不足检查单碱基错误,补做一轮基于HiFi的polish
端粒信号数远低于预期存在未闭合的染色体末端确认是否漏掉末端数据,考虑补测超长读长

5.3 计算资源的开销评估

猪这个基因组规模,做T2T组装的算力开销不算小。32核以下的小机器基本不用考虑直接跑,起步建议是64线程以上、256到512GB内存的服务器,ONT数据量大的时候内存峰值还可能更高。跑一个完整流程,从HMW DNA提取、建库、测序等待,到组装、polish、质控,顺利的话一到两周能走完;遇到数据质量波动、污染、参数需要反复调试的情况,时间翻倍很正常。做项目规划时一定要留足buffer,别把时限卡死在一条单向跑道上。

5.4 最终判断T2T是否做成功的硬标准

最后还是要回到那个最基础的问题:怎么判断一个T2T组装算真正成功?我的标准很简单,三条硬杠杠:第一,全基因组里没有未解析的gap,所有染色体都从一端端粒连续拼到另一端端粒;第二,端粒信号和着丝粒卫星序列的分布,跟已知染色体结构完全对得上;第三,用独立数据验证过——比如用Hi-C或光学图谱确认大片段的顺序没有颠倒、重复,再用PCR或者Sanger测序抽查几个关键区域。三条都过,我才会认为这个T2T是能拿到下游分析里去用的实打实资源,而不是只能挂在论文里展示的图。

说句实在话,我最初看到这篇论文标题的时候,最深的感受不是某个技术点有多惊艳,而是国内团队终于有底气把“基因组完整度做到极致”这件事,落地到一个农业动物身上。技术参数和数据都会更新,但“用一套没有gap的完整基因组去回答育种和医学问题”的思路,会在后续很长一段时间里影响这个领域。如果你正在考虑做自己物种的T2T,我的建议是别只盯着最新测序平台和工具,先把样本质量、数据比例和质控指标想清楚。底盘稳了,剩下的就是耐心和算力的事。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询