☰
AI实验室挖出类CRISPR新系统:宏基因组与蛋白语言模型的挖掘范式
2026/9/29 17:31:01 网站建设 项目流程

看到"Anthropic自己的实验室,挖出了一个类CRISPR新系统"这条消息时,我正开着Claude在改一份基因组注释脚本。第一反应是:一家做大模型的公司跑去搞基因编辑了?第二反应是:好像也真的说得通。Anthropic是Claude背后的公司,在AI安全和生物交叉领域一直有布局,这次从宏基因组数据里筛出一个类似CRISPR的可编程工具,其实标志着一个更重要的趋势——大模型不再只是帮你写代码、读文献,它开始直接参与新生物学工具的发现。这篇文章我想从技术角度做个复盘:这个类CRISPR系统大概是个什么东西、Anthropic是怎么把它挖出来的、它对基因编辑行业意味着什么,以及我们这些做生物信息或者合成生物学的人,能从这条新闻里学到哪些真正有用的东西。

1. 消息为什么这么炸:一个AI实验室把手伸进了宏基因组数据库

1.1 事件的来龙去脉:Anthropic的实验室到底做了什么

先理清楚"Anthropic自己的实验室"指的是什么。Anthropic在公开资料里有专门的生物安全团队和AI+生物交叉研究组,他们一直关注大模型在蛋白质结构、序列理解方面的能力边界。这次被刷屏的消息,按目前透露的信息看,是他们的研究团队不满足于让模型回答生物学问题,而是直接下场做工具挖掘——从公共宏基因组数据库里,锁定了若干个和CRISPR功能相似、但序列相似度极低的"孤儿基因簇",最终确认了一个新的可编程核酸酶系统,也就是标题里说的"类CRISPR"。

这个消息能在圈子里炸开,核心原因是身份反差。过去我们习惯的是"生物学家发现新系统,AI提供辅助验证",比如用AlphaFold预测结构、用语言模型生成候选蛋白。而这次反过来:AI公司的自有实验室主动定义问题、设计挖掘策略、完成大规模筛选,生物学只是它的应用场。它在做的事情,本质上是把地球上还没有被注释出来的基因序列,当成一个巨大的语料库去反复通读。

需要说明的是,目前披露出来的细节并不完整,论文还没有全文放出,下面我基于已有的公开信息和同行讨论,把这类工作通常怎么做、这次可能做对了什么,拆开来聊。

1.2 从"让模型读文献"到"让模型读基因组"的范式迁移

过去两年,蛋白语言模型已经证明了一件事:把数百万条蛋白序列丢给Transformer训练,模型能学会序列和功能之间的深层关联。Evo、ProGen、ProtGPT2这些工作,已经把"用模型生成蛋白质"变成了常规操作。但Anthropic这次走的路径不太一样,不是生成一个蛋白,而是去"发现一个系统"。

绝大多数人会误以为这还是在做BLAST的同源搜索,只是换了个更聪明的工具。其实区别很大:传统同源搜索要求候选序列和已知Cas蛋白在氨基酸层面上有足够高的相似度,这决定了它只能在已知家族里找变体,很难跳出框架。而语言模型对蛋白的表示方式是语义化的,两个蛋白序列相似度只有20%,但在结构域组织、理化性质、共定位模式上高度一致,模型依然能把它们归到相近的语义空间。

打个比方,BLAST像是在电话簿里找一个姓氏和你相同的人,蛋白语言模型则像是在看你朋友的朋友圈——不一定同姓,但他出现在同一个聚会里、聊同一个话题、干同一类活,那他就很可能值得认识。Anthropic的实验室大概率是先用模型对宏基因组里的全部开放阅读框做embedding,再结合CRISPR阵列、移动元件等上下文信息做聚类,把那些"看起来像、听起来像、但序列上完全不像"的候选捞出来。这一步,传统工具是真的做不到。

2. 类CRISPR系统的技术内核:它不是Cas9换了件马甲

2.1 先把"类CRISPR"的范围说清楚

CRISPR-Cas系统本身是个大家族,分成两大类:Class 1是多亚基复合物,Class 2是单效应蛋白,比如大家熟悉的Cas9、Cas12、Cas13。而在细菌和古菌的移动遗传元件里,还潜伏着一批"类CRISPR"系统——它们不是真正的适应性免疫系统,但会用一小段RNA或DNA作为向导,实现对核酸序列的程序化识别和切割。比如TnpB、IscB、OMEGA家族里的Ihu/Ihi,以及真核生物里的Fanzor,都属于这个范畴。

这批蛋白的共同特征是体积小、机制紧凑,普遍被认为是CRISPR效应蛋白的远亲或祖先。它们的向导RNA很短,识别位点有时没有苛刻的PAM要求,这让它们在基因编辑应用上有很大的想象空间。把新系统放在这个谱系里看,才能理解为什么Anthropic的发现值得认真对待。

系统/蛋白大致大小向导机制主要特点
SpCas9约1368 aacrRNA+tracrRNA双向导NGG PAM,应用最广
Cas12a约1300 aa单crRNATTTV PAM,交错切割
TnpB约400-500 aa短ωRNA体积小,移动元件来源
IscB约500-600 aa短RNA被认为是Cas9远亲
此次新系统推测约500-600 aa短向导RNA识别偏好与众不同的PAM

2.2 这次系统值得注意的三个技术特征

虽然论文没有全部公开,但结合流出的框架信息和同类系统的共性,有三个特征值得盯住。

第一是体积。这类从移动元件里挖出来的蛋白,通常比SpyCas9小一半以上,对AAV病毒载体包装、植物转化、以及线粒体编辑这类对payload敏感的递送场景特别友好。体积小带来的不只是递送方便,还有可能更低的免疫原性——蛋白越小,被宿主免疫系统识别为外来抗原的表位越少,这在体内编辑里是一个隐形但极其重要的优势。

第二是PAM识别的差异化。Cas9需要NGG,Cas12a偏好TTTV,这在实际操作中经常限制靶点选择。如果新系统识别的是T-rich序列或者其他简并基序,就意味着原本"无靶可打"的基因组区域多了一批可用位点,和现有工具形成互补而不是竞争。

第三是天然的高保真倾向。移动元件来源的核酸酶,在进化压力下通常对靶点识别有非常紧凑的要求,因为它们一旦乱切宿主基因组,自己也活不下去。如果这种特性在湿实验中被证实,脱靶率可能会比改造过的高保真Cas9变体还要漂亮。当然,这是我基于进化逻辑的推测,一切要等正式论文的脱靶数据出来再下定论。

2.3 行业为什么对"又一个CRISPR"这么敏感

原因很简单:现有编辑工具三巨头各有各的痛。Cas9是大而全,但体积大、PAM限制多;Cas12a嗜好T-rich序列,做A/T富集区域是神器,但G/C密集区域就挠头;Cas13走RNA路线,不碰DNA。一个能够补上某一块短板的系统,哪怕只解决一个具体痛点,就足以撑起一家初创公司或者一个专利池。

再加上碱基编辑和先导编辑现在都是模块化设计——脱氨酶、逆转录酶都能往核酸酶骨架上挂。新的支架蛋白一旦被验证,下游应用组合几乎是无限的。所以每次出现这类新闻,产业界的反应都非常迅速,第一个动作通常都是去查专利,第二个动作是联系作者要质粒。

3. 从海量数据到拿到新系统:AI辅助挖掘的完整链路

3.1 数据侧:宏基因组数据库是一座大乱炖富矿

做这类挖掘,第一步一定是选对数据源。常用的有IMG/M、MGnify、JGI以及NCBI的WGS数据库,里面除了细菌古菌,还混着大量噬菌体、质粒、整合性移动元件,序列质量参差不齐,组装错误和污染序列到处都是。但也正是因为杂,才足够大,很多从未被注释的"暗物质序列"就藏在这里。

挖掘的第一步是准备数据:按contig做基因预测,把全部ORF翻译成蛋白序列,同时保留它们所在的基因组上下文。这一步很容易被低估,但最终筛出来的候选是不是真的"像CRISPR",很大程度上取决于你对上下文的处理——比如基因簇是否挨着CRISPR阵列、是否位于转座酶附近、是否和有毒力岛或分泌系统共定位。

3.2 模型侧:把基因簇当文章一样通读

数据准备好之后,Anthropic这类团队的常规做法,是用蛋白语言模型给每条ORF算一个稠密向量,再做聚类和检索。我可以给一个最小化的伪代码示意,帮你理解整体流程:

# 伪代码:蛋白语言模型embedding + 上下文聚类找候选 import numpy as np from sklearn.cluster import HDBSCAN # 1. 从consensus contigs里用Prodigal预测全部ORF orfs = predict_orfs("metagenome.fasta") # 2. 用预训练蛋白语言模型(如Evo/ProtT5)把每条蛋白变成向量 embeddings = np.stack([protein_llm.embed(orf.seq) for orf in orfs]) # 3. 只保留"孤儿ORF":没有已知结构域注释、长度在300-800aa、周围2kb内有重复序列或转座酶 candidates = [orf for orf in orfs if no_domain_hit(orf) and 300 < len(orf.seq) < 800 and has_mobile_context(orf)] # 4. 对候选向量做密度聚类,找出"家族式"扩张的未知蛋白 clusters = HDBSCAN(min_cluster_size=5).fit(embeddings[candidates]) # 5. 对每个大簇做共定位分析和系统发育分布统计,打分排序

注意,这里的关键不是embedding本身,而是筛选条件的设计。真正的"类CRISPR"候选必须满足几个硬指标:有核酸结合潜力、旁边存在可形成向导RNA的非编码序列、在不同门类里呈现散布式分布(说明这是移动元件而不是宿主基因)、蛋白大小落在合理范围。这些条件组合起来,比单纯做同源搜索要难得多,但也正是语言模型擅长的事——它能把"序列像不像"升级为"在这个基因组语境里,它是否扮演系统角色"。

3.3 从计算候选到湿实验验证:AI负责提出假设,试管负责证伪

捞出来的候选最终能不能叫"新系统",只有一个标准:在试管里重现功能。通常的验证路径是:合成候选基因和推测的向导RNA,组装成质粒,在细菌或体外转录体系中测试切割活性;然后做PAM扫描,看它到底偏好什么靶位点;再通过突变关键残基确认催化活性位点;最后用NGS测序评估脱靶情况。

验证环节对应问题常用方法
表达与组装蛋白能否可溶表达,RNA是否被正确加工大肠杆菌共表达、Northern/Western
向导依赖性切割切割是否真正由向导RNA引导有/无向导RNA对照电泳
PAM偏好靶点识别规则是什么质粒文库PAM扫描+NGS
脱靶评估会不会乱切基因组全基因组无偏脱靶检测
体内功能在细胞内能否发挥编辑作用细菌内编辑报告系统

很多团队死在第二步到第三步之间。计算预测给出一排候选,湿实验一跑,多半是没活性、不溶、或者切割是非特异的。这也是为什么这类发现真正稀缺的部分不是算力,而是"低成本实验闭环"——AI公司往往要和实力强的分子生物学实验室合作,才能把这个过程走完。Anthropic这次能落到"系统"而不是停留在"候选基因簇",说明他们已经走通了至少一部分湿实验验证。

4. 对基因编辑行业的影响:工具扩容与落地可能性

4.1 给编辑工具箱里添一个新筹码

站在搞应用的人的角度,多一个被验证的RNA引导系统,直接意味着设计空间变大。CRISPR应用的复杂度从来不在于"能不能切",而在于"如何在特定细胞、特定位点、特定时间窗口里切得准、切得稳"。新系统如果出生就自带小体积、低脱靶、新PAM这三个标签之一,它就能立刻进入碱基编辑、先导编辑、基因调控这些模块化平台,被改造成更好用的工具。

这个逻辑在历史上反复出现过。Cas12a刚出来的时候,大家觉得它不过是Cas9的替代品,但后来凭借T-rich PAM和双切割特性,成了检测和A/T富集区编辑的主流选择。一个新系统的价值,往往不是替代王者,而是在王者的盲区里开辟自己的生态位。

4.2 从实验室走向临床和农业的路径

临床应用层面,最直接的想象力是AAV递送。AAV载体的包装上限大概在4.7kb左右,而SpyCas9加上向导RNA表达框就已经逼近甚至超过这个阈值,所以临床上经常要塞进Split-Cas9或者用双AAV系统。一个小500aa左右的效应蛋白,加上启动子和向导RNA,能轻松塞进单AAV,递送效率和表达均一性都会明显提升。神经系统、心肌、肝脏这些AAV亲和的组织,都是潜在受益场景。

农业和植物编辑方面,新的PAM偏好意味着更多"无靶可打"的位点变成可编辑位点,而且小蛋白对植物转化载体更友好。如果未来能稳定实现在叶绿体或线粒体基因组的编辑,粮食作物的雄性不育育种、细胞质遗传改良这些长期卡脖子的方向,都会有新的工具支撑。

4.3 比工具本身更大的一个信号

我认为这条新闻最值得关注的,不是这个具体的系统,而是它的发现方式。AlphaFold让我们看到AI能预测结构,Evo、ProGen让我们看到AI能生成序列,而这次是AI公司用自研模型从海量混杂数据中发现了一个此前人类从未描述过的生物系统——一个完整的、有功能的、可编程的分子机器。

这意味着大模型在生物学的角色,从"辅助理解"升级为"主动发现"。序列数据库不再只是检索对象,而是一个可以被反复提问的语料库。未来类似的系统可能会越来越多,而且发现速度会指数级加快。对传统科研团队来说,掌握语言模型的使用方法,可能比多跑几千次BLAST有价值得多。

5. 我的几点判断与实操避坑心得

5.1 别听到"类CRISPR"就激动:验证清单先过一遍

每次出现这类新闻,总有人急着下场跟进。我的建议是,先用一张清单冷静评估:

  • 有没有直接的向导RNA依赖性切割实验?如果没有这个数据,其他全是空中楼阁。
  • PAM扫描做了没有?覆盖是否足够全面?
  • 脱靶实验是用的什么方法?有没有和Cas9在同条件下对比?
  • 蛋白是否独立起效,还是必须依赖宿主的其他因子?依赖宿主因子不代表不重要,但应用转化会麻烦很多。
  • 专利情况如何?如果核心序列和修饰方式已经被布局,后续商业开发的自由度会受限。

面对任何号称"CRISPR新变体"的系统,我习惯先去查它有没有独立的生化证据,再谈应用。过去几年有不少论文标题很唬人,最后补实验的时候发现向导RNA其实不是必需的,或者切割产物混乱,这类教训不少。

5.2 想复现类似的挖掘流程,从这几步开始

如果你也想在自己的课题里试试这种"AI挖掘"的思路,我建议从最小可复现流程起步:

  1. 从MGnify或IMG/M下载一批组装质量好的宏基因组contig,优先选人有注释的,减少组装错误干扰。
  2. 用Prodigal预测ORF,同时用CRISPRCasFinder标注CRISPR阵列和Cas操作子位置。
  3. 用Evo或ProtT5类蛋白模型对所有ORF算embedding,这一步有GPU最好,没有也可以用小的ESM-2模型,效果差别可控。
  4. 筛选"孤儿ORF"并聚类,聚焦那些在移动元件上下文里反复出现的未知家族。
  5. 对候选做共定位分析:看它周围有没有非编码RNA候选、有没有转座酶、有没有毒素-抗毒素系统。
  6. 把最后存活的三五个候选交给合作实验室做湿实验,千万别自己闭门造车。

这条链路看起来不复杂,但每一步都有坑。最常翻车的是宏基因组嵌合体——一条contig上拼了来自两个物种的片段,导致"共定位"是假的。筛选时务必做物种组成校验和基因组上下文复核。

5.3 对三类人的建议

做分子生物学的同行,建议花一点时间把蛋白语言模型的基本用法装进自己的工具箱,它不会替代你的实验能力,但能让你从"在读文献"变成"在分配假设"。做生信的同学,建议别沉迷于算更多feature,真正的瓶颈是把计算预测和湿实验验证闭环起来——能和实验团队深度合作的人,在这种交叉机会里最稀缺。做产业观察的朋友,盯住三件事:正式论文的方法学细节、核心专利的申请范围和有没有第三方独立复现的结果。

我个人在实际操作中的体会是,这种"AI挖系统"的新闻里,最值钱的信息往往不是那个具体的蛋白,而是那套把语言模型当作发现引擎的方法论。序列语料库就在那里,地球上海量的"暗物质基因"也就在那里,谁能建立更高效的提问-验证闭环,谁就能持续挖出下一个"类CRISPR"。这比单独一个工具的新闻,要让整个行业睡不着觉。等正式论文出来,我会再写一篇更细的机制拆解,到时把PAM、结构域、脱靶数据一项项对着讲。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询