1. 这条消息到底在说什么:先把事实和噪音分开
我第一次看到“Claude自主发现类CRISPR新酶系统”这个标题的时候,第一反应不是兴奋,而是警惕。原因很简单:过去两年里,凡是把“AI”和“科学发现”放在一起的新闻,十有八九在传播过程中会被拧成两种极端——要么是“AI要取代科学家了”,要么是“不过是高级一点的文献检索”。这两种解读都不对,而且都不解决问题。
先把这件事的核心事实摆清楚。根据公开报道,Anthropic 的研究团队让 Claude 参与了一项基因组数据分析任务,目标是在大规模序列数据中寻找与已知 CRISPR 相关蛋白具有相似特征、但此前未被标注或未被实验验证的候选系统。结果它筛出了一批候选,其中包含与逆转录酶相关的元件组合,这类组合在自然界中确实存在,最接近的已知参照是某些细菌基因组里携带逆转录酶活性的防御相关系统。张锋的点评很克制,大意是“值得研究”,而不是“已经证明有功能”。这个措辞非常关键,因为从“序列上像”到“实验上能用”,中间隔着一条很长的验证链。
所以这条消息真正值得关注的点,不是“AI发现了新酶”,而是AI 在生物序列数据里做候选筛选这件事,已经进入了一个可以产出可验证假设的阶段。它解决的不是“功能确认”问题,而是“在海量可能性里先圈出一小片值得做实验的区域”的问题。适合读这篇文章的人,是那些对 AI 辅助科研、智能体工作流、基因组数据分析感兴趣,但又不想被营销话术带偏的从业者或爱好者。
我下面要拆的,不是这条新闻本身,而是它背后那套“智能体驱动候选发现”的方法论——这套东西你完全可以迁移到自己的项目里,不管你是做生物信息、做数据挖掘,还是单纯想搞明白 Claude 这类工具在真实科研场景里到底怎么用。
2. 为什么是“候选发现”而不是“功能验证”:理解这条链路的分工
2.1 生物序列空间有多大,人工筛查为什么不可行
先算一笔账。一个典型的细菌基因组大小在 2 到 5 Mb 之间,也就是 200 万到 500 万个碱基对。公共数据库里已经收录的细菌基因组数量早就过了几十万量级,而且还在快速增长。CRISPR 相关系统的一个显著特征是:它们通常以“操纵子”形式成簇出现,包含 Cas 基因和 CRISPR 阵列,但不同系统的基因排列、蛋白结构域组合差异极大。
如果你要人工去找“类 CRISPR 但又不是已知 CRISPR”的系统,你需要做的事情包括:识别候选操纵子、比对保守结构域、排除已知家族、评估是否携带逆转录酶或其他效应模块、判断是否可能具有核酸靶向活性。这套流程里,每一步都可以写规则,但规则写得太死会漏掉远缘同源,写得太松又会产出大量假阳性。这就是为什么过去这类发现主要依赖两类方法:一是基于序列相似性的自动注释流水线,二是少数实验室多年积累的经验直觉。
Claude 在这里扮演的角色,更接近一个“能同时处理多种证据来源、并且能解释自己为什么这么判断”的筛选器。它不是在跑 BLAST,而是在读注释、读文献摘要、读结构域预测结果,然后给出一个排序后的候选列表。这个列表的价值在于:它把原本需要一个人花几周甚至几个月才能过一遍的候选集,压缩到了可以在一轮实验里验证的规模。
2.2 逆转录酶为什么让这件事变得有意思
逆转录酶在 CRISPR 语境里之所以敏感,是因为它暗示了一种可能性:这类系统可能不只是切割 DNA,而是能把 RNA 信息写回 DNA。已知的某些防御系统确实利用逆转录酶来记录入侵者的序列信息,形成一种“记忆”。如果新发现的系统也具备类似能力,那它在基因编辑工具开发上的想象空间就很大——比如更精准的序列插入、更可控的细胞内记录。
但这里必须踩一脚刹车。序列里出现逆转录酶结构域,不等于这个系统在生理条件下真的以逆转录方式工作。很多逆转录酶相关基因在基因组里是“孤儿”,没有明确的防御功能,甚至可能是退化元件。张锋说“值得研究”,翻译成实验室语言就是:这个候选值得花几周时间做异源表达、做体外切割实验、做结构解析。它可能成,也可能不成。AI 做的是把“值得试”的东西挑出来,而不是替你做实验。
2.3 智能体在这里到底做了什么,没做什么
我看了几篇相关的技术讨论,也自己用类似思路跑过一些序列筛选的小项目。我的理解是,Claude 在这类任务里的工作流大致是这样的:先接收一批基因组区域的注释信息,然后根据预设的筛选标准(比如“包含 Cas 样蛋白但缺乏已知 CRISPR 阵列”“邻近存在逆转录酶”“结构域组合与已知家族距离较远”)逐条评估,最后输出候选列表和判断理由。
它没做的事也很明确:没有做实验,没有做分子动力学模拟,没有做进化分析的全部统计检验。它做的是信息整合和优先级排序。这个定位很重要,因为如果你把它当成“自动发现机器”,你会失望;如果你把它当成“能帮你把候选集从一万条压到一百条的助手”,它的价值就非常实在。
3. 如果你想复现这套思路:从数据到候选列表的实操拆解
3.1 数据准备:你需要什么样的输入
假设你想在自己的项目里做类似的事情,第一步不是打开 Claude,而是把数据整理成它能有效处理的格式。我试过几种方式,最稳的是把每个候选区域整理成结构化的文本块,包含以下字段:
- 区域编号和基因组坐标
- 邻近基因的注释(蛋白名、结构域、长度)
- 是否包含已知 CRISPR 相关特征(阵列、Cas 基因)
- 与已知家族的序列相似度(如果有)
- 你关心的额外特征(比如逆转录酶、核酸酶、解旋酶)
把这些信息写成 JSON 或 YAML,每个区域一个条目,然后分批喂给模型。不要一次性丢几万条进去,上下文会爆,而且模型在超长上下文里的判断一致性会下降。我的经验是每批 50 到 200 条比较合适,具体取决于每条的信息量。
提示:如果你手头只有 FASTA 序列,没有注释,那就先用 Prokka 或类似工具做一遍自动注释,再把注释结果整理成上面的结构。这一步不能省,因为模型需要的是“有语义的信息”,而不是裸序列。
3.2 提示词设计:怎么让模型给出可用的判断
我踩过的最大坑,是早期提示词写得太笼统,比如“帮我找找有没有新的 CRISPR 系统”。这种问法得到的回答基本是废话,因为它没有约束条件,模型只能泛泛而谈。
后来我改成结构化提示,效果明显好很多。核心要素包括:
- 角色设定:明确告诉它你是一个微生物基因组分析助手,任务是筛选候选防御系统。
- 筛选标准:逐条列出你关心的特征,比如“包含至少一个 Cas 样蛋白”“缺乏已知 CRISPR 阵列”“邻近存在逆转录酶或核酸酶”。
- 排除条件:明确哪些情况直接排除,比如“与已知 Cas9 相似度超过 80%”“注释为转座酶且无其他防御特征”。
- 输出格式:要求它按固定格式输出,包括候选编号、判断理由、置信度(高/中/低)、建议的下一步验证方向。
我实测下来,置信度这一栏特别有用。模型标“高”的候选,我拿去人工复核,命中率明显高于随机挑。标“低”的也不是没价值,但通常需要更多人工判断。
3.3 结果复核:哪些信号值得你花时间
模型给出候选列表之后,不要直接信。我一般会做三层复核:
第一层是结构域一致性检查。把候选区域的蛋白序列拿去跑 HMMER 或 InterProScan,看结构域注释是否和模型描述的一致。这一步能过滤掉大部分明显错误。
第二层是基因组上下文检查。看看候选区域周围有没有移动元件、有没有异常 GC 含量、有没有重复序列。这些信号不一定是否定性的,但能帮你判断这个区域是不是“干净”的候选。
第三层是文献交叉验证。把候选里最关键的蛋白序列拿去搜文献,看看有没有人已经报道过类似的东西。这一步经常能发现模型漏掉的信息,因为文献里可能已经有人做过部分实验,只是没有明确命名。
注意:模型在判断“是否已知”这件事上并不可靠,因为它的知识有截止时间,而且它不一定记得所有冷门文献。所以文献检索这一步必须人工做,不能省。
4. 智能体工作流在科研场景里的真实边界
4.1 它能加速什么,不能加速什么
我自己的体会是,智能体在科研里最擅长的环节是信息压缩和假设生成。比如你有一个几万条的候选列表,它能帮你按优先级排序;比如你在读一堆文献,它能帮你提取关键结论并对比。这些任务的特点是:输入信息量大、判断规则相对明确、但人工做起来极其耗时。
它不擅长的是需要物理直觉或实验反馈的环节。比如判断一个蛋白在体外能不能折叠、一个切割反应在特定缓冲液里效率如何、一个结构域组合在进化上是否合理。这些需要实验数据或专业模拟,模型只能给猜测。
4.2 一个常见的误解:把“发现”和“验证”混为一谈
我见过不少讨论,把“AI 找到候选”直接说成“AI 发现新酶”。这个说法在传播上很抓眼球,但在科研语境里是不准确的。发现和验证是两件事,前者是提出假设,后者是检验假设。AI 目前能稳定做的是前者,而且做得越来越好;后者仍然依赖实验科学家的判断和操作。
张锋的点评之所以值得琢磨,就是因为他没有把话说满。他说“值得研究”,而不是“已经证明”。这个分寸感,恰恰是专业和炒作之间的分界线。
4.3 对非生物背景的人,这套思路有什么用
如果你不是做生物的,这套东西对你也有参考价值。核心逻辑是:用智能体处理大规模候选集,把人工判断集中在高价值样本上。这个逻辑可以迁移到很多场景,比如:
- 做市场调研时,从几千条用户反馈里筛出值得深挖的主题
- 做代码审计时,从大量告警里筛出真正有风险的条目
- 做内容运营时,从海量素材里筛出可能爆的选题
关键不在于你用什么模型,而在于你能不能把筛选标准写清楚,并且设计好复核流程。
5. 常见问题与排查技巧实录
5.1 模型给出的候选全是已知家族,怎么办
这是最常见的问题。原因通常是筛选标准写得太宽,或者输入数据里已知家族的占比太高。我的解决办法是:在提示词里明确要求“排除与已知 Cas 蛋白相似度超过某个阈值的候选”,并且在输入数据里标注哪些是已知家族。如果模型还是反复给已知结果,那就把已知家族的序列单独拿出来做一轮预过滤,不要丢给模型。
5.2 模型判断理由看起来很合理,但复核发现是错的
这种情况通常发生在模型对某个结构域的功能理解有偏差的时候。比如它可能把某个常见结构域误判为“罕见组合”。解决办法是:在提示词里附上关键结构域的功能说明,或者要求模型在给出判断时引用具体的注释来源。如果它引用的来源和你的注释不一致,那就以你的注释为准。
5.3 候选列表太长,怎么进一步压缩
我一般会做两轮压缩。第一轮按置信度筛,只保留“高”和“中”。第二轮按基因组上下文筛,排除那些周围有大量移动元件的区域。如果还是太长,那就按你关心的核心特征排序,比如“是否携带逆转录酶”“是否缺乏已知阵列”,优先看同时满足多个条件的。
5.4 怎么判断一个候选值不值得做实验
这个问题没有标准答案,但我自己的经验是看三点:一是序列特征是否完整(有没有明显的截断或移码),二是基因组上下文是否干净(有没有被移动元件打断),三是是否与已知系统有足够距离(太近没新意,太远可能根本不是这类系统)。三点都满足的候选,我会优先考虑。
| 问题类型 | 典型表现 | 排查方向 | 处理建议 |
|---|---|---|---|
| 候选全是已知 | 输出结果与已知家族高度重合 | 检查筛选标准是否过宽 | 增加排除条件,预过滤已知序列 |
| 判断理由错误 | 理由合理但复核不通过 | 检查结构域注释是否准确 | 附上注释来源,要求引用具体证据 |
| 列表过长 | 输出几百条候选 | 检查置信度分布 | 按置信度和上下文做两轮压缩 |
| 候选质量差 | 序列截断、上下文混乱 | 检查输入数据质量 | 先做注释和过滤,再喂给模型 |
6. 我个人的几点实操体会
第一,不要指望一次提示就能得到完美结果。我通常要跑三到五轮,每轮根据上一轮的输出调整筛选标准和输入格式。这个过程本身就是在帮你理清自己到底想要什么。
第二,模型给出的置信度只能参考,不能全信。我遇到过标“高”但复核发现是已知家族的,也遇到过标“低”但实际很有意思的。所以复核环节不能省,而且复核标准要提前定好,不能边看边改。
第三,如果你要做的是严肃的科研项目,一定要把模型的输出和你的判断过程记录下来。一方面是为了可复现,另一方面是当你写论文或报告的时候,这些记录能帮你解释为什么选了这些候选。
第四,这套方法的价值不在于“AI 有多聪明”,而在于“你能把问题拆得多清楚”。模型只是一个执行者,真正的判断力还是在你手里。张锋说“值得研究”,背后是一整套实验设计和验证逻辑,那才是科研的核心。AI 能帮你更快地走到“值得研究”这一步,但走不走得通,还得看实验。