AI自主发现类CRISPR新酶系统:从宏基因组到基因编辑的假说引擎

发布时间:2026/10/3 10:09:13
AI自主发现类CRISPR新酶系统:从宏基因组到基因编辑的假说引擎 CRISPR 基因编辑的新闻每隔一阵就会来一条但这次确实不太一样不是实验室里的科学家设计实验发现了新酶而是 AI 模型 Claude 在公开基因组数据库里翻来翻去自己找了一批“类 CRISPR”的新酶系统。功能还不知道张锋的回应也很克制只说“值得研究”。我第一反应是这又是一条被标题党放大的新闻。可仔细看公开报道的细节发现事情比表面上有意思得多。这个事件的核心不在于“AI 又抢了科学家的活”而在于“AI 从海量数据里提出假说的能力已经越过了一个临界点”。对做基因编辑的人来说这可能是未来几年值得盯住的方向对做生信、做开发、甚至单纯把大模型当生产力工具的人来说这套“AI 提假说 人工验证”的流程也完全能迁移到自己的日常研究里。这篇文章我不打算复述一遍新闻而是把它拆开来讲清楚AI 到底是怎么找到这些类 CRISPR 系统的张锋那句话的分量在哪里以及这套方法我们能不能自己上手复现。1. 事件还原AI 找到的“类 CRISPR”新酶系统到底是靠什么发现的1.1 解剖“自主发现”AI 实际干的三件事公开报道里只说 Claude“自主发现”这听起来很玄乎但拆开看它干的其实是生物信息学里三件并不新鲜的事只是方式和速度变了。第一件事是拿着公开数据库里的海量基因组做扫描。数据来源主要是 NCBI、MGnify 这类公共库里面存放着大量细菌、古菌的基因组序列。人类基因组只有一套但微生物基因组是几万套、几十万套很多还是环境样本里直接拼出来的从来没人仔细看过。第二件事是识别 CRISPR 阵列。CRISPR 系统在细菌身上有一套非常有辨识度的“档案记录”结构一段段短的重复序列中间夹着长度不一的外源 DNA 片段也就是间隔序列。这种“重复-间隔-重复-间隔”的模式计算机非常容易识别。传统工具如 PILER-CR、MinCED、CRISPRCasFinder 都是干这个的AI 做的也是同样的事但容忍度更高能识别出那些不那么典型、被传统规则漏掉的阵列。第三件事是搜索 Cas 样蛋白。完整的 CRISPR-Cas 系统除了记忆档案还得有武装力量也就是 Cas 蛋白。II 型系统的 Cas9、V 型的 Cas12、VI 型的 Cas13这些都已经被研究得很透。AI 要做的是在 CRISPR 阵列附近寻找那些编码“看起来像 Cas 但又不完全像”的蛋白序列。在这个环节常用的不是直接跑 BLAST 比对而是把蛋白序列转成高维向量用聚类的方式把“功能相似但序列差异大”的候选捞出来。换个生活化的比喻传统方法像拿着通缉令上的照片去认人必须长得够像才能发现AI 的方法像根据一个人的生活习惯反推他可能住在哪个片区哪怕从没见过照片也能圈出几个可疑地址。这就是“自主发现”四个字背后最实在的技术变化。1.2 “类 CRISPR”不是“坏的 CRISPR”先搞懂这套系统长什么样很多人看到“类 CRISPR”这三个字会下意识以为这是“类似但不好用”的东西。这个理解需要纠正。完整的 CRISPR-Cas 免疫系统需要两大件前面说的 CRISPR 阵列负责记录入侵者的 DNA 片段作为“通缉档案”后面跟着的 Cas 蛋白负责根据档案去识别并切割入侵者的核酸。两个部分缺一不可否则免疫就会失效。而“类 CRISPR”系统指的是与已知系统同源、但结构上不完整的基因簇。可能的情况有三种有阵列但旁边的 Cas 基因缺了大半只剩一个作用不明的蛋白有完整的 Cas 样蛋白但找不到典型的阵列结构可能它已经被改造成了别的调控元件蛋白结构域的排列组合非常奇怪和已知的 Cas 家族都对不上号。这三种情况在微生物基因组里其实很常见因为细菌基因组演化速度很快很多防御系统会退化、重组、被挪作他用。传统工具遇到这类基因簇处理方式通常是直接过滤掉因为“不够典型”但 AI 恰恰相反它会把那些“说不清是什么”的当作高价值异常点单独挑出来。每个做科研的人都明白未知比已知更值钱。自然界里已知的 CRISPR-Cas 系统已经被翻来覆去研究了几十年新东西的空间越来越窄而一个不知道能干什么的蛋白酶反而可能是下一把还没被发现的“分子剪刀”。这就是“功能未知”四个字真正的价值。2. 张锋的“值得研究”为什么是这轮新闻里最值钱的一句话2.1 一句话读懂“值得研究”张锋这个名字做基因编辑的人没有不知道的。他是 CRISPR-Cas9 真核基因编辑技术的奠基人之一也是利用宏基因组数据挖掘新 CRISPR 系统的代表人物。他所在团队过去这些年干的事就是从各种奇怪的环境样本里找新的 Cas 蛋白然后改造成好用的基因编辑工具。所以“值得研究”这四个字从他嘴里说出来基本等同于一个资深猎手看到了一块陌生的兽径时说“这里有东西”。他不会轻易对新闻事件做评价一旦说了说明这批候选系统在专业判断上确实有追踪价值。为什么他有这个判断力因为张锋自己的实验室就有“从多样性里挖工具”的成功记录。通过分析宏基因组数据他们找到过体积更小、更便于递送的 Cas9 同源物还参与推动了 Cas12、Cas13 的发现和应用。这条路他不是第一次走也不是只凭直觉他是切切实实知道自然界里还剩多少没被发现的系统的人。2.2 功能未知的酶系统为什么是工具库的下一块拼图判断一个新发现的酶系统有没有价值可以看它可能变成什么。功能未知不意味着没有功能一个被自然选择保留下来的基因大概率是有用的只是我们还没测出来。做个简单的推演如果这个新酶具备……它可能成为……对标现有工具核酸酶活性新的基因编辑工具Cas9 / Cas12 的替代或补充只结合不切割的能力新的基因调控工具dCas9 / dCas12RNA 切割活性新的 RNA 检测与编辑工具Cas13与转座子相关的结构域新的大片段基因插入系统CAST / INTEGRATE只在特定古菌里存在的特征新的分子诊断靶点反向应用于临床检测每一种可能性对应一个具体应用场景。比如现有 Cas9 的问题在于分子量太大递送困难Cas12 的问题在于 PAM 序列限制Cas13 对 RNA 的检测灵敏度虽然高但特异性还有提升空间。如果这批新酶系统里有一两个能在这些环节上做出改善那它们就是实打实的新工具起点。这跟在地里捡到一块金属差不多。普通人看到一块锈迹斑斑的金属不知道是什么但经验老到的考古队员看一眼出土地点会告诉你“值得研究”——因为那个位置底下可能埋着一个没被打开过的器物层。2.3 比单个发现更重要的事AI 参与假说生成张锋点评里最值得琢磨的其实不是他认可了某一个酶而是他认可了“AI 可以参与科学假说生成”这个路径本身。过去发现新 CRISPR 系统基本靠科学家肉眼加运气。一个实验室可能花好几年筛几万个基因组才能找到一两个候选。而 AI 的扫描能力是人力完全没法比的它可以在几天内把公共数据库里的数十万条基因组全过一遍把所有“看起来异常”的 CRISPR 相关基因簇都捞出来。科学家的工作从“找”变成了“选”——在一个已经缩小很多倍的池子里判断哪些最值得进实验室。这就是质变。以前是新酶在自然界里等着被人类发现平均速度以年为单位现在变成 AI 批量提交候选名单科学家的判断和实验验证才是瓶颈。这个转变对任何一个依赖“先发现、后验证”的领域都是通用的不只是 CRISPR。3. 这套“AI 找酶”的思路普通人怎么迁移到自己的研究里3.1 一个研究生可以落地的“AI 生信”最小复现流程这套逻辑并不是只有顶级实验室才能跑。就算不碰 CRISPR任何一个手里有数据集、想找异常模式的研究者都可以走一遍下面这个最小流程。我把它整理成六个步骤每一步都有明确产出准备环境。Python 3.10 以上装好 biopython、pandas、scikit-learn有 GPU 更好没有也能跑小规模数据。拿数据。从 NCBI 下载基因组序列或者从 MGnify 拉宏基因组的 contigs。先别贪多拿一万条以内练手就够。跑常规工具。用 MinCED 或 CRISPRCasFinder 扫一遍把标准 CRISPR 位点找出来作为基线数据。提取非典型位点。这一步是关键把工具没识别出来、但序列特征看起来像阵列的区域全部标记出来。传统工具留下的“废弃产物”恰恰是 AI 二次筛查的好素材。调用大模型做二次筛查。把候选区域的序列上下文、预测注释信息丢给模型请它挑出“结构组合异常”的位点。注意这一步要给模型足够的上下文信息而不是只给它一段 DNA 序列。用结构预测验证优先级。对候选蛋白跑 AlphaFold 或 ESMFold看看折叠出来的结构和哪些已知结构域相似再把结果按“全新结构 已知结构域的新组合 已知结构域的突变体”排序。这个流程里AI 不是替代品它的作用是把你从“海量数据里扫雷”的低级劳动里解放出来让你把精力集中在判断和验证上。3.2 用 Claude Code 跑数据分析的真实体验既然热搜里到处都是 Claude Code 相关话题我顺带说说我用它做生信分析的实际体验因为这件事和 AI 辅助发现其实是一脉相承的。Claude Code 本质上是一个能在终端里直接干活的 AI 工程师。你给它一个任务它自己写脚本、跑命令、看报错、改代码整个过程都在终端里。我在处理序列数据的时候会直接让它写提取 CRISPR 特征的脚本速度确实比我手动敲代码快。举一个实际例子我要从一个大型 FASTA 文件里统计所有候选区域的重复单元长度分布我只需要把文件格式说明和任务目标告诉它它几分钟就能给出能跑的代码。但这不是说它没有坑。最典型的坑是它会“一本正经地写出看起来对、实际缺一步”的代码。比如我在处理 GenBank 的 feature 表时它写出的解析代码漏掉了嵌套注释结构导致注释信息丢失了一部分报错还没暴露问题。后来我把大任务拆成几个小步骤让它单独执行每一步结果先人工核对一遍再进下一步这种情况就少了很多。我的建议是Claude Code 适合当“高级助理”用不适合当“全权负责人”用。大任务拆成 5 到 10 个小任务每个小任务都给足上下文最后你只需要审一遍核心逻辑省下的是大量机械性的编码时间。3.3 实验结果之前的三个质量闸门AI 给出的候选最终要上实验台但在此之前必须过三个质量闸门。任何一步没有通过这个候选就只能停留在“数据挖掘结果”层面不能进入实验验证。第一个闸门是数据检查。候选区域是否真的有回文重复序列、间隔序列与前导区CRISPR 的特征是否经得起重新审视如果连基本特征都不成立那就是纯假阳性直接丢弃。第二个闸门是同源检查。把候选蛋白序列拿去跑 BLAST看它跟已知 Cas 蛋白的相似度。如果相似度高于百分之三十那不叫新系统叫新变体只有相似度足够低、或者存在完全不同的结构域组合才配得上“类 CRISPR 新系统”这个标签。第三个闸门是结构检查。用 AlphaFold 等工具预测候选蛋白的三维结构和已知 Cas 蛋白的结构比对。如果预测结果里出现了从未见过的结构域折叠方式这是最理想的状况如果结构高度相似那它大概率只是已知蛋白的远亲。这三个闸门都过了候选才值得拿进湿实验室做功能验证。这套标准并不是我拍脑袋定的它其实就是科研里最基本的“可重复、可验证”要求只不过以前靠审稿人把关现在 AI 时代需要自己提前把关。4. 把 AI 当科研搭子踩坑清单与可复用的避坑方法4.1 大模型不是专家是“会检索的实习生”很多人用 AI 做科研最大的误区是把它当成了“什么都知道的专家”问什么就信什么。这个认知需要修正。大模型的回答本质上是基于训练数据的概率预测。你给它一段序列它说“这可能是 Cas9 同源物”不代表它真的看过这个序列只能说明它的训练材料里存在大量类似序列的特征。它是在做模式匹配不是在用分子生物学知识做推演。这就像你请了一个读过几百万篇文献、但没有任何实验经验的实习生。他能在五分钟内给你列出一个靠谱的文献清单但他没法区分“文献里的说法”和“已经被重复验证的结论”之间的差别。所以跟 AI 协作的正确方式是让它提供线索和假设而不是让它提供结论。4.2 高频翻车场景与现场处置我把实际使用中遇到的高频问题整理成了一张表每个问题都附上处理办法翻车场景具体表现处理办法编造数据库编号AI 给了一个看似合理的 GenBank accession实际不存在所有编号必须回数据库原始页面复核不直接使用生成代码有隐患脚本能跑但大数据量时会内存溢出或死循环先在小数据集上跑通再扩大规模逐步验证混淆同源与功能等价因为序列相似就直接判定功能相同要求它补充系统发育分析看进化关系而非相似度忽略数据版本引用的数据版本过时结果无法复现固定下载脚本版本记录数据获取时间戳上下文丢失多轮对话后它忘了最初的任务限制条件把核心约束写进每轮提示词不让它“自由发挥”这张表里的问题我自己基本都遇到过。最让我印象深刻的是第一个它曾给出一串看起来十分规范的数据库编号我拿去一比发现是它“根据常见格式杜撰”的。从那以后我所有的数据来源都只信官方检索不信任 AI 声称的编号。4.3 怎样给 AI 布置一个“可证伪”的任务科研的核心是提出可证伪的假设。给 AI 布置任务也是一样好的任务设计能让 AI 的输出变成可以验证的命题而不是一堆模糊的描述。举个反例。你问“这个蛋白是什么”AI 大概率给你一段“看起来像核酸酶”的模糊描述这种答案没法验证。但如果你把任务改一下请根据已知 Cas 蛋白的 RuvC 和 HNH 结构域特征逐条检查这个候选蛋白序列列出它与哪些结构域的匹配度最高给出每个关键保守残基的位置列表如果要做点突变验证其是否影响切割活性请推荐排名前三的突变位点并说明理由。这样 AI 输出的就不是结论而是“候选位点 理由 验证方案”的打包材料你可以直接拿到实验台上去试。如果实验结果和 AI 预测一致说明它的推理路径值得信任如果不一致你也能精确定位是哪个环节出了问题。这就是我理解的“可证伪任务”AI 提供的不是一个最终答案而是一个可以被实验推翻或支持的假说包。把任务设计到这个颗粒度AI 辅助科研的效率会明显提升。5. 如果这波发现走向应用真正的受益者是谁5.1 三类应用场景可能最快受益假设这批类 CRISPR 新酶系统最终被验证有功能最先受益的场景不会太远。第一个是基因编辑工具开发。现有工具的三个痛点PAM 序列限制、脱靶效应、大尺寸蛋白难以递送任何一个新酶能解决其中一个就有应用价值。特别是体积小的新酶在体内基因治疗里是很有吸引力的方向因为递送载体容量有限越小的工具越容易进入临床。第二个是分子诊断。基于 CRISPR 的检测工具比如 SHERLOCK 和 DETECTR依赖 Cas 蛋白的特异性切割来实现信号放大。新的 Cas 样蛋白一旦具备 RNA 或 DNA 切割活性就意味着新的识别位点、新的灵敏度和特异性组合诊断窗口会扩大不少。第三个是农业育种。定点编辑、抗病性改良、大片段插入这些需求一直存在但现有工具在不同物种里的效率差异很大。新的酶系统可能是那个“在特定作物里效率更高”的趁手工具。这三个领域有一个共同特点它们都长期被少数几种工具卡着脖子而自然界里天然存在的酶多样性就是突破这些限制的种子库。5.2 再往远处想一步AI 从“发现工具”变成“设计引擎”这次事件让我更在意的一层是AI 的位置正在从“发现工具”慢慢变成“设计引擎”。过去我们找到一个新酶要花很长时间去理解它、改造它让它变得好用。但在 AI 参与之后这条流水线有望被大幅压缩。AI 可以从大自然里找原始的类 CRISPR 系统然后用蛋白质语言模型去预测哪些位点突变能提升活性、降低脱靶再让实验人员去验证优化后的版本。换句话说自然界提供一个起点AI 负责缩短“从起点到可用工具”的旅程。这个判断目前还只能说是合理推测毕竟这次发现的系统功能还没被实验证实AI 设计酶的能力也还在早期。但从 AlphaFold 解决结构预测、到这次 AI 发现新系统方向已经明确AI 在生命科学里的角色会越来越接近一个能提出新东西的参与者而不再只是处理旧数据的工具。5.3 最后说点个人体会看到这条新闻时我想到四个字效率跃迁。我做科研那会儿从数据到假说全靠一本本文献和一遍遍试错。现在一个大模型能在几分钟内给出我可能要翻几个月文献才能想到的候选方向而且它给出的还是“带可验证方案”的完整假说包。这个变化对老一代研究者是压力对新一代研究者则是红利。我想说的是AI 发现类 CRISPR 新酶系统、张锋说值得研究这些都是引子。更值得关注的是一件事所有手里握着数据、之前不知道怎么开展方向的人现在都有了从数据里提出假说的新能力。就算不研究 CRISPR这套“AI 提假说 人做验证”的方法也适用。如果你有兴趣建议不要只看热闹直接拿自己手头的数据试一次。先让 AI 给你找几个“异常点”再亲自去核实每一个。这个过程里你会体验到 AI 是高效的协作者也会意识到它离真正的科学家还差多少个实验验证的距离。

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询