950个AI智能体跑了21小时,从DNA数据库里挖出全新酶系统

首页 / AI资讯 / AI4S

0:00
0:00
1x
定时

Anthropic的生命科学研究组用Claude完成了一次自主科学发现。研究人员让模型直接搜索海量DNA序列数据库,结果找到了一套此前被生物学界忽略的酶系统,命名为阵列关联反转录酶,英文缩写为ART。这次搜索动用了约950个并行智能体,连续运行21小时,累计消耗约2.1亿词元。与常见的辅助写作或代码生成不同,这次模型的角色是主动搜索者:它需要自己判断在哪里找、找什么、以及哪些信号值得深挖。

950个智能体跑了21小时

这项工作的规模值得拆开看。950个智能体并行运行,意味着任务被切分成大量可以同时处理的子问题,而不是由单一模型顺序推进。21小时的连续运行与2.1亿词元的消耗,则说明搜索过程涉及反复的读取、比对与筛选。这种工作方式接近真实科研中的文献筛查与假设验证循环,只是把执行速度提升到人力无法达到的量级。

把并行规模与运行时间放在一起,能看出这类自主研究与传统生物信息学工具的区别。传统流程依赖研究者预先设定好筛选条件与比对规则,工具的产出范围被输入条件严格限定;而智能体驱动的方式允许模型在搜索过程中调整关注点,把偶然发现的异常模式作为新的线索继续追踪。ART的发现路径正是如此:模型在噬菌体序列中注意到一个不寻常的反转录酶,它旁边还伴随一个类似CRISPR的重复阵列和一个辅助蛋白,这三个元素的空间邻近关系构成了后续分析的关键线索。

效率提升的另一个参照来自同期的工具优化工作。Anthropic报告称,Claude在不到四周内优化了30多个开源的结构预测、蛋白质设计与基因组学工具,平均提速约4倍,其中包括把原本需要多卡的折叠任务压缩到单个GPU节点完成,相关代码已经开源。把工具变快与把发现变自动化叠加起来,才是这类工作真正的产能来源。

发现的是什么,为什么值得关注

反转录酶是一类能把RNA逆转录为DNA的酶,在分子生物学与基因编辑工具开发中具有基础地位。CRISPR系统之所以能成为通用工具,关键就在于它由核酸酶与向导RNA组合,能够精确定位并切割目标序列。ART的特殊之处在于,它把反转录酶与类似CRISPR的重复阵列放在同一个基因邻域中,这种组合在功能上可能意味着某种新的靶向机制。

需要注意的是,目前确认的是发现本身,而不是功能机制。研究组明确表示,这套系统的具体功能仍在研究中,因此他们把预印本公开,邀请更广泛的科学界参与验证与讨论。麻省理工学院的张锋在看过材料后表示这一发现确实引人关注,但同样没有给出功能层面的结论。对科学传播而言,这一区分很重要:一个被识别出的基因元件与一个被验证的分子工具之间,通常还隔着数年实验工作。

即便如此,这项发现仍有明确的现实意义。基因编辑工具的开发长期依赖对天然系统的挖掘,CRISPR本身的产业化路径就是从细菌免疫系统中被发现、改造并最终成为工具。随着测序数据总量呈指数增长,人工逐一筛查已不可能覆盖,把搜索工作交给可以长时间运行的智能体,为工具发现提供了一条可扩展的路径。ART的价值在于它提供了一种新的候选结构,而不是已经可用的产品。

把ART放回反转录酶的家族谱系里,能看出它的独特之处不在单个结构,而在组合方式。常见的反转录酶多与转座子或病毒元件相伴,功能指向基因组的插入与复制;ART则与重复阵列和辅助蛋白相邻,这种搭配更接近一套定向识别的装置。如果后续实验能证实它的靶向机制,它有可能成为继CRISPR之后又一类可被改造的基因操作工具,而这条路径的关键仍然是把天然元件变成可控的分子机器。

科研范式的变化与边界

这次发现是AI在生命科学领域角色变化的又一个样本。过去一年,模型在分子设计环节的表现提升明显:有研究显示,由模型自主设计的蛋白质在16个靶点中成功命中14个,在1320个经过可靠测试的设计里有354个真实结合靶点,整体命中率26.8%,显著高于传统方法约10%的水平。设计端的效率提升,把产业瓶颈推到了验证端,也就是湿实验中快速获得反馈的能力。国内外的蛋白交付与合成企业因此成为这轮需求增长的实际受益者。

药企的动作也在印证这一趋势。9月以来,多家跨国药企加快了AI合作:有企业采用通用模型辅助研发,有企业把内部平台与蛋白交付供应商对接,也有企业与合成生物学公司、抗体设计公司签订合作。与此同时,OpenAI的基金会宣布投入超过1.25亿美元资助那些单一机构难以承担的健康数据集建设,覆盖小分子在体内的代谢基准、失败药物项目的监管文件保存,以及个性化癌症疫苗所需的数据。这些投入解决的是模型训练最缺的原料问题。

边界同样清晰。自主搜索能扩大候选范围,但无法替代实验验证,ART的功能未知就是最直接的例子。智能体的搜索质量依赖训练数据与工具接口的质量,如果数据库本身存在偏倚,模型只会更快地放大这种偏倚。此外,2.1亿词元的消耗意味着这类工作有明确的成本门槛,短期内更适合高价值、可验证的靶点筛选,而不是无差别的全库扫描。可以观察的是,这种智能体驱动的发现方式能否从个别案例变成可重复的流程,以及它产出的候选列表能否持续通过实验检验。

素材来源:Anthropic官网、FutureTools、AI/TLDR、The Neuron 发布时间:2026-09-24