约950个Claude Agent在21小时里找到“类CRISPR”新系统,但它能做什么仍是谜

Anthropic宣布,其新建的分子生物学团队让Claude自主检索19亿个蛋白质簇,从约20万个逆转录酶中筛出一种此前未被描述的组合:逆转录酶、相邻伙伴基因和一串规则重复的非编码DNA共同构成“阵列相关逆转录酶”(ART)。约950个Agent会话在21.5小时内消耗2.156亿Token,最终由一个Agent直接阅读原始DNA时发现异常重复结构。人类实验进一步确认,这些重复序列会被转录成多种短RNA。不过,Claude发现的不是一种已被证明可用的基因编辑工具:逆转录酶本身过去已有记录,ART的生物学功能、酶是否活跃、短RNA是否为其底物均未确定,论文也尚未同行评审。真正值得关注的,是通用AI第一次在大规模基因组数据中自主改变调查方向、识别异常并提出可供湿实验验证的研究线索。

文章作者、来源:Anthropic

Claude找到的不是一条全新蛋白质,而是一套被忽视的组合

ART存在于噬菌体——感染细菌的病毒——的基因组中,由三部分组成:一个逆转录酶、旁边的伙伴基因,以及一长串间距相对规则的DNA重复序列。

逆转录酶负责以RNA为模板合成DNA。ART中的这类酶并非第一次被发现,早期研究已经记录过相关序列;Claude的新发现,是这些酶旁边反复出现的非编码DNA阵列和功能未知的伙伴蛋白。换句话说,它没有设计一种新酶,而是从已有自然序列中识别出了此前没有被当作完整系统理解的结构关系。

这种重复阵列令人联想到CRISPR:CRISPR也利用重复序列与其间保存的信息产生向导RNA,使相关酶能够识别特定目标。但ART附近没有典型的Cas基因,现有实验也没有证明它能够切割、复制、粘贴或编辑特定DNA。因此,“类CRISPR”目前只是对结构特征和潜在机制的类比,不是已经成立的功能结论。

一次21.5小时、2.156亿Token的自主搜索

研究人员最初只给Claude一份高层任务说明:在庞大的DNA数据库中寻找值得研究的新型逆转录酶系统。

随后,基于Claude Mythos 5的Agent自行拆解任务、检索文献、调用生物信息学工具、比较基因组邻域,并建立后续子任务。技术报告记录了119项任务、949个Agent会话和2.156亿Token,总墙钟时间为21.5小时;整个计算搜索阶段没有人类中途干预。

搜索范围覆盖约19亿个蛋白质簇。Agent收集了超过20万个逆转录酶簇,评估3564个可能反复与它们共同出现的伙伴蛋白家族,最终形成19份供人类审阅的候选报告。Anthropic官网将后两项取整表述为“约3500个候选系统和20个重点候选”。

ART并不是沿着最初假设直接找到的。负责该分支的Agent先考察一个可能的伙伴基因,随后认为该基因并非专门与逆转录酶配合。它没有结束调查,而是转向阅读逆转录酶上游的原始DNA,继而发现肉眼可见的串联重复。

Agent随后计算重复单元的数量和间距,比较已知逆转录酶系统,检索此前文献,并撰写报告交给人类研究者。这种能够在否定原假设后主动更换问题的行为,是此次工作的关键,而不仅仅是高速运行一套预先写好的序列匹配程序。

湿实验确认了“阵列会产生RNA”,但尚未确认功能

人类研究人员随后检查Claude提交的候选,并完成全部实际实验。初步结果显示,ART阵列确实会被转录成一组彼此分离的短RNA,而不是没有生物意义的随机重复。

预印本还分析了一项已有的葡萄球菌噬菌体感染数据:ART重复序列产生了三种长度约为165、201和166个核苷酸的RNA;在感染约15分钟时,这些RNA最多约占噬菌体RNA的8%。

这项证据说明该阵列会被细胞读取,因而更可能属于一个真实运作的生物系统。但它仍没有回答几个最重要的问题:ART逆转录酶是否真正具有活性、这些短RNA是否是其底物、伙伴蛋白是否与酶直接协作,以及整个系统究竟帮助噬菌体完成什么任务。

即使未来确认ART具有可编程性,从发现机制到开发成基因编辑或治疗工具,也还需要酶活性、靶向规则、准确率、细胞毒性和递送方式等多轮验证。

这项“发现”目前并不能稳定复现

预印本披露了一个非常重要的限制:研究团队用相似设置重新运行了十次搜索,没有一次再次找到ART。问题不在于模型看不懂重复序列,而在于自主Agent没有再次选择读取足够长的上游DNA,因此从未看到完整阵列。

当研究人员直接把有关DNA片段交给较强模型时,模型在至少90%的测试中能够描述重复结构;把任务重新放回带文件和工具的Agent环境后,成功率最低降至约32%。

这表明,模型的局部识别能力与完整科研Agent的可靠性是两件事。ART的发现包含真实的自主判断,但也具有明显偶然性:如果当时那个Agent没有打开正确文件、读取正确区段并决定继续深挖,这条线索可能仍会被遗漏。

因此,现阶段更现实的做法不是让一次Agent运行替代科学流程,而是并行运行大量探索者,再由审阅Agent、人类专家和可重复实验逐层淘汰错误假设。

人类并没有退出科研流程

Anthropic将计算搜索描述为高度自主,但人类仍决定了研究领域、初始任务、数据库和工具环境,也负责判断哪些报告值得测试。所有湿实验均由人类科学家执行。

Anthropic还表示,Claude产生候选假设的速度已经快到需要反过来研究“哪些提案具有科学品味”。团队会比较被保留和被放弃的报告,再把总结出的判断标准写回后续提示词,使Agent更接近专家选择课题的方式。

这是一种人机分工:Agent负责在超出个人阅读能力的数据规模中寻找异常、追踪支线和整理证据;人类负责选题、实验、因果判断、安全边界和最终结论。

CRISPR先驱Feng Zhang在审阅预印本后认为,逆转录酶旁出现RNA重复阵列“确实耐人寻味,值得进一步研究”。他的评价肯定的是研究线索,而不是确认ART已经成为新的基因编辑工具。

Anthropic正式把模型接进自己的实验室

ART也是Anthropic新生命科学研究组和湾区分子生物学实验室公开的首项成果。该实验室只进行BSL‑1和BSL‑2级别工作,不处理能够感染人类的病原体,实体实验全部由人类完成。

这项布局表明,前沿模型公司正在从“向科学家提供聊天和代码工具”,转向自行建立模型、数据分析与湿实验之间的闭环。模型可以批量提出远多于人类能够测试的假设,真正的瓶颈随之转向实验资源、验证设计和如何判断哪些候选值得投入。

ART最终可能只是一个有趣但用途有限的噬菌体系统,也可能揭示一种新的核酸处理机制。现有证据尚不足以判断两者中的哪一种。但即使ART本身没有发展成实用工具,这项工作仍展示了AI在科学发现中的一个具体角色:不是凭空生成答案,而是在海量已有数据中注意到人类尚未赋予意义的异常结构。