Claude 发现的 ART:考验的是可复现的 AI 科学,而不是又一个 CRISPR
Anthropic 首次公开的生物学研究显示,AI 代理能够从基因组数据中发现被忽略的模式;但它也提出了更难的问题:其他团队能否稳定复现这一发现,并证明系统究竟做了什么?
Anthropic 新生命科学团队首次公开的成果,很容易被一句话说偏。Claude 代理搜索了大规模 DNA 序列集合,注意到逆转录酶周围一种此前未被完整描述的排列,并帮助研究人员识别出他们称为阵列相关逆转录酶系统(array-associated reverse transcriptase system,简称 ART)的结构。该结构包含一组很长的 DNA 重复序列,外观上类似 CRISPR 的某个特征。

这确实值得关注。但它并不意味着 Claude 已经产生了一种新的基因编辑疗法,甚至不能证明 ART 具备有用的编辑功能。Anthropic 表示,该系统的主要功能仍然未知。更值得讨论的是 AI 辅助发现的结构:模型可以找到人类此前没有描述的候选对象,但成果的价值取决于搜索能否重复、观察能否核验,以及生物学功能能否通过实验建立。
对于正在考虑 AI 科学工具的研究人员和企业,实际启示很直接:应当评估完整的发现流程,而不只是模型提出醒目假设的能力。昂贵的瓶颈或许会从寻找候选对象,转移到判断哪些候选对象值得投入湿实验室时间。
Anthropic 说 Claude 找到了什么
这项工作始于一次针对异常逆转录酶实例的广泛计算搜索。逆转录酶是一类能够把 RNA 复制成 DNA 的酶。分子生物学家早已熟悉这一酶类,但基因组数据库中仍有海量特征不明的蛋白质及其邻近 DNA 序列。难点不只是识别一个已知家族,而是发现某个熟悉成分以不寻常的方式排列,从而可能指向另一种生物系统。
根据 Anthropic 的公告,这次研究大约使用了 950 次代理会话,持续约 21 小时,消耗约 2.1 亿个 token。代理搜索蛋白质和 DNA 数据,把逆转录酶家族拆分成不同群组,检查邻近基因,并生成报告供人类审阅。最终,一名代理查看了一个异常逆转录酶旁边的原始 DNA,注意到了一组串联重复阵列。
这个候选系统主要出现在噬菌体中,也就是感染细菌的病毒。Anthropic 描述了三个相互关联的特征:一个逆转录酶基因、一个相邻的辅助基因,以及一组间隔均匀的非编码 DNA 长重复阵列。公司将这类系统称为阵列相关逆转录酶,简称 ART。早期实验发现,该阵列会被转录成多个短 RNA,但研究人员尚未确定这些 RNA 的作用,也没有确定它们是否是逆转录酶的底物。
因此,与 CRISPR 的比较属于结构层面,而不是功能层面。CRISPR 系统能够利用引导序列和相关蛋白,对核酸执行可编程操作。ART 在逆转录酶附近拥有重复阵列,这使它值得研究;但这并不意味着 ART 可编程、能够切割 DNA、能够编辑基因组,或可以被改造成医疗工具。Anthropic 自己的公告明确承认了这种不确定性,技术报告的措辞则更加谨慎。
公告还表示,底层逆转录酶曾出现在早期研究中,而相关阵列和辅助基因此前没有被识别为一个连贯系统。这一区分很重要。AI 的贡献未必是从零发明了一种分子,而是从已有序列数据中发现并解释了一种此前没有以这种形式描述过的关系。
这是一名候选者,不是完成的发现
科学发现经常被压缩成一个动词:找到。实际上,这个词里藏着多个不同成就。一个系统可能先是在数据库中被发现,被标记为异常,被提出为新家族,在实验室中表达,证明具备活性,确定生物学功能,最后才成为可靠工具。这些阶段所需的时间可能完全不同。
ART 报告似乎确立了其中的早期阶段。研究人员识别出一种反复出现的基因组排列,并收集证据,说明它是一个连贯家族,而不是孤立的注释错误。他们还开展了初步实验室工作,考察其表达情况。但他们尚未证明逆转录酶会在相关过程中发挥活性,短 RNA 会引导它,或该系统会执行对生物技术有用的操作。
这不是对研究的批评。早期生物学发现之所以有价值,正是因为它们会打开新的问题。但区分不同阶段,可以避免读者得出夸大的结论。一个此前未被完整描述的系统可能揭示噬菌体生物学的重要信息,却最终永远不会成为基因编辑平台。许多天然分子系统很有意思,但并不一定是实用工具。
“类 CRISPR”这个说法也需要谨慎。CRISPR 最初也是作为重复序列模式被识别出来的,后来才逐渐理解其生物学作用。这个历史类比解释了 ART 的模式为何值得关注,却不能预言结果。外观相似的排列可能来自不同机制;重复阵列的功能还取决于序列、结构、相关蛋白、表达情况和细胞环境。
Anthropic 的技术报告据称指出,ART 位点附近没有 cas 基因,而且其间隔序列呈现出不同于许多 CRISPR 系统间隔序列的保守模式。这些观察让类比更受限制,却没有降低其趣味性。它们提示,该阵列可能代表一种独立机制,而不是隐藏的传统 CRISPR 系统。同时,这也进一步说明,在讨论应用之前,必须先完成功能实验。
最重要的数字不是 950 次代理会话
这次行动的规模确实醒目:数百次代理会话、数十亿个被考察的序列簇,以及数亿个 token。但计算规模不等于发现可靠性。一个研究系统真正有用,是因为它能在有记录的条件下,以足够高的稳定性反复产生有意义的结果,让其他研究人员能够信任这套流程。
对技术报告的一份详细独立分析指出了一个很有说明力的测试。原始行动之后,作者用相同的大致流程又运行了十次。据称,ART 阵列在十次重跑中一次都没有被发现,尽管其中一些重跑触及了相关的逆转录酶谱系。这并不能推翻最初的观察,却表明该结果对搜索路径非常敏感。
这类似于“至少通过一次”和“持续通过”的差别。代理可能因为某个工作者选择把一长段原始序列载入上下文,而在一次运行中发现有价值的异常;另一次运行则可能总结或跳过同一区域。如果发现依赖这种上下文选择上的偶然性,那么模型的识别能力只是系统的一部分。搜索框架、文件工具、上下文预算、路由策略和后续规则同样重要。
据称,Anthropic 后续测试发现,当相关序列直接放入上下文时,能力更强的模型更常识别出重复阵列;当相同信息只能通过文件和工具取得时,表现会下降,部分原因是代理经常没有读取足够长的连续序列。这揭示了一个具体的工程问题:代理可能能够识别模式,却不可靠地决定应该检查哪些原始数据。
对于 AI 科学团队,这是一项有用的设计要求。基准测试至少应区分三个问题:
- 当相关证据直接展示时,模型能否识别已知模式?
- 在大型数据集中,代理能否检索或暴露这些证据?
- 完整流程能否以可复现的频率发现真正的新候选对象?
在第一个问题上表现出色的系统,仍可能在第二个问题上失败。第三个问题偶尔成功的系统或许适合探索性工作,但如果没有报告分母,就不应被描述为可靠的自主科学家。
为什么上下文工程对科学很重要
在软件工作中,代理通常可以通过运行构建或测试套件来检验一个改动。在生物学中,证据更加分散。相关信息可能分布在序列数据库、注释、文献、结构预测、样本元数据和实验室测量中。模型可以生成一份措辞流畅的解释,却悄悄没有检查最重要的原始输入。
ART 案例展示了这个问题的一种形式。关键观察来自一名直接查看连续 DNA 区域的代理,而不是只依赖注释或摘要。这不是无关紧要的界面细节,而是科学方法的一部分。一个要求代理搜索数据库,却没有保留原始序列、坐标、来源和精确转换步骤的流程,可能产生难以审计的结论。
因此,实用的 AI 生物学流程应当让证据如何移动变得可见。每个候选对象都应保留来源标识符、实际检查过的序列或数据切片、所应用的转换、使用过的工具、模型版本,以及促成下一步跟进的理由。摘要适合分流,却不能替代底层证据。
代理还应被要求区分观察和解释。“这里有十四个大致重复的片段,它们由处于某一范围内的间隔隔开”是一种观察。“这是一个可编程防御系统”则是一种解释。前者可以对照序列检查,后者需要更多生物学证据。把两者写进同一段叙述,会让推测性结果显得比实际更确定。
好的系统还应主动生成相互竞争的解释。一个看似重复的结构可能来自组装伪影、污染、测序错误、移动遗传元件、以另一名称描述过的已知系统,或大规模搜索空间造成的巧合。在把候选对象排入实验室工作之前,代理应主动寻找这些可能性。一份只为新颖性辩护的报告像营销材料;有用的科学报告还要解释为什么明显的替代解释不成立。
人类研究人员仍然贡献什么
Anthropic 描述的搜索行动在最初确定方向后无需人类介入地运行,但这并不意味着发现独立于人类专业知识。人类选择了研究问题,设计了运行框架,挑选数据,设定安全边界,审阅输出,决定哪些候选者值得实验,并解释实验室结果。这些选择决定了代理能看到什么,也决定了什么会被算作有前景的异常。
人类贡献不是脚注,而是实验设计本身。有人必须判断逆转录酶是一个值得切入的入口,认为邻近基因值得比较,决定异常的上游 DNA 应当跟进,并让候选系统接受实验室测试。模型提供的是一种可扩展的搜索和假设生成层,嵌入这一设计之中。
这种分工在一段时间内很可能仍然实用。AI 系统擅长反复扫描规模庞大而杂乱的语料库,连接相距很远的文献,生成候选分类,并撰写结构化报告。人类科学家仍负责选择有意义的问题,判断生物学合理性,设定安全边界,选择实验,并决定结果是否改变了研究领域。最有价值的系统会让这种协作更可追溯,而不是用“AI 发现了”这句话把它隐藏起来。
措辞也关系到署名和可复现性。更准确的说法是:Anthropic 研究团队使用 Claude 代理识别并分析了一种此前未被描述的基因组排列,随后进行了初步实验室表征。这样的表述既承认模型实际完成的计算贡献,也保留研究人员的作用,以及功能尚未确定这一事实。
评估 AI 辅助发现的实用清单
评估科学代理的组织,应当要求工作流层面的证据。单纯的模型基准不够,因为科学工作是一条由检索、分析、排序、实验和解释组成的链条。下面这些问题,比醒目的 token 总量更有信息量。
1. 成功的单位究竟是什么?
成功是指正确注释、发现新候选对象、找到可复现的关联、验证机制,还是得到有用干预?这些是不同的产品。一个为基因组挖掘设计的系统可能非常擅长寻找候选对象,却无法证明其功能。评估应当测量买方真正需要的流程环节。
2. 系统多频繁地找到同一个结果?
用相同数据反复运行行动,并记录哪些地方发生变化。报告运行次数和成功发现次数。如果只有一次运行成功,就明确写出来。一次罕见但价值很高的发现仍可能值得成本,但组织需要知道自己购买的是可靠仪器,还是一张附带详尽报告的彩票。
3. 另一支团队能否重建这条路径?
系统应保存提示词、工具调用、来源记录、序列坐标、中间文件、模型标识符和时间戳。如果核心证据只存在于私有对话日志中,外部研究人员就难以核验结果。事后发布一份最终叙述,并不能实现可复现。
4. 评分者是否独立?
模型生成的报告经常由同一家族的另一个模型评分。这对分流可能有用,却不能替代独立科学审查。评估应包含人类专家、可行时的外部数据,以及在结果揭晓前就设计好的测试。否则,系统可能只是因为贴合创建者后来写出的解释而得到奖励。
5. 代理是否检查了原始证据?
流程应记录代理是否真的读取了其结论所依赖的序列、图像、光谱或数据表。仅仅引用文件名或重复注释不能算作检查。在许多领域,强制结构化证据检查,可能比换用更大的模型更能提高可靠性。
6. 模型出错时会发生什么?
系统需要一条拒绝路径。候选对象应当可以以“证据不足”“已知系统”或“很可能是伪影”结束。一个只奖励新颖性、却不惩罚假阳性的流程,会向研究人员倾倒大量听起来合理的故事,消耗本就有限的实验室能力。
成本、隐私与运转摩擦
ART 行动还说明,用 token 价格估算 AI 科学成本是不完整的。报告中的 2.1 亿个 token 只是计算输入。一个真实项目还必须承担数据存储、序列搜索基础设施、工具执行、模型重试、专家审阅、实验材料、设备时间、生物安全流程,以及科学家调查低质量候选对象的机会成本。即使计算搜索相对便宜,实验室阶段也可能占据主要账单。
大量使用 token 的代理群组还会让成本难以预测。主管代理可能在工作者发现异常后开启更多任务,一项长期调查也可能分叉成许多并行会话。团队应当为每次行动、每个候选对象和每一层后续调查设置预算。当系统探索大规模搜索空间时,停止规则尤其重要:更多代理可以产生更多假设,却不一定产生更多经过验证的知识。
隐私和数据权利同样需要重视。基因组数据可能包含专有序列、与患者关联的信息、未发表研究,或受机构协议约束的材料。把原始数据发送给托管模型,可能带来保留、访问、训练和司法管辖问题。负责任的部署应记录哪些数据离开组织、保留多久、哪些子处理者能够访问,以及模型提供商能否将其用于改进。
数据来源既是隐私问题,也是科学质量问题。如果序列来自受限数据库,团队必须确认有权把它用于外部模型流程,并分享生成的报告。如果代理通过连接器获取公共信息,这些连接器也应执行与研究人员账户相同的权限。方便的科学助手不应意外变成数据外泄通道。
供应商锁定是另一项现实风险。如果代理的完整行动逻辑、记录、注释和排序方法都只存在于某个专有界面中,迁移到另一种模型会很困难。团队应导出机器可读记录,并保留与模型无关的数据表示和评估任务。即使工作流已经高度专业化,也应让模型可以被替换。
现在谁适合尝试
AI 辅助发现最适合已经拥有明确科学问题、高质量数据、领域专业知识和候选验证途径的团队。挖掘大规模序列集合的研究团队,可能受益于能够分流基因邻域、比较文献并准备候选报告的代理。收益更可能来自扩大一个小团队可以检查的证据数量,而不是取消科学家的必要性。
对于只有“寻找突破”这类模糊目标、缺少实验室或外部验证能力,或者无法保存可复现审计轨迹的组织,这种方法就不那么合适。这些团队或许会得到吸引人的假设,却没有可靠方式区分有意义的异常与数据库伪影。它们应先从更窄的信息检索任务开始,在部署自主分叉流程前建立评估纪律。
同样的建议也适用于生物学以外的研究。在材料科学、化学、医学和气候建模中,代理可以加快搜索并提出联系,但结果在通过独立核验前仍然只是暂定结论。一个无法展示自己使用了哪些证据的系统,不应被用于影响实验、患者、安全或昂贵采购的决定。
下一项里程碑是可重复性
Anthropic 的 ART 结果值得关注,是因为它展示了通用 AI 在生物研究中的一种合理角色:不是按需发明一项完成的技术,而是注意到人类团队可能没有时间检查的数据关系。这是一种有意义的能力。它或许能帮助研究人员探索被忽视的蛋白质家族,把基因组环境与文献联系起来,并优先安排原本可能隐形的实验。
这项结果也为下一步设定了清晰标准。研究人员需要确定 ART 是否具有活性、其 RNA 做什么、该系统分布多广,以及它表面上的 CRISPR 相似性是否具有功能意义。AI 科学团队则需要报告重跑成功率、假阳性、证据访问情况、独立审查,以及人类决策的确切作用。
在此之前,最稳妥但仍然有用的解读是:Claude 从一次大规模搜索中帮助识别出一个有前景的生物学假设,而人类已经开始检验它。这已经是研究自动化的一项实际进步,但还不是新的 CRISPR。两种说法之间的差距,正是科学结论和工作流价值最终要由什么决定的地方。
来源
本文依据所给主要文章及其列出的材料改写,包括 Anthropic 关于 Claude 发现带有类 CRISPR 重复序列的新型酶系统的公告;Anthropic 技术报告《Autonomous AI agents discover reverse transcriptases with tandem repeat arrays》;Gautam Parab 对十一轮行动中仅一轮发现 ART 系统的分析;Hacker News 相关讨论;Nature 关于新型可编程 DNA 重组酶的背景文章;以及 arXiv 关于 AI 驱动科学发现中验证必要性的研究。
Comments
Sign in to comment.
No comments yet.