论文题目:Accelerating scientific discovery with Co-Scientist
作者:Gottweis, J., Weng, W.-H., Daryin, A., Tu, T., Sirkovic, P., Myaskovsky, A., et al.
发表期刊:Nature, 2026.7.1
一、研究背景
近年来,科学研究面临明显的“知识广度—专业深度”矛盾。一方面,复杂科学问题往往需要高度专业化的领域知识;另一方面,真正具有突破性的科学假设又常常来自跨学科知识之间的关联发现。随着科学文献数量快速增长、实验技术不断细分,研究人员很难同时完成大规模文献消化、跨领域知识整合、创新假设生成和实验方案设计。因此,如何利用人工智能辅助科学家进行结构化思考、提出可检验的新假设,成为当前 AI for Science 领域的重要问题。Gottweis 等人在 Nature 发表的 Accelerating scientific discovery with Co-Scientist 正是在这一背景下提出的,其目标是构建一个能够辅助科学家进行假设生成、批判、排序、演化和实验验证规划的多智能体系统。
该研究的核心思想是:科学发现并不是线性的“问答过程”,而是一个不断提出假设、查找证据、批判反思、修改方案和实验验证的循环过程。传统大语言模型可以完成文献摘要和知识问答,但在新假设生成、逻辑自洽性评估、实验可行性判断和多方案优选方面仍存在不足。因此,作者提出 Co-Scientist,将 Gemini 大模型作为基础模型,构建由多个专门智能体协同工作的复合式多智能体 AI 系统,用于模拟科学研究中的生成、评审、竞争、演化和元评审过程。
二、基本框架与研究难点
Co-Scientist 的总体框架可以概括为“科学目标输入—多智能体协同推理—假设竞赛与演化—科学家反馈—实验验证”的闭环流程。系统首先接收科学家以自然语言提出的研究目标、约束条件和偏好,然后由 Supervisor agent 对任务进行解析和调度,并将任务分配给不同的专门智能体。系统包含四个关键组成部分:自然语言交互界面、异步任务执行框架、专门智能体集合以及持续上下文记忆。自然语言界面用于科学家定义目标、提供约束和反馈;异步任务框架用于动态分配计算资源;专门智能体负责生成、评审、排序、聚类、演化和总结;上下文记忆则用于存储系统状态和历史推理信息,以支持长时程迭代。图1展示了 Co-Scientist 的总体架构。该系统由监督智能体统筹多个专门智能体,通过假设生成、反思评审、排序竞赛、相似性分析、演化优化和元评审反馈形成闭环式科学推理过程。
在专门智能体设计上,Co-Scientist 主要包括 Generation agent、Reflection agent、Ranking agent、Proximity agent、Evolution agent 和 Meta-review agent。Generation agent 负责基于文献和已有知识生成初始假设;Reflection agent 扮演类似同行评审者的角色,对假设的正确性、质量和新颖性进行批判性审查;Ranking agent 通过 Elo 竞赛机制和成对科学辩论对不同假设进行排序;Proximity agent 计算假设之间的相似性并构建近邻关系图,用于去重和组织研究空间;Evolution agent 对高排名假设进行组合、细化和改进;Meta-review agent 总结评审和竞赛中的共性问题,并将反馈传递给后续迭代过程。
这篇文章面对的研究难点主要有五个。第一,如何让 AI 不只是总结已有文献,而是生成具有新颖性、合理性和可检验性的科学假设。第二,如何降低大语言模型在科学推理中的幻觉问题,使生成内容能够被文献、数据库或专门工具支撑。第三,如何在大量候选假设中进行有效筛选和排序,避免科学家面对过多低质量结果。第四,如何将 AI 生成的假设从“文本推理”推进到真实实验验证。第五,如何保证系统具备安全性和可控性,避免生成不伦理、不安全或无法验证的研究方向。作者将这些难点分别转化为多智能体分工、外部工具检索、深度验证评审、Elo 竞赛排序、科学家在回路和实验验证等技术环节。

Fig. 1 Co-Scientist 的总体设计、多智能体架构和实验验证概览
三、主要内容
文章首先提出 Co-Scientist 的系统架构。该系统不是一个单一 LLM,而是一个基于 Gemini 的多智能体科学推理框架。科学家输入研究目标后,Supervisor agent 生成研究计划配置,并根据任务状态动态调度不同智能体。系统的输出目标包括与研究目标一致、科学上合理、具有新颖性、可实验验证并满足安全约束的研究假设或研究方案。
其次,文章详细介绍了各类智能体的职责和协同关系。Generation agent 通过文献检索、模拟科学辩论、条件推理和研究空间扩展生成候选假设;Reflection agent 通过初步评审、完整评审、深度验证评审、观察评审和模拟评审等方式识别逻辑缺陷、证据不足和潜在错误;Ranking agent 通过 Elo-based tournament 对假设进行成对比较和排序;Evolution agent 对优势假设进行补充、组合、简化和发散式改进;Meta-review agent 则总结系统运行中的共性缺陷,形成下一轮智能体推理的反馈。该机制使 Co-Scientist 形成一种无需反向传播训练的“迭代式自改进”能力,即通过提示反馈和上下文记忆持续提升后续输出质量。
再次,文章从系统评估角度验证了 Co-Scientist 的有效性。作者在 203 个不同科学研究目标上分析了测试时计算量扩展对假设质量的影响,并使用 Elo 评分观察系统在持续推理过程中的输出质量变化。结果显示,随着系统迭代生成、评审和演化,后期假设的平均 Elo 评分和最佳 Elo 评分均呈上升趋势,说明多智能体反馈闭环能够促进假设质量提升。进一步地,作者选取 15 个由生物医学专家设定的复杂研究目标,将 Co-Scientist 与 Gemini、OpenAI o1、OpenAI o3-mini-high、DeepSeek R1 以及专家 best guess 等进行比较,结果显示 Co-Scientist 在迭代后取得更高的 Elo 评价。图2说明 Co-Scientist 的性能提升来自持续的测试时计算扩展。随着生成、评审、排序和演化过程不断推进,系统生成假设的 Elo 评分逐步提高,并在复杂生物医学问题上优于若干基线模型和专家初始假设。

Fig. 2 测试时计算扩展对假设质量的提升作用展示图
最后,文章通过三个生物医学应用进行了端到端验证:急性髓系白血病的药物重定位与联合用药发现、肝纤维化的新型表观遗传靶点发现,以及抗菌药物耐药相关细菌基因转移机制解释。在急性髓系白血病任务中,Co-Scientist 提出了若干候选单药和联合用药方案,并通过体外实验进行了验证;在肝纤维化任务中,系统提出的部分表观遗传调控靶点和对应药物在肝脏类器官实验中表现出抗纤维化作用;在抗菌药物耐药任务中,系统独立提出了 cf-PICIs 可能通过与不同噬菌体尾部相互作用来扩展宿主范围的机制,该结果与研究团队当时尚未发表的实验发现相吻合。图3给出了 Co-Scientist 生成的 AML 单药候选物的体外验证结果,说明该系统不仅能够生成文本形式的科学假设,还能够提出可进入实验验证流程的候选治疗方案。

Fig. 3 AML 单药重定位候选药物的体外验证图
四、创新点
(1)文章提出了面向科学发现的复合式多智能体架构。与传统单模型问答或文献综述工具不同,Co-Scientist 将科学研究过程拆分为生成、评审、排序、聚类、演化和元评审等多个子任务,并由 Supervisor agent 统一调度。这种设计使 AI 系统能够更接近真实科学研究中的多角色协同过程。
(2)文章提出了基于“科学辩论 + Elo 竞赛”的假设优选机制。系统并不是一次性输出答案,而是让多个候选假设在持续竞赛中接受成对比较、科学辩论和质量排序,从而逐步筛选出更具新颖性、合理性和可验证性的研究方向。该机制为多智能体系统中的方案优选和证据竞争提供了一个清晰范式。
(3)文章展示了测试时计算量扩展在科学推理任务中的作用。Co-Scientist 并不只依赖模型参数本身,而是通过更多轮次的生成、评审、检索、辩论和演化来提升输出质量。换言之,该系统将“推理过程”本身作为性能提升的重要来源,为复杂科研任务中的长时程智能体推理提供了实证支持。
(4)文章强调科学家在回路的协同机制。Co-Scientist 不是完全自主的“AI 科学家”,而是允许科学家通过自然语言定义目标、加入约束、调整研究方向、提供反馈并决定实验验证优先级。这一点对于高风险、高不确定性的科学任务尤为关键,也说明多智能体 AI 更适合作为科研增强工具,而不是替代专家判断。
(5)文章完成了从算法框架到实验验证的闭环。许多多智能体或 LLM 科研系统停留在文本生成和自动评价层面,而该研究进一步将 AI 生成的假设用于真实生物医学实验,并在药物重定位、肝纤维化靶点发现和抗菌药物耐药机制解释中进行了验证。这使文章的贡献不仅是提出一种多智能体架构,更是展示了其在实际科学发现流程中的应用潜力。
结语
这篇文章核心贡献在于将大模型组织成一个具有任务分解、异步调度、证据检索、同行评审式反思、竞赛排序、持续演化和专家反馈能力的多智能体系统。该研究表明,多智能体 AI 可以作为一种“结构化科学思维引擎”,帮助研究人员从海量知识中提出更具新颖性、可解释性和可验证性的研究假设。
同时,文章也指出了该类系统仍然存在明显局限,包括底层模型可能产生事实错误或幻觉,实验验证规模仍然有限,评价指标仍需更加客观,系统可能带来研究方向同质化风险,并且必须依赖严格的同行评审、安全约束和人类专家判断。因而,Co-Scientist 更适合作为科学家的增强型协作工具,而不是独立完成科学发现的替代系统。对于数字孪生、智能运维、PHM 或复杂工程系统研究而言,该文最值得借鉴的是其“监督智能体统筹、多专门智能体分工、候选方案竞赛演化、证据驱动验证、人在回路反馈”的总体方法论。