随着大语言模型能力的不断提升,其应用场景已经从编程辅助扩展至能够独立完成端到端科学研究工作流的智能体。近年来涌现出的多个系统(如Sakana的AI Scientist、AutoResearchClaw、DeepScientist、AI-Researcher等)已具备文献综述、假设构建、实验执行和论文撰写等完整能力,其生成的论文质量已接近人类水准。然而,随着AI生成论文在表面质量上的持续提升,一个深层次的结构性问题逐渐浮出水面——可验证性。由于现有自主科研流程以迭代方式生成文本,任何环节引入的错误都会被不断放大。部分系统会产生不存在的引用文献、方法描述与实际代码之间存在错位,以及实验结果无法从所提供代码中完整复现等问题。

为解决上述问题,研究团队在最新发布的论文中提出了"证据链"(Chain-of-Evidence,简称CoE)这一全新的AI科研可验证性框架,并据此构建了Science One框架和CoE审计协议。实验结果表明,基线系统的幻觉引用率高达21%,且存在大量代码与文本不一致的问题;而Science One框架在实现零幻觉引用和完全可验证实验结果的同时,在MLE-Bench、Parameter-Golf等前沿基准测试上取得了业界领先的表现。

证据链框架的核心理念

CoE是一套定义研究产出可信度标准的概念框架,其作用类似于ACID对数据库事务可靠性的定义。该框架并不规定如何构建科研智能体,而是明确规定其产出必须满足的属性,并遵循一条包含两个层面的核心原则:研究产出中的每一项声明都必须附有完整的证据链(完整性),且每条证据链必须真正支持其所对应的声明(正确性)。这里的"声明"可以是参考文献、报告数据、方法描述或研究结论,它们都必须能够追溯至相应的证据来源,例如同行评审论文、实验日志、实际运行的代码或结果数据表等。

幻觉引用指向并不存在的论文;无法复现的分数在代码重新运行后无法再次出现;方法描述失当则指论文中声称采用了某种算法,而代码中实现的却是另一种。上述每一种情况都意味着某项声明与其证据之间的关联链条已断裂,而CoE审计协议正是为了量化这类断裂而设计的。

Science One框架的设计思路

为证明可验证的AI科研不必以牺牲问题解决能力为代价,研究团队设计了Science One框架。与此前那些先生成论文、再尝试事后关联事实的智能体不同,Science One框架通过三个核心模块从架构层面原生实现了CoE框架:

问题调研器(Problem Investigator)通过检索PDF文件实现文献的有据可查;发现模块(Discovery Module)负责探索并评估解决方案;论文撰写与验证模块(Paper Writing & Verification Module)负责论文撰写,并通过内置的声明验证器(Claim Verifier)确保所有声明均与其证据来源相符。

CoE审计协议与评估结果

为了对Science One框架与业界前沿基线系统(如Sakana AI的AI Scientist v2、AutoResearchClaw、DeepScientist、AI-Researcher等)进行严格评估,研究团队专门开发了CoE审计协议。该事后评估协议充当自动化取证审查员的角色,对生成的产出物(论文、解决方案、代码和参考文献)执行四项严格的完整性检查。

研究团队将CoE审计协议应用于来自自动化科研系统设计(ADRS)基准测试中五项系统优化任务(Prism、Cloudcast、EPLB、LLM-SQL和事务调度)所生成的75篇论文。结果显示,Science One框架在可验证性方面显著优于所有基线系统,在全部四项完整性检查中均位居首位。

其参考文献无一为幻觉引用,每篇引文均指向真实可检索的论文,而基线系统的幻觉引用率则高达21%。这是因为问题调研器通过检索而非凭借记忆生成参考文献。Science One框架还实现了完美的分数验证效果,以及最高的方法与代码一致性。相比之下,基线系统频繁出现论文中描述了复杂算法(如"混合神经符号求解器"),但提交的代码实际上只是简单确定性启发式方法的情况。

值得强调的是,严格的可验证性约束并未损害该智能体的科研能力。Science One框架在全部五项ADRS任务上均达到或超越了人类专家水准,并在其中两项任务(Cloudcast和EPLB)上取得了所有系统中的最高综合得分。此外,研究团队还将Science One框架部署于六项高难度外部任务上,进一步验证了其泛化能力。

结语

随着自主科研系统不断向更高难度的科学问题发起挑战,单纯的求解质量将不再是区分各系统的核心指标,研究产出是否值得信赖才是关键所在。本研究的发现表明,可验证性必须被视为一项首要的架构约束。通过在声明产生之时即构建证据链,而非事后补救,Science One框架证明了AI智能体完全能够产出严谨、可信且极具竞争力的科学研究成果。研究团队希望证据链框架及其审计协议能够为社区构建下一代AI科学家提供有价值的工具与参考。

特别感谢Bhavana Dalvi Mishra、Jiefeng Chen、Chun-Liang Li、Palash Goyal、Mihir Parmar、Yiwen Song、Yale Song、Raj Sinha、Parthasarathy Ranganathan、Burak Gokturk和Jinsung Yoon为本研究所作出的重要贡献。

注:Science One框架目前为实验性研究原型,尚未达到生产环境部署标准。

Q&A

Q1:证据链(CoE)框架和CoE审计协议是什么,能解决什么问题?

A:证据链(CoE)框架是一套定义AI科研产出可信度标准的概念框架,要求研究产出中的每项声明都必须附有完整且真实的证据链。CoE审计协议则是一套自动化评估工具,通过对论文、代码、参考文献等产出物执行四项完整性检查,量化AI生成论文中幻觉引用、数据无法复现、方法与代码不一致等问题,使研究产出的可靠性得以被客观衡量。

Q2:Science One框架相比其他AI科研系统有哪些优势?

A:Science One框架原生集成了证据链框架,通过问题调研器、发现模块和论文撰写与验证模块三大核心组件,在产生每项声明的同时即构建证据链。评测结果显示,其幻觉引用率为零,而基线系统高达21%;同时实现了完美的分数验证和最高的方法与代码一致性。在ADRS基准测试的五项任务中,Science One框架均达到或超越人类专家水准。

Q3:Science One框架目前可以直接用于实际科研工作吗?

A:目前还不能直接用于实际生产环境。Science One框架目前定位为实验性研究原型,尚未达到生产环境部署标准。其主要价值在于验证"可验证AI科研"这一方向的可行性,并为社区构建下一代AI科学家提供方法论参考和技术基础。

Google