构建一个优秀的AI智能体,不只是选对模型那么简单。围绕模型的架构——即"执行框架"(Harness)——同样至关重要。它决定了上下文如何渲染、动作如何执行、状态如何管理,以及任务何时结束。仅凭执行框架的设计差异,就能在基准测试结果上带来两位数的波动,并在Token成本上产生显著差距,而底层模型完全相同。

NVIDIA实验室推出的面向对象智能体框架NOOA(NVIDIA Labs Object-Oriented Agents),正是基于这一洞察构建的开源研究预览版本。它包含一套Python框架、内存系统、能力测试模块,以及附带完整代码、数据和评估结果的基准智能体,供社区复现、验证和二次开发。

统一架构:智能体即Python类

智能体开发历来需要协调多个分散的组件,包括提示词模板、工具模式定义、回调代码和工作流图谱。NOOA采用了更简洁的方式:一个智能体就是一个Python类。它的方法即能力,它的字段即状态,它的文档字符串即提示词,它的类型注解即强制约束。方法体为省略号(…)的标准Python方法,将在运行时由大语言模型驱动的循环来补全;方法体正常的方法则作为普通的确定性Python代码执行。

这一设计的核心优势在于:智能体开发回归到传统软件开发模式。智能体可以进行差异比较、代码审查、单元测试、链路追踪、版本管理和重构——无论是人工操作还是AI编程智能体辅助,使用的都是现有代码库中早已熟悉的工具。

六大核心能力设计

NOOA架构识别出六项驱动智能体性能的模型接口设计理念:

类型化输入/输出:智能体调用具有类型化参数和经过验证的返回值,而非自由文本。

引用传递:模型操作的是实时Python对象,查看的是有界预览,而非序列化数据转储。

代码即动作:模型通过编写Python代码来执行操作,支持控制流和内联方法调用。

可编程循环工程:编排循环是普通Python代码,开发者和模型均可编写。

显式对象状态:持久化的类型化状态存储在智能体对象上,而非仅存在于对话历史中。

模型可调用的框架API:上下文块和事件历史均以API形式开放,供模型检查和管理。

长期记忆子系统

NOOA包含一套长期记忆子系统。它并非自动运行的后台摘要管道,而是一个由智能体通过模型可调用工具主动维护的存储库——智能体会在工作过程中有意识地写入、查询和修正记录,同时与当前轮次相关的自发性记忆也会自动浮现到上下文中。记录携带类型、重要性和标签信息。"支持""矛盾""派生自"等类型化关系将记录连接成知识图谱,而非平铺的日志。后台反思机制会对存储进行整合,合并重复项、关联相关记录、将情节提炼为洞察,并清理不再相关的信息。

智能体可以跨会话积累知识,无需重新训练。所有内容持久化存储在一个人类可读的SQLite文件中,团队可通过标准方式进行检查、备份和审查。存储的记忆可引用实时智能体状态,保持知识的时效性。多个智能体可共享同一存储库,同时保留各自的所有权。在后续的ARC-AGI-3评估中,该记忆系统相比基于文件笔记的同款智能体,将RHAE指标提升了11.8个百分点。

跨领域基准测试表现

六大能力在多个不同领域均可量化验证,相同的通用接口实现了领先水平的结果:

软件工程方面,在SWE-bench Verified上,NOOA搭配GPT-5.5达到82.2%,超过提交时公开排行榜最优水平(79.2%);搭配Opus 4.6达到79.8%,所用智能体仅253行代码,无任何针对该基准的专项提示词。

网络安全方面,在CyberGym L1上,NOOA搭配GPT-5.5解决了86.8%的任务,跻身得分最高的开源智能体之列,领先大多数主流闭源系统。测试在屏蔽网络访问的条件下运行,并对每条轨迹启用了基于规则的"作弊检测",因此结果来源于对代码本身的推理,而非查询已披露漏洞,且未使用任何网络安全专项引导。

通用推理方面,在ARC-AGI-3上,单个NOOA智能体搭配GPT-5.5达到50.2%的平均RHAE(技能模块:比假设驱动基线高+8.5分;记忆模块:比基于文件笔记高+11.8分);搭配GPT-5.6-sol达到85.1%,每局成本约13.3美元,在低于20美元每局的成本约束下全面推进了该基准的分数-成本帕累托前沿。

执行框架带来的效率提升

执行框架工程不仅提升准确率,还能提升效率。在SWE-bench Verified上,NOOA搭配GPT-5.5以每任务29次大语言模型调用、约110万Token的消耗达到82.2%。对比框架需要66次调用和220万Token才能达到78.2%,或29次调用和130万Token达到78.6%。NOOA以相当甚至更低的成本,取得了同等乃至更优的结果。

两项机制推动了这一效果:

其一是引用传递:工具返回结果以实时Python变量的形式在代码中直接组合,而非以文本形式在上下文窗口中往返传递。模型看到的是类型化的有界预览,完整值保留在执行环境中。

其二,正是这一特性使NOOA无需在前沿模型上进行上下文压缩即可解决SWE-Bench:中位会话的提示词Token峰值为2.2万至7.2万,而模型窗口为20万至40万。由于NOOA通过引用传递工具结果而非将其序列化写入上下文窗口,转录记录在整个会话中保持追加写入且缓存有效,无需摘要处理,预填充缓存命中率在整个任务过程中持续累积。

ARC-AGI-3:未知游戏中的世界建模

ARC-AGI-3将智能体置于一个未知的网格游戏中,规则、目标和操作方式需要通过行动来探索发现。NOOA示例是配套DreamTeam架构(原有六个专业智能体协同围绕共享可执行世界模型)的单智能体移植版,缩减为一个智能体和一个45行的技能模块。游戏运行于独立的框架进程中,通过追加写入文件交换状态与动作。

该技能指导智能体将世界模型构建为工作空间中的一组Python程序,用于编码观测状态并预测下一状态。每轮智能体进行"逆向验证"——将其预测与实际发生的情况进行对比——并在出现偏差时修正其模型和假设。

在两小时时限的竞赛模式下,GPT-5.5集群达到50.2%平均RHAE,世界建模技能相比假设驱动基线贡献了+8.5分,记忆子系统相比基于文件笔记贡献了+11.8分。GPT-5.6-sol集群达到85.1%,每局成本约13.3美元,25局中有19局全部解决,推进了该基准的分数-成本帕累托前沿。两个集群的每局成本均控制在20美元以内。

集群在分层沙盒机制下运行——包括进程内单元守卫、每次运行的操作系统权限降级、游戏身份端到端匿名化,以及内核强制执行的每单元沙盒。对两个集群的红队审计(GPT-5.5实时运行进行了18轮审查,GPT-5.6-sol运行进行了9扫描器审计)在任何规则上均未发现泄露(分别检查了13,335条和10,107条日志)。用于生产部署时,NOOA与NVIDIA OpenShell安全运行时配套使用。

网络安全:漏洞验证工作流

漏洞发现是对智能体框架的严苛考验。智能体必须在大型代码库中找到候选漏洞,然后通过生成能够触发崩溃的输入来证明漏洞真实存在。验证步骤毫无容错空间——崩溃必须是正确的那个,且必须可复现,否则发现毫无价值。NOOA能让此类工作流的构建更加简便:确定性检查与模型推理共存于一个类型化对象上,因此每个验证步骤都以强制代码形式运行,而非以模型可能遵循也可能不遵循的提示词指令形式存在。

在NVIDIA近期的内部研究中,验证流水线被实现为单个NOOA对象。模型编写并运行Python代码来调用智能体自身的方法,将探索过程和检查逻辑集中在一处,而非通过固定的工具菜单进行路由。其中三个方法作为确定性门控:第一个将验证器的原始输出转化为明确的"崩溃/未崩溃"判定;第二个确认崩溃与已报告的漏洞相匹配;第三个重新运行输入以验证可复现性。由于这些门控是普通的类型化方法,而非在独立进程间传递的自由格式文本,只有当代码明确判定通过时,发现才会被接受,整个运行过程形成单一可检查、可测试的追踪链路。

在CyberGym L1(真实漏洞再发现基准)上,NOOA增强的研究框架使用通用模型且无网络访问,解决了86.8%的任务。

开源贡献与未来展望

智能体生态系统已通过在编排、工具、记忆、模型接口和评估等方面的广泛贡献快速演进。NOOA是对这一进程的贡献:以面向对象智能体框架形式呈现的开源执行框架研究,在软件工程、网络安全和推理基准上达到了业界最先进的水平。NVIDIA将框架、测试、基准智能体和评估方法全部公开发布。

开源实现的重要性在于:团队可以审视其方法,而非盲目信任。基于透明、类型化、可检查的智能体,配以单一存储库中的人类可读状态、可查询的事件历史和标准接口,团队可以在现有安全审查、访问控制和可观测性实践的基础上持续构建。

NOOA以开放的实验性接口形式提供,而非现有框架的替代品。报告中的技术均已详细记录,任何项目都可采用、挑战或改进这些方法。

Q&A

Q1:NOOA框架和普通智能体框架相比,有哪些核心差异?

A:NOOA最大的不同在于将智能体设计为一个Python类,方法即能力、字段即状态、文档字符串即提示词。它提出了六大核心能力:类型化输入输出、引用传递、代码即动作、可编程循环、显式对象状态和模型可调用API。相比传统框架需要协调提示词模板、工具模式和工作流图谱,NOOA让智能体开发回归标准软件开发模式,支持代码审查、单元测试和版本管理。

Q2:NOOA在SWE-bench和ARC-AGI-3等基准上的成绩是怎么做到的?

A:在SWE-bench Verified上,NOOA搭配GPT-5.5达到82.2%,超过当时排行榜最优水平79.2%,且每任务仅用29次大语言模型调用和约110万Token,成本约为对比框架的一半。在ARC-AGI-3上,搭配GPT-5.6-sol达到85.1%,每局成本约13.3美元。关键在于引用传递机制避免了大量Token消耗,以及世界建模技能和长期记忆子系统的协同作用。

Q3:NOOA的长期记忆系统是如何工作的?

A:NOOA的记忆系统不是自动后台摘要,而是智能体主动维护的知识库。智能体通过模型可调用工具有意识地写入、查询和修正记录,相关记忆也会自动浮现到当前上下文中。记录之间通过"支持""矛盾""派生自"等关系构成知识图谱,后台反思机制会合并重复、提炼洞察并清理过时信息。所有数据存储在单一SQLite文件中,人类可读,多个智能体可共享同一存储库。

NVIDIA