近年来,编程AI智能体正逐步成为长周期机器学习工作流的实际执行者。它们能够检查代码仓库、配置运行环境、解决构建问题、启动实验、监控执行过程、分析指标并汇总结果。

对于强化学习(RL)研究而言,这一能力尤为重要——有意义的指标往往只有在核心实验基础设施就绪后才会显现。Autoresearch是由Andrej Karpathy发起的一个开源Python项目,专为自动化AI与机器学习模型训练而设计。

在这一框架下,自主AI智能体将高层目标转化为研究假设,对真实代码库进行编辑与测试,保留能够改善指标的方案,并将结果反馈给人类研究员。这使团队能够以高性能开放模型(如NVIDIA Nemotron)为起点,构建专业领域智能体,再通过针对可量化领域任务的强化学习加以优化,同时保持对数据、知识产权、部署方式及训练流程的完全掌控。

本文将介绍如何运行一套轻量级、无需用户编写代码的、基于技能的自动化研究工作流。该工作流在NVIDIA NeMo RL与NVIDIA NeMo Gym上,借助NVIDIA Brev GPU实例,使用前沿编程智能体(搭载GPT 5.5的Codex)进行了测试。

该工作流展示了以下三项智能体能力:

全栈自主性:完成软件栈搭建、依赖解析、GPU内存与磁盘空间及检查点管理、实验启动、运行监控与问题调试。

目标驱动的自动化研究:对基线进行性能分析,提出或跟进研究假设,启动实验,分析指标,并持续迭代以逼近研究目标。

论文到代码的转化:阅读论文,制定实现方案,将算法转化为代码,添加测试,并启动验证训练。

在本文所展示的示例中,Codex首先为视觉语言模型(VLM)强化学习训练的冒烟测试搭建了完整的NeMo RL与NeMo Gym技术栈;随后从零开始构思并创建了一个全新的NeMo Gym视觉计数环境,并对Qwen3-VL-2B-Instruct模型进行训练,使其在该任务上的准确率从25.0%提升至96.9%;最后,Codex从一篇研究论文中实现了一种离策略强化学习算法,并启动了长达10小时的验证训练。

自动化研究的目标并非将研究员排除在外,而是将重复性的搭建与迭代工作交由智能体处理。研究员仍然负责设定目标、审查里程碑、把控策略方向,并做出最终决策。

NeMo RL与NeMo Gym简介

NeMo RL与NeMo Gym均为开源库,同属NVIDIA NeMo框架。NeMo RL基于AutoModel、Megatron-Bridge与vLLM构建,用于大语言模型和VLM的后训练,由Ray进行编排,支持GRPO、DPO、SFT及奖励模型训练等工作流,采用配方驱动的配置方式,可从小规模验证运行扩展至分布式训练。NeMo Gym则提供模型与任务交互、接收奖励并通过实时生成的经验进行学习的环境。

NeMo RL与NeMo Gym共同为智能体主导的强化学习研究提供了实用基础。智能体可在同一代码仓库中检查训练配方、接入新环境、运行基线、调整训练参数并对比结果。

智能体技能设计

搭载GPT 5.5的Codex具备强大的推理、代码导航与工具调用能力,但它并不会自动了解每个本地操作规范——例如检查点应存放在哪里、哪些指标具有权威性,或在长时间会话、上下文压缩或断线后如何恢复任务目标。

为此,本文还引入了三项互补的智能体技能:

Brev规范:针对NVIDIA Brev GPU实例的操作指南。它负责保持代码仓库整洁,将检查点、缓存等大型文件存储至指定卷,并安全处理密钥信息。

会话记忆:面向长周期工作的持久化会话日志。它记录总体目标、子任务、已加载技能、重要文件、决策过程、进度状态及交接说明。

自动化研究:实验循环管理。它保存用户目标,建立基线,为每个假设创建分支,在实验台账中记录尝试,监控停止规则,并将结果汇总供人工审查。

这些技能充当结构化、可复用的工作流指令,将操作上下文与机构知识编码其中,使智能体能够更具可重复性地执行研究循环。

环境配置

本次演示使用以下配置:

Visual Studio Code

搭载GPT 5.5模型的Codex插件

配备一块NVIDIA L40S 48 GB GPU的Brev实例

NeMo RL代码仓库(通过Brev可启动项预克隆至/home/ubuntu/RL目录)

Hugging Face与Weights & Biases凭证(如工作流需要经过身份验证的模型、数据集或日志访问)

以下各节将依次验证三项智能体能力:首先搭建机器环境并验证技术栈;其次运行目标驱动的自动化研究任务;最后利用相同的智能体工作流实现一篇研究论文并启动更长周期的验证训练。

第一步:全栈自主性验证

本节演示智能体自主管理完整硬件与软件栈的能力。在启动自动化研究循环之前,首先需要验证机器、代码仓库、依赖项、模型访问权限及训练循环能否端到端正常运行。这一环境验证是后续长周期智能体研究运行的基础。

使用NeMo-RL Autoresearch可启动项,启动一个配备单块NVIDIA L40S 48 GB GPU的Brev实例。

在Windows系统上,打开SSH配置文件(通常位于C:\Users\<YOUR_USER_NAME>\.ssh\config),添加以下内容:

Host Brev-Ubuntu

HostName <BREV_IP_ADDRESS>

User ubuntu

IdentityFile C:/Users/<YOUR_USER_NAME>/.brev/brev.pem

BREV_IP_ADDRESS可在Brev实例页面顶部找到。在VS Code中,选择"连接到主机"并选择已配置的主机名(如Brev-Ubuntu)。在macOS和Linux系统上,Brev密钥通常位于~/.brev/brev.pem,SSH配置方式类似。

在VS Code中,打开/home/ubuntu/RL目录下的NeMo RL项目。然后从VS Code扩展市场安装Codex IDE扩展。安装完成后,Codex将出现在聊天窗口中,使用API密钥或ChatGPT账号登录即可。

Codex支持多种权限模式:默认模式、自动审查模式和完全访问模式。对于本工作流,自动审查模式是合理的起点——它允许Codex在沙箱中运行命令,同时对高权限操作进行审查。完全访问模式对实例拥有更广泛的控制权,仅在对安全设置充分了解的情况下使用。

在/home/ubuntu/RL目录下打开VS Code终端。如有需要,创建.env文件存储凭证:

export WANDB_API_KEY=wandb_v1xxx

export HF_TOKEN=hf_mqyyy

建议先熟悉Brev环境,例如输入df -h查看虚拟实例的存储配置。

接下来,提示Codex搭建NeMo RL并运行小规模强化学习训练冒烟测试:

/goal Use the nemo-rl-brev-etiquette skill under `./skills`, set up NemoRL to do a smoke test RL training of the Qwen3-VL-2B-Instruct model

/goal命令为Codex设定一个持续性目标。在本次运行中,Codex应完成以下工作:加载Brev操作技能、初始化缺失的NeMo RL子模块、从Hugging Face下载Qwen3-VL模型、将Hugging Face、Torch、Triton、uv、Ray、日志及工作缓存等大型资源路由至/ephemeral目录,并解决依赖或配置问题,直至完成一个训练步骤。

整个过程大约需要40分钟至1小时。目标并非最优化的NeMo RL配置,而是验证从代码仓库搭建、模型访问、依赖解析到训练执行的完整端到端路径。

技术栈验证完成后,使用以下提示词持久化当前配置状态:

Now use the nemo-rl-session-memory skill under `./skills`, persist this setup information

若遭遇网络断线或VS Code重启,可通过以下提示词加载最新会话:

Use the nemo-rl-session-memory skill under `./skills`, load the latest session, and provide me with a summary

这将为Codex提供之前的目标、环境假设、已加载技能、重要路径及近期命令执行结果,以便继续工作。

第二步:目标驱动的自动化研究

技术栈验证完成后,下一步是从环境搭建转向目标驱动的研究任务。在这一模式下,人类提供目标与预算,Codex负责管理整个循环:基线建立、假设提出、实验执行、指标分析与结果汇总。

在启动研究任务之前,先让Codex实现一个新的强化学习环境。以下示例将创建一个面向VLM的视觉计数任务:

/goal Now using the Nemo gym circle click environment as a reference, implement a new Gym environment named "star count", that teaches a model to count the number of stars of different colors on a canvas of different resolutions. Show me several examples

该环境将生成包含不同颜色星星的图像,画布分辨率各异,并要求模型按颜色统计星星数量。

接下来,使用以下提示词启动一个有时间限制的研究任务:

/goal Now use the nemo-rl-autoresearch and nemo-rl-session-memory skill under `./skills`, start a new auto research session, goal: Train the Qwen3-VL-2B-Instruct model to high accuracy, using SFT algorithm on the star count gym environment. Start with profiling the model out of the box accuracy. Time budget: 5h

提示词需包含目标、方法、任务环境、基线要求与时间预算。自动化研究技能将据此制定包含可量化停止规则和实验台账的研究计划。

在本次运行中,Codex将star count环境合成生成的数据接入NeMo RL的SFT训练路径。之所以选用SFT,是因为此前的自动化研究会话发现GRPO在该任务上无法提升准确率,而Codex提出的SFT方案后来被证明行之有效。

在一次实验中,Codex在不到一小时内取得了最佳结果。以下是提示Codex提供简要总结后的最终报告:

star_count SFT任务使用LoRA SFT方法,在新的NeMo Gym视觉计数环境上对Qwen/Qwen3-VL-2B-Instruct进行了训练。我们首先在固定的64个样本保留评估集上对模型进行了开箱即用的性能分析,初始精确准确率为25.0%,平均奖励为0.705208。完成环境搭建、数据生成、评估器与SFT配方配置后,首次LoRA冒烟运行将准确率提升至78.125%。扩大SFT数据量和训练步数带来了主要增益:2048训练/256验证、160步的运行达到了95.3125%的精确准确率;最佳的4096训练/512验证、320步运行达到了96.875%的精确准确率,平均奖励为0.992188。最佳检查点为step_240,其在部分得分奖励上略优于最终检查点,精确准确率持平。总体而言,准确率从25.0%提升至96.875%,提升幅度达71.875个百分点。剩余错误并非格式问题,而是对单个颜色的计数出现了接近正确答案的偏差,这表明下一步最有价值的改进方向是针对密集或视觉模糊场景进行有针对性的难例数据增强。

这正是智能体主导的研究循环的核心价值所在:Codex并非只执行了一条命令,而是完成了基线性能分析、环境与数据路径构建、验证实验运行、数据与训练步数扩展、检查点评估、错误分析,并为人工审查提出了合理的下一步研究方向。

第三步:论文到代码的转化

论文到代码的转化是由OpenAI PaperBench率先提出的理念,旨在自动实现论文中的研究思路。Codex能够读取论文、推导实现方案、编写并测试代码,然后启动训练,从而加速这一过程。

本示例的目标论文为《大语言模型可通过离策略强化学习学会推理》。该论文提出了一种基于最优优势的带滞后推理策略优化方法(OAPL),这是一种长滞后离策略强化学习方法。OAPL并不将训练-推理策略之间的不匹配视为需要消除的缺陷,而是将滞后生成策略纳入目标函数,从而在训练模型与生成模型存在较大差异时仍能实现稳定高效的训练。

这是一个很好的测试案例,因为它既需要算法实现,也需要系统层面的判断:损失计算方式发生了变化,长滞后设置也影响了训练与生成的协调方式。

综合提示词如下:

/goal Start a new session with nemo-rl-session-memory skill under `./skills`. First, read this paper https://arxiv.org/abs/2602.19362 in pdf format, form a plan then implement it. Write and run unit tests to satisfaction. Write document. Then start a new autoresearch session with the nemo-rl-autoresearch skill, train a Qwen3-1.7B model with this algorithm on the DAPO-math-17K dataset. Time budget: 10h

Codex将该请求分解为以下阶段:

阅读PDF文档;提取算法;检查NeMo RL的钩子接入点;制定实现方案;将算法转化为代码;添加单元测试;编写文档;在DAPO-math-17K数据集上启动Qwen3-1.7B模型的验证训练任务。

这一提示词的要求较高。在实际操作中,更稳妥的工作流是分阶段推进:先让Codex完成阅读与规划并经人工审查,再批准实现、文档编写与单元测试,最后才启动较长周期的自动化研究验证任务。

额外的验证手段包括:自洽性检验(让Codex在不同分支上对算法进行两次独立实现并对比决策),或智能体交叉验证(由另一个前沿编程智能体对论文、实现、测试与结果进行审查)。

实验结果

图3展示了OAPL算法与GRPO变体DAPO在Qwen3-1.7B模型和DAPO-math-17K数据集上的训练进度对比。

在本次运行中,OAPL以更少的训练步数达到了更高的准确率,与论文关于有效长滞后离策略训练的核心主张相符。右侧面板还显示,OAPL使用的Token数量明显多于DAPO,这自然引出了一个后续研究问题:为何OAPL会产生更多输出,以及哪些算法改进能够在不牺牲准确率的前提下促进输出简洁性?

注意事项与最佳实践

尽管前沿智能体的能力日益强大,仍有若干失效模式值得关注:

上下文漂移:长时间会话可能经历多次上下文压缩。若缺乏持久化记忆,智能体可能遗忘目标、已加载技能或停止规则。

本地文件管理:日志、检查点、数据集和缓存可能散落在文件系统各处,除非明确规定了机器专属的操作规范。

方向漂移:运行过程中的指令调整虽然有用,但后续追问有时会打乱自动化研究会话的节奏,导致提前终止。

低信号循环:Codex有时会陷入无效的试验循环,例如仅训练极少步数或使用极小批次,无法提供足够的学习信号。人类研究员应能轻易识别这种低效行为并及时纠偏。

在构建和测试NeMo RL与NeMo Gym自动化研究技能的过程中,我们总结了以下几条实用经验:

将自动化研究技能视为持续演进的工作流指令。Codex可协助随时间推移更新这些技能,以反映机构惯例、最佳实践和历次运行的经验教训。

尽管Codex能力出众且乐于协助,但面对复杂的研究问题,人类的指导与判断仍然至关重要。

在启动长周期自动化研究执行阶段之前,进行明确的头脑风暴与规划过程,有助于在执行前验证研究思路。

可以将Codex视为一位能力出众的实习生或初级同事。这意味着人类研究员不必对每一行实现代码都保持深入了解,但仍需通过适当的方法对工作成果进行验证,以确保对研究质量有充分把握。

在启动长周期自动化研究会话之前,设定明确的预算约束,例如时间限制、GPU小时预算或最大实验次数。这有助于智能体聚焦于最高价值的假设,避免过于宽泛的实验扫描。

结语

智能体并非要取代研究员,而是支持一种高效的分工协作模式。智能体承担大量搭建、调试、日志记录和实验循环工作,同时提供洞察与下一步建议;研究员则负责定义目标、提供领域判断、把控研究方向,并决定哪些结果具有实际意义。

借助NeMo RL、NeMo Gym、Brev、Codex以及一套精简的操作技能,研究团队可以大幅减少在环境搭建、问题调试和重复实验执行上耗费的时间与算力,从而将更多精力投入到决策层面:哪些实验值得运行,以及如何解读实验结果。

Q&A

Q1:NeMo RL和NeMo Gym分别是什么,有什么区别?

A:NeMo RL和NeMo Gym都是NVIDIA NeMo框架下的开源库。NeMo RL基于AutoModel、Megatron-Bridge和vLLM构建,用于大语言模型和VLM的后训练,支持GRPO、DPO、SFT等工作流,由Ray编排,可从小规模验证扩展至分布式训练。NeMo Gym则提供模型与任务交互的环境,模型可在其中接收奖励并通过实时生成的经验进行学习。两者结合为智能体主导的强化学习研究提供了完整基础。

Q2:自动化研究工作流中,智能体会完全替代人类研究员吗?

A:不会。自动化研究的目标是将重复性的搭建与迭代工作交由智能体处理,而非将研究员排除在外。研究员仍然负责设定目标、审查里程碑、把控策略方向并做出最终决策。智能体承担环境搭建、调试、日志记录和实验循环等工作,研究员则专注于判断哪些实验值得运行以及如何解读结果,两者形成高效的分工协作。

Q3:使用Codex运行自动化研究时,有哪些常见的失效模式需要注意?

A:主要有四类失效模式需要警惕:一是上下文漂移,长时间会话经历多次上下文压缩后,智能体可能遗忘目标或停止规则;二是本地文件管理混乱,日志、检查点等文件可能散落在文件系统各处;三是方向漂移,运行中的追问有时会打乱研究节奏导致提前终止;四是低信号循环,智能体可能陷入仅训练极少步数或使用极小批次的无效循环,需要人工及时识别并纠偏。

NVIDIA