软件交付生命周期公司Harness希望将智能体纳入应用代码所经历的同一管道与管控流程,以改变目前阻碍智能体落地部署的现状。

根据2026年Gartner首席信息官与技术高管调查,目前仅有17%的企业完成了AI智能体的实际部署。

本周,Harness正式发布AI智能体开发生命周期(Agent DLC)服务,让开发者能够以与应用代码相同的治理规范、测试流程和安全标准来交付AI智能体。

Harness高级副总裁兼总经理Trevor Stuart向The New Stack表示,让智能体在演示环境中正常运行并不难,但要判断它在生产环境中的实际表现,则是另一个截然不同的问题。

"智能体所产生的攻击面更大,且具有动态性,"Stuart说道,"这让企业对将其部署到生产环境心存顾虑。迫使智能体始终停留在预生产或沙箱环境中,结果在技术上算是成功,但在实际应用中毫无价值。"

他进一步强调,将任何内容交付至生产环境的前提,是确保质量与严谨性能够在真实负载下经受住考验。因此,在智能体场景中,最难的部分在于——当相同的输入每次可能产生不同的输出时,如何维持质量标准。

应用代码具有确定性,开发者可以对同一代码运行两次相同的测试,并每次获得相同的可预期结果。而智能体显然有其自身的运作逻辑。智能体的底层语言模型决定如何完成任务,因此同一个智能体在接收相同输入时,每次运行可能选择不同的工具或采取不同的行动。

一次通过的测试并不能保证下次也会通过。问题也变得难以复现,这意味着传统的缺陷发现与修复方案同样无法直接套用。

在这些核心挑战面前,要将确定性的交付管控应用于非确定性决策的AI智能体,难度确实相当大。

"不要试图让智能体变得可预测,而是要让围绕它的管道变得可预测,"Stuart解释道,"回顾持续交付的一贯做法,我们关注的是在代码发布前测试是否通过。现在,我们以同样的方式来看待质量门禁和评估分数:从正确性、安全性和性能三个维度对响应进行评级,然后将该分数直接接入管道,作为通过/不通过的判定门禁。"

Stuart表示,这才是真正的突破所在——Harness正在将确定性机制与治理规范引入一个面对非确定性输出的流程。他坦承,至少在近期内,我们无法让智能体的输出具备可复现性。

"我们能够复现的,是已发生事件的完整记录:每一次模型调用、每一次工具调用、每一个执行步骤,全部被捕获,"Stuart补充道,"正是这份记录,让工程师能够真正对智能体进行调优,以获得更好的结果,而非靠猜测。"

他解释说,这意味着不能仅仅在发布前执行评估,还需要在智能体上线运行期间持续进行测试与迭代,让开发者能够快速做出调整,并通过真实使用情况观察变更效果,持续优化,从而不断推动智能体向更好的用户体验演进。

前文提及的不断扩大的攻击面,根源在于智能体会连接工具和API、派生子智能体,并从其调用的每个模型中继承信任关系。Stuart及其团队指出,静态扫描从未针对这类风险而设计。Harness现在推出五项新产品与能力,覆盖测试、部署、运营和治理等环节,致力于弥合这一差距。

Harness AI Evals让智能体质量变得可量化,允许团队定义评估数据集、配置评分函数,并设置质量门禁,在智能体或模型发生变更时自动捕获回归问题。Harness Agent Deployments将Harness已应用于Kubernetes部署的金丝雀发布、审批机制和OPA策略守卫,延伸至托管智能体运行时环境。

此外,Harness还推出了AI Configs,用于支持在运行时对提示词和模型变更进行发布与管理;AI资产目录则自动发现组织代码仓库中构建的每一个智能体、技能和插件,并为每项资产关联负责人,确保没有任何内容在无人追踪的情况下上线或运行;Harness AgentTrace负责记录单次智能体运行及完整多步骤会话中发生的一切,展示智能体的执行路径、延迟瓶颈,以及不同模型或提示词对结果的影响。

Harness还将开源AgentTrace背后的基础组件,包括harness-sdk和harness-evals,让开发者能够将相同的追踪原语引入自己的AI应用。

这一切是否意味着开发者现在可以更快速、更有把握地推进智能体部署?从可量化效果的角度来看,软件工程师采用临时试点方案测试智能体,与使用Harness平台全套工具来监管整个Agent DLC管道,两者之间究竟存在怎样的取舍?

"这里没有完美的数据,所以我不会给你一个漂亮的美元数字,"Stuart坦诚道,"但我们从自己发布的《2026年工程卓越状况报告》中确实了解到,开发者每天近三分之一(31%)的时间投入在AI相关工作上,而这些工作在任何指标中都没有体现;94%的工程负责人承认,技术债务、验证时间和职业倦怠等问题根本没有被纳入他们的跟踪范畴。"

Stuart描述的管道转型,其核心是将智能体及其底层技术视为一种服务。

"这正是AI资产目录的设计理念,"Stuart总结道,"没有一个凌驾于一切之上的单一治理角色。归属权在资产创建的那一刻就已绑定,并始终可追溯至对应的负责人。此外,每个人都能发现组织内已经构建了什么,从而减少重复劳动和不必要的蔓延。"

2026年6月,Harness推出了自主工作者智能体产品,使团队能够在软件交付管道内构建和运行AI智能体。工作者智能体作为受治理的步骤在管道内运行,受到Harness已应用于每次部署的相同管控措施的覆盖。Agent DLC则将同样的上下文与治理规范延伸至智能体的完整生命周期。

目前已适用于组织代码的管道、策略、审批流程和存证机制,如今同样适用于其智能体——评估门禁、部署审批和安全检查均作为单一管道中的阶段运行,从智能体创建之初,贯穿其后续的一切活动。

Q&A

Q1:Harness的Agent DLC是什么?它解决了什么问题?

A:Harness Agent DLC是一项AI智能体开发生命周期服务,旨在让开发者用与应用代码相同的治理规范、测试流程和安全标准来交付AI智能体。它主要解决了智能体因输出结果不确定、难以复现,导致企业不敢将其部署到生产环境这一核心难题,通过构建可预测的交付管道来应对智能体本身的非确定性。

Q2:智能体部署为什么这么难?

A:智能体的底层语言模型会自主决定如何完成任务,导致同一输入每次可能产生不同输出,测试结果无法复现,传统缺陷修复方案失效。此外,智能体连接工具、API并派生子智能体,导致攻击面大幅扩展且具有动态性,传统静态扫描无法应对这类安全风险,企业因此普遍不敢将智能体推向生产环境。

Q3:Harness AgentTrace具体能记录哪些信息?

A:Harness AgentTrace可以记录单次智能体运行及完整多步骤会话中的所有细节,包括每一次模型调用、每一次工具调用、每一个执行步骤,以及智能体的执行路径、延迟瓶颈,还有不同模型或提示词对最终结果的影响。这份完整记录能帮助工程师精准调优,而非依赖猜测。

The New Stack