随着企业不断将AI智能体和智能体应用推向生产环境,AWS表示传统的可观测性和监控工具——包括其自身的CloudWatch服务——将难以解释智能体为何会表现出特定行为。
CloudWatch通过AWS管理控制台使用指标、日志和追踪功能,跨账户、区域和服务监控应用程序与基础设施,但AWS表示这只能呈现部分画面。要理解智能体的行为,开发人员和运维团队需要在多个工具之间切换,包括通过Amazon Bedrock AgentCore提供的智能体专用可观测性和评估工具、应用性能监控工具,以及CloudWatch中的基础设施监控工具。
AWS正试图通过推出一款名为CloudWatch Omni的新非控制台体验来消除这种碎片化问题,该工具以应用为中心,将智能体、应用程序和基础设施的遥测数据整合在一起,帮助企业在具体场景中调查和理解智能体的行为。
这意味着开发人员和运维团队可以从正在调查的应用程序入手,而不必在各个AWS资源和监控控制台之间来回切换,这家云计算巨头在介绍CloudWatch Omni的博客文章中写道。
该公司表示,这款新工具能够自动发现应用拓扑结构,展示各组件之间的连接方式,从而让开发人员和运维团队无需任何手动设置,即可立即使用自然语言或SQL查询遥测数据。
据介绍,这些自然语言查询由一个AI助手提供支持,该助手在内置的AWS DevOps Agent协助下处理发现和引导式调查工作,能够自动关联数据并识别跨智能体、应用程序和基础设施的根本原因。
这种以应用为中心的方法也改变了团队开始使用Omni的方式。
AWS表示,对于现有的CloudWatch客户而言,迁移到Omni无需重新配置现有的遥测数据,因为已发送到CloudWatch的日志、指标和追踪数据可以通过统一数据存储在Omni中直接使用,从而实现跨信号类型的关联分析。现有的插桩代码、仪表盘和告警设置也都会延续到新环境中。
对于初次使用CloudWatch和Omni的团队而言,企业需要通过OpenTelemetry协议(OTLP)端点导入遥测数据,并在CloudWatch Omni中为某个应用程序创建一个“空间”,随后系统会自动发现该应用的拓扑结构,并开始呈现其依赖关系和健康状态信号。
AWS表示,Omni发布之初即支持多种智能体开发框架,使团队能够将基于LangGraph、CrewAI、OpenAI Agents SDK、Vercel AI SDK和AWS Strands构建的智能体纳入同一套可观测性体系中。
这家云计算巨头还补充说,Omni同样支持独立的评估工具,允许团队将现有的智能体评估工作流引入Omni,包括Braintrust、DeepEval和Ragas。
企业还可以选择自己想要使用的Omni界面类型:运维团队可以访问非控制台的网页体验,而开发人员则可以通过适用于VS Code、Kiro和Cursor的原生扩展在Omni中查看智能体追踪信息。该公司表示,这些扩展还可用于在本地运行和追踪智能体,本地开发无需AWS账户。
分析人士表示,能够直接通过开发环境访问Omni,加上其以应用为中心的方法,应该能够消除开发人员在调查智能体行为时面临的日常摩擦,从而提高工作效率。这对首席信息官(CIO)而言也有好处。
HyperFrame Research的AI技术栈研究主管斯蒂芬妮·沃尔特表示:“借助Omni,CIO可以获得跨智能体、应用程序和基础设施的统一操作视图,从而减少工具碎片化问题。”
HFS Research执行研究主管阿希什·查图尔维迪表示,这反过来也可以加快智能体的部署速度。
查图尔维迪说:“目前企业部署智能体的障碍很少是能力问题,因为智能体通常能够完成工作。真正的障碍在于,CIO无法确信地回答当智能体出错时会发生什么、他们要如何得知,以及能多快发现问题。没有这些问题的答案,任何负责任的CIO都不会将涉及营收或客户的事务交由智能体处理。”他补充道:“由于Omni减少了调查智能体行为所需的工具数量和时间,它可以让CIO更清楚地了解智能体出错时的行为表现、能多快发现这些问题,以及这些问题可能对业务运营产生的影响,从而帮助CIO将智能体从试点阶段推向生产环境。”
但他表示,这种简化也带来了相应的代价:“你的可观测性越是依赖单一供应商的这套体系,你理解自身系统的能力就越依赖于这个供应商。”
Moor Insights and Strategy首席分析师迈克尔·利昂表示,CIO还应注意潜在的成本和评估方面的挑战。
利昂说:“智能体会产生大量遥测数据,因为每一次提示、工具调用和交接都会被追踪,所以数据摄入费用的增长速度可能会超出团队的预期。”
他补充道:“此外,智能体评估的质量取决于企业对‘好答案’的定义,而很多企业还没有把这个定义写下来。”
查图尔维迪表示,对于已经基于Datadog、New Relic或Grafana建立了成熟的应用程序和基础设施可观测性环境的企业而言,转向Omni可能收获不大。
沃尔特表示,最早采用该工具的很可能是现有的CloudWatch和Bedrock AgentCore客户,因为他们的遥测数据和插桩代码已经可以直接延续到Omni中;她还补充说,同时运行多个智能体试点项目的企业也可能从Omni中受益,从而实现评估和运维的标准化。
目前,Omni在美国东部(弗吉尼亚北部)、美国西部(俄勒冈)和欧洲(爱尔兰)这几个AWS云区域可用。不过,该公司表示这种有限的区域可用性并不会限制其使用。
一位AWS发言人表示:“即使Omni目前只在这些初始区域运行,客户也可以将来自其所有账户和区域的遥测数据集中到他们首选的Omni区域,从而获得统一的可观测性数据视图,且不会产生额外费用。”
Omni用户需要为数据摄入、存储和分析功能付费,来自AWS服务的遥测数据采用分层定价。数据摄入按每GB收费,存储按每GB每月收费。
这位发言人表示,分析功能的定价基于使用量,相当于最多五倍于摄入的日志或跨度(span)数量的分析用量包含在内,不额外收费。
集成在Omni中的AWS DevOps Agent则有独立的价格清单。
现有的CloudWatch客户不会被自动迁移至Omni,但可以选择创建Omni空间并配置访问权限。
Q&A
Q1:CloudWatch Omni是什么?
A:CloudWatch Omni是AWS推出的一款新的非控制台可观测性工具,能够将AI智能体、应用程序和基础设施的遥测数据统一整合在一起,以应用为中心帮助企业调查和理解智能体的行为表现。
Q2:现有CloudWatch客户使用Omni需要重新配置吗?
A:不需要。现有客户已发送到CloudWatch的日志、指标和追踪数据会自动在Omni中可用,通过统一数据存储实现关联分析,原有的插桩代码、仪表盘和告警也会延续下来,无需重新配置。
Q3:CloudWatch Omni支持哪些智能体开发框架?
A:Omni发布之初就支持LangGraph、CrewAI、OpenAI Agents SDK、Vercel AI SDK和AWS Strands等多种智能体开发框架,同时也支持Braintrust、DeepEval和Ragas等独立评估工具。
