可观测性平台公司Dynatrace于近日宣布对其Dynatrace Intelligence服务进行一系列重要升级,旨在推动自主站点可靠性工程师(SRE)从过去的概率性方法,转向更具确定性的实时上下文与控制能力。
新功能扩展旨在自动解决软件基础设施运营中的故障事件、防止服务中断,同时保留人工监督与治理机制。
Dynatrace Intelligence于今年1月在公司旗舰用户大会Perform上正式发布。此次升级新增了用于事件分类与修复的自主智能体,以及无代码自定义智能体创建功能,同时扩展了与主流工具和工作流的集成,以实现自主可观测性。
这是否意味着真正意义上的无人干预自主运维时代即将到来?
Dynatrace首席产品官史蒂夫·塔克在接受采访时表示,"这并非人类与平台之间非此即彼的选择",即人工主导与智能体主导的运维模式将长期并存。他强调,随着对结果可信度的不断提升,真正的目标是"逐步迈向更高程度的自主运维"。
"在已采用自主SRE方式的客户中,我们经常看到一种循序渐进的推进路径,"塔克说,"首先是信任我们具有确定性和因果逻辑的AI精准定位根因;其次是在此基础上实现修复自动化(可同时基于因果与预测能力,但仍需人工参与环节);向人工监督环路与真正自主行动的跨越,则建立在前期步骤所积累的信任度之上。"
塔克解释道,大多数团队最初都是以"人在回路"的方式启动,对Dynatrace已掌握的信息和精准操作进行验证,再逐步开放平台的自主行动权限。
"成功的衡量标准不是工程师的工作效率,而是完全无需人工介入处理的事件占比,"塔克表示,"Dynatrace提供建议与指引,帮助用户根据事件分类判断哪些环节应该自动化。自主化的程度,由用户自行决定。"
在本轮产品更新中,Dynatrace将智能体AI与对复杂环境的确定性实时理解相结合,主打"基于事实而非猜测的AI行动"这一核心定位。
作为本次更新的核心亮点,自主SRE智能体能够在检测到新问题时自动触发,判断该问题是否属于已有事件调查的一部分。一旦确认,智能体将以补充洞察信息丰富调查内容,并在检测到的问题中添加对应调查的关联引用。
在SRE智能体体系中,云SRE智能体负责协调修复活动,并与AWS、微软Azure和谷歌云等环境中的智能体进行集成,最终将所有发现汇总,形成统一可审计的自主运维记录。
此外,还有三项关键产品更新:Agent Builder支持无代码创建和部署自定义AI智能体,将自主运维能力延伸至各类独特工作流;升级版Dynatrace Assist为用户带来自然语言调查与智能体就绪工作流;同时新增与ServiceNow、Atlassian和PagerDuty的深度集成,并加强了与主要云服务商的连接。
Dynatrace表示,通过让Dynatrace Intelligence以确定性、实时的系统理解为每一步行动提供依据,平台已超越依赖概率输出的传统可观测性模式。每项操作都植根于特定环境上下文,并以透明、可审计、可治理为设计原则。
IDC集团副总裁史蒂芬·艾略特表示:"AI生成洞察与安全合规执行之间的鸿沟是最大的顾虑之一,客户需要具备确定性的实时上下文,结合自动化与可审计性,才能实现可信赖的可靠结果。"
云SRE智能体、增强版Dynatrace Assist以及扩展后的集成生态系统,目前已向DPS SaaS客户开放。自主SRE智能体与Agent Builder预计将于2026年8月上线。
展望未来,随着Dynatrace、微软、Datadog和Komodor等平台相继推出受策略约束的AI智能体以驱动自主SRE能力,2027年或许真的将成为自主SRE全面普及的元年。
Q&A
Q1:Dynatrace Intelligence的自主SRE智能体具体能做什么?
A:
自主SRE智能体会在检测到新问题时自动触发,判断该问题是否属于已有事件调查的范畴。若确认相关,智能体会补充新的洞察信息并关联至已有调查记录。云SRE智能体则负责协调跨AWS、Azure、谷歌云等环境的修复活动,并汇总成统一的可审计记录,整体目标是减少甚至消除人工介入的需求。
Q2:Dynatrace的自主运维是完全不需要人工参与的吗?
A:
目前并非完全无人参与。Dynatrace首席产品官史蒂夫·塔克表示,多数团队采用"循序渐进"的方式,从"人在回路"验证阶段起步,逐步过渡到"人工监督环路",最终实现真正的自主行动。自主化程度由用户自行决定,平台的目标是随着可信度提升而逐步扩大自主运维的比例。
Q3:Dynatrace Intelligence的新功能什么时候可以使用?
A:
云SRE智能体、增强版Dynatrace Assist以及扩展集成生态系统目前已向DPS SaaS客户开放。无代码智能体创建工具Agent Builder和自主SRE智能体预计将于2026年8月正式上线。
