思科对1000名IT专业人士的调查显示,网络复杂性和警报数量的增长已经难以持续,这促使从业者更愿意让智能体AI工具自主采取行动。
网络专业人士正把希望寄托在人工智能上,期待它能缓解网络复杂性不断攀升的困境,而这种复杂性的加剧在很大程度上恰恰是由于AI使用的增加所致。
思科与研究咨询公司Omdia联合发布的一份新报告描绘了这样一幅图景:企业网络已经变得复杂到人力难以管理的地步。情况严峻到什么程度呢?51%的受访者表示,他们已在生产环境中使用智能体AI工具实时采取纠正措施,而不仅仅是听取AI的建议。84%的受访者预计将在十二个月内实现完全由AI主导的运营模式。
在接受调查的1000名IT和网络运营负责人中,四分之三表示他们以某种方式在网络运营中使用AI,80%的人对赋予AI"高度或完全自主的角色"感到放心。超过半数受访者(56%)表示,只有在人工审批AI行动的前提下才会这样做,但24%的人对AI在无人监督的情况下采取网络行动感到自在。绝大多数受访者(82%)都能接受让AI在某些类别中自主对生产网络进行部分变更。
思科将这种转变称为从AIOps(AI运维)迈向智能体驱动运营,即AgenticOps。包括ZK Research创始人兼首席分析师朱斯·克拉瓦拉在内的资深行业观察人士对这一理念表示认同。
"必须要有智能体化的运营方式,网络专业人士会拥抱它,"他说。要完全建立起对新工具的信任可能需要一些时间,但这份信任终将到来——就像自动驾驶汽车的发展曲线一样,他指出,自动驾驶汽车发生的事故远比人类驾驶的汽车少。同样地,智能体AI工具"也会犯错,但比人类犯的错误要少得多。而且它能让人们把精力集中在更有价值的事情上,"克拉瓦拉说。
Omdia网络首席分析师吉姆·弗雷参与了此次思科调查的设计,他同样认为向AgenticOps转变是不可避免的趋势。
"在我看来,这是网络复杂性不断上升与具备相应技能(包括解决跨领域问题能力)的人才数量不断减少这两个因素叠加的结果,"弗雷说。
AgenticOps必须包含有效的防护机制
这份题为《智能体AI对网络运营的影响》的思科调查报告发布之际,业界正呼吁放缓AI应用的步伐,部分原因是像Hugging Face遭黑客攻击这样的事件——起因正是失控的智能体AI代理。然而调查显示,数百名网络专业人士乐于将网络的部分控制权交给AI代理。
不过,他们愿意这样做的前提是必须有严格的防护机制到位,而Hugging Face事件恰恰缺乏这一点。几乎所有受访者(99%)都表示,如果没有以下防护机制,他们不会信任AI自主行动:
可解释的AI行动
行动需人工审批
基于策略的操作限制
紧急覆盖机制
基于角色的访问控制
不可篡改的审计追踪
思科网络平台及ThousandEyes高级副总裁兼总经理乔·瓦卡罗表示,防护机制让用户能够看到智能体得出结论背后的推理过程,从而建立起对AI的信任。此外,虽然AI智能体可以从其分析的情报中得出结论,但它们采取的任何行动都会映射到基于网络团队标准操作流程预先定义好的工作流,这些流程规定了在不同情况下应如何应对,他说。
弗雷表示,根据他与思科的交流,另一个关键限制条件是智能体代理之间不会互相通信。"这很有帮助,因为当它们被限制为只能靠自己解决问题时,危险性就小得多,"他说。
另一个限制条件是,智能体是围绕特定技能或知识以及明确的责任范围来构建的。"当你像思科和Splunk那样以产品为基础来实现这一点时,这一点是可以受到控制的。这才是正确的做法。"
"把这些因素综合起来,就能让企业网络运营团队有信心利用智能体AI来帮助他们应对日益增长的复杂性,"瓦卡罗说。
驱动需求的因素:复杂性、快速变化以及AI本身
复杂性确实在增加,59%的调查受访者表示他们至少每天都会对生产网络环境进行变更。报告指出:"这些组织中有一半每天进行多次变更,对相当一部分组织而言,变更甚至每小时都会发生多次。"因此,57%的人表示他们的变更流程已经跟不上节奏。
92%的受访者表示,性能问题往往跨越多个领域,包括云、安全、应用程序和终端。同样,95%的人表示他们现有的非智能体化工具(AIOps)在多个方面存在明显不足,主要表现为需要过多的人工解读,且缺乏跨领域可视性。
三分之二的受访者表示,生成式AI的蓬勃发展也加剧了网络复杂性。思科通过对直接面向AI的流量进行分析发现,AI流量的日均增长轨迹是每六个月翻一番。报告指出:"这种加速很可能是由AI任务日益增长的复杂性所推动的,这些任务比简单查询需要交换更多的数据。"
或许也就不足为奇了,调查发现,普通组织每天会产生约4100条监控警报和事件,其中51%与网络相关。Omdia估计,一名普通从业人员每天大约能审查、调查并解决21条网络警报,这意味着要处理这样的日常量,需要约100名专家组成的团队。
由于很少有组织拥有如此多的人手,近一半的警报(46%)未经调查就被关闭。对65%的受访者而言,警报疲劳是"造成员工不满的重要因素",而67%的人表示警报数量过多使团队无法完成其他关键工作。
克拉瓦拉表示,这些数字与他自己在安全警报方面的研究结果相吻合,该研究发现受到调查的警报远低于50%。
工具太多,问题解决耗时过长
各组织平均依赖10种工具来努力维持端到端的可视性,但这些工具往往彼此孤立,导致难以诊断跨领域的问题——而许多问题恰恰属于这一类。这一点也反映在受访者解决问题所耗费的时间上。
解决一次网络事件的平均耗时为88小时,而中位数为12.5小时。弗雷表示,平均值之所以被拉高,是因为有些组织需要一周甚至更长时间才能解决问题,这反映出复杂程度之高。"这确实是一个很好的机会,可以通过让AI协助分析并自动化根本原因排查流程,把工作做得更好,"他说。
一个例子是,某些组织在每次发生同样情况时都会采取相同的纠正措施。"如果我已经做过14次了,那就干脆自动化处理,但要告诉我你做了,"弗雷说。
网络专业人士或许也可以借鉴安全领域同行的经验。面对同样"问题太多、处理不过来"的困境,安全专业人士正越来越多地采取自动化响应的策略,即便这意味着要关闭某项资源,弗雷说。这种思路的逻辑是,潜在损失要大于对业务造成的潜在影响。"我认为网络从业者也在朝着更能接受这种方式的方向发展。"
解决方案:又一个"单一视图平台"
思科方面提出了其新的Cloud Control平台作为解决方案。该平台旨在为网络、安全、计算、可观测性和协作解决方案提供统一的视图和管理平面。Cloud Control还应用智能体AI来诊断和解决问题,包括那些跨领域的问题。说到底,这又是一个所谓的"单一视图平台",只不过这次加上了AI的元素。
一家销售网络设备的厂商——正是这些设备让网络变得复杂到难以管理——如今又反过来销售旨在解决这种复杂性的方案,这似乎有些讽刺意味。
"网络厂商在这个问题上是不是难辞其咎?当然是。但看到他们现在着手简化问题,也是件好事,"克拉瓦拉说。"而且网络的使用方式比以往任何时候都要多得多,出于多种原因,它变得更加复杂了,"包括网络现在要支持数量级远超从前的设备,并且几乎与一切事物相连。
弗雷对此表示认同。"我一直在关注网络的演变,以及自动化运营的种种尝试,这一直是件非常困难的事,"他说。"我认为借助AI,我们终于有可能实现这一目标了。"
Q&A
Q1:什么是AgenticOps?
A:AgenticOps是指从传统的AIOps(AI运维)向智能体驱动的网络运营模式转变,即让具备自主决策能力的智能体AI工具直接参与网络运营,能够实时诊断问题并采取纠正措施,而不仅仅是提供建议。
Q2:网络专业人士愿意让AI完全自主运营网络吗?
A:调查显示80%的网络专业人士愿意赋予AI高度或完全自主的角色,其中56%要求AI行动需经人工审批,24%可以接受AI在无人监督下采取行动,但99%的受访者都强调必须有严格的防护机制才能信任AI自主行动。
Q3:为什么网络运营变得越来越复杂?
A:主要原因包括网络变更频繁(59%的组织每天都在变更生产网络)、性能问题常跨越云、安全、应用等多个领域、生成式AI流量激增(平均每六个月翻一番),以及每天产生约4100条监控警报,远超人工处理能力,导致近一半警报未经调查就被关闭。
