Cisco与Splunk借.conf26大会展示AI如何重塑可观测性,即所谓的"面向可观测性的AI"。其核心论点是:网络、安全运营和AI基础设施必须融合为一个统一、可关联的运营系统,而Splunk可以作为连接这些系统的数据与行动层。

对网络工程师而言,此次9月14日至17日活动的主要看点是:Cisco推出了新的Network Intelligence App,将网络拓扑、设备健康状况和事件数据整合进Splunk;扩展了基于ThousandEyes的网络洞察能力;拓展了AI与智能体可观测性;并论证了AI成本、行为与安全性正日益依赖网络级遥测数据。

这是一项雄心勃勃但亟需推进的工作。多年来,网络团队一直被要求证明事故是否源于"网络问题",而应用、云、安全和基础设施团队往往使用不同工具,得出相互矛盾的结论。Splunk最新推出的功能旨在用共享的运营上下文取代这些碎片化视图,将网络数据与应用行为、基础设施性能、安全事件和AI智能体活动关联起来。能否在异构的客户环境中真正实现这种统一体验,将是对其成效的检验。

网络智能成为核心

对网络工程师而言,本次.conf大会最重要的发布是全新的Network Intelligence App for Splunk Observability。该应用将把Cisco网络拓扑、设备健康状况和事件数据引入Splunk,使工程师能够在不离开该平台的情况下,追踪告警到受影响的设备并了解周边网络背景。这种集成视图可以省去当前困扰工程师的仪表盘切换和手动关联工作,节省大量时间。

在会前吹风会上,Splunk高级副总裁兼总经理Kamal Hathi用网络工程师再熟悉不过的方式描述了这一运营难题:当网页运行缓慢时,"总是被归咎于网络问题"。但根本原因可能出在ISP、DNS提供商、云服务或应用程序上。网络团队往往只能看到接口、连接和设备状态,而其他团队则使用各自独立的工具,但最终往往还是由网络运营团队来定位问题根源。

Cisco的应对方案是将网络的拓扑和健康信号纳入一个共享的可观测性平面。"事实上,所有这些数据都运行在一套通用数据基础之上,能够提供跨网络和应用领域的端到端可见性,"Hathi表示。这并不能消除对网络专用管理平台、数据包级故障排查或深厚领域专业知识的需求。但它可以改变事故处理的最初阶段。运营团队不必一开始就陷入关于责任归属的跨部门争论,而是可以从关联证据入手:服务性能下降情况、受影响的用户路径、相关网络设备、底层事件以及更广泛的拓扑结构。

这一价值主张对拥有园区、分支机构、数据中心和云环境的大型企业尤为重要,因为用户体验往往需要跨越多个领域和提供商才能最终触达应用程序。

ThousandEyes拓展可见性边界

Cisco还通过与ThousandEyes的原生集成来扩展网络可见性。其新的Network Insights功能将使用合成测试,提供跨企业自有基础设施和外部网络的应用及网络性能可见性。

这对于理解用户体验问题的根本原因而言是一项重要创新。现代数字服务的可用性,取决于企业Wi-Fi、局域网、广域网、SD-WAN、DNS、互联网传输、SaaS依赖项、云基础设施和应用服务这一整条链路的综合表现。传统网络监控非常擅长报告企业自有的基础设施情况,但当故障出现在第三方网络或企业边界之外时,其作用就大打折扣。

Hathi表示,Cisco的目标是将"你能控制的和你无法控制的(包括内部网络和互联网)纳入一个统一的运营视图"。对网络工程师而言,这或许是Cisco与Splunk联合战略带来的最直接好处:减少自有基础设施与影响用户体验的外部依赖项之间的盲区。

需要提醒的关键点是:关联性并不等于因果性。合成测试可以大幅缩小可疑领域的范围,但团队在将根本原因归咎于运营商、云服务商或SaaS供应商之前,仍需要扎实的基线数据、依赖关系图、升级流程和独立证据支撑。

AI让网络变成一个可观测性问题

Cisco本届.conf大会的更宏观主题是"大规模可信AI"。这听起来不像是传统的网络运营议题,但随着边缘推理和物理AI在不远的将来落地,它正迅速变成一个网络运营问题。Cisco产品组合战略高级副总裁Jeff Schultz表示,AI智能体不再局限于超大规模数据中心,而是运行在园区、分支机构、数据中心、混合部署环境、协作环境和安全运营中心之中。这种分布式部署给基础设施带来了新的压力,"如今基础设施承受的压力达到了前所未有的水平,"Schultz说。

这一转变正在改变网络专业人员的角色:网络工程师将被要求支持AI应用和智能体,这些应用会产生更难预测的东西向流量,需要跨环境访问数据和模型服务,并可能以机器速度执行操作。可靠性不能再仅凭设备正常运行时间、延迟或丢包率来衡量,还必须越来越多地反映AI服务是否正常运作、是否合理消耗资源,以及是否在既定护栏范围内运行。

Cisco正通过扩展的Splunk Agent Observability来应对这一挑战,该功能将在Splunk Observability Cloud和Cisco Cloud Control中提供。Cisco表示,该功能将提供对AI智能体在GPU、向量数据库和编排框架等各组件中性能的可见性,同时评估输出结果,并应用护栏机制来阻止不准确或不安全的操作。

这并非要取代网络可观测性,而是扩大了运营范围。例如,网络团队在排查AI辅助客服系统运行缓慢的问题时,可能需要区分是网络拥塞或路径性能下降、模型延迟、GPU饱和、检索质量、智能体偏移,还是第三方API延迟所致。由于故障模式如今横跨所有这些领域,一个通用的遥测层就显得至关重要。

成本与数据架构同样关键

.conf大会的另一大主题是AI经济性。Splunk新推出的Tokenomics功能旨在追踪和归因AI Token支出、揭示员工对AI编程智能体的使用情况、预测消耗量,并帮助企业将工作负载路由到更具成本效益的模型上。这是一个开始影响众多组织的问题。上周我与一家机构交流时了解到,由于没有办法监控使用情况,该机构在三个月内就花光了全年预算。

网络团队并不掌控模型Token预算,但他们将在塑造这些预算的架构决策中扮演核心角色。Schultz表示,Cisco观察到客户正在将部分AI工作流从前沿模型迁移到园区和分支服务器上的边缘推理,甚至迁移到运行开源模型的桌面系统上。

这带来了一个新的设计权衡:是将数据迁移到集中式模型,还是将推理能力迁移到更靠近数据和用户的地方。正确答案将因延迟、隐私、带宽、弹性、GPU可用性以及运营和管理需求的不同而各异。但这使得网络遥测数据以及对数据路径的清晰理解,成为AI经济性的核心要素,而不仅仅是故障排查的辅助信息。

Cisco通过其AI Tier和Cisco AI POD for Splunk强化了这一理念。这些产品旨在将AI能力引入自管理环境,由NVIDIA加速计算为本地或受控部署提供基础支撑。对于拥有敏感运营数据的企业而言,这可以让他们在不将关键机器数据移出企业既定安全边界的情况下,应用Splunk的AI能力。

给Cisco客户的建议

Cisco客户应将.conf26视为务实推进运营现代化的契机,而非替换现有全部工具的理由。

从摩擦最大的服务入手。选择一项经常因网络与应用责任之争而引发事故的关键业务应用,针对该服务试点Network Intelligence App和ThousandEyes关联功能,然后衡量故障分诊时间、问题定位时间和升级处理量。

首先,统一跨领域遥测数据标准。关联式可观测性依赖于准确的设备清单、拓扑信息、时间戳、服务归属和一致的标签体系。在期望AI给出可信的根因分析之前,应先解决这些基础性问题。

将AI可观测性作为联合项目推进。在网络、平台、应用、安全和FinOps团队之间建立共享运营模式。AI智能体引发的故障模式往往无法简单归咎于单一团队。

在变更控制环节始终保留人工把关。Cisco的智能体愿景强调护栏机制和受控行动。网络团队应先从AI辅助的调查和建议入手,只有在验证了数据质量、回滚流程和责任机制之后,才谨慎允许有限范围内的自动化操作。

用自身数据验证经济性方面的宣称。Cisco承诺通过数据联邦、机器数据湖和AI驱动的数据管理来降低数据管理成本。该公司援引Autodesk的案例称其数据摄取成本降低了28%,迁移一项搜索工作负载后节省了78%的成本,但每个客户的数据保留、查询和合规需求各不相同。

结语

Cisco正将Splunk定位为一个以Cisco为中心的环境中的运营智能层,而不仅仅是独立的日志分析或SIEM平台。对网络工程师而言,这可能意味着在AI、云和安全运营领域获得更重要的话语权。但只有当企业真正用这项技术来创建共享证据和工作流程,而不仅仅是多一个仪表盘时,这项技术才能真正发挥价值。

Q&A

Q1:Network Intelligence App主要能为网络工程师解决什么问题?

A:它能将Cisco网络拓扑、设备健康状况和事件数据整合进Splunk,让工程师无需离开平台就能追踪告警到受影响设备,省去仪表盘切换和手动关联的繁琐流程,从而更快定位问题根源。

Q2:ThousandEyes的Network Insights功能有什么作用?

A:该功能通过合成测试,提供跨企业自有基础设施和外部网络(如ISP、云服务、SaaS)的应用及网络性能可见性,帮助团队判断问题究竟出在企业内部网络还是第三方网络。

Q3:Splunk的Tokenomics功能主要解决什么问题?

A:它用于追踪和归因AI Token支出、揭示员工对AI编程智能体的使用情况、预测消耗量,并帮助企业将工作负载路由到更具成本效益的模型,避免AI使用成本失控。

Networkworld