IBM近期的网络增强举措——包括100G以太网和集成的RoCE/RDMA网络技术——持续推进其目标:为IBM Z大型机在混合云和AI环境中提供更高带宽、更低延迟、更简化的操作以及更强的集成能力。

IBM大型机早已不再是曾经那种孤立运行的专用网络系统。如今,IBM Z被设计成企业整体网络中一个高性能的参与者,采用标准以太网和IP协议,同时增加了支持低延迟、高吞吐量通信的先进技术。

IBM当前的大型机网络战略优先支持传统以太网/IP连接,增加基于远程直接内存访问(RDMA)的网络选项,并支持与通常围绕其运转的大型数据中心进行高效、安全的通信。

“我们的战略是确保IBM Z成为客户更广泛混合基础设施中深度集成的一部分,”IBM首席发明家兼IBM Z首席产品经理安德鲁·克里明斯(Andrew Crimmins)向Network World表示,“这意味着要持续提升带宽、降低延迟、增加I/O容量,同时让大型机更容易与云环境、分布式系统、存储以及AI基础设施相连接。”

专为I/O加速设计的DPU

大型机演进的一个例证是将I/O处理任务卸载到专用技术上,例如数据处理单元(DPU)架构,从而使系统能更高效地应对日益增长的网络和存储需求,克里明斯表示。

该DPU架构与支撑当前IBM Z系统的IBM Telum II处理器架构相集成。据IBM介绍,DPU本身包含四个处理集群,每个集群配备八个可编程微控制器,还有一个负责协调各集群并管理I/O子系统的I/O加速器,以及一个专用请求管理器,以确保能处理大量的I/O工作负载。

将I/O功能从主处理器核心中卸载并非新策略——IBM过去曾通过I/O卡上的定制ASIC芯片实现过这一点,克里明斯说。但转向片上DPU模式相比此前的ASIC模式带来了多项优势,包括:

客户仍可继续受益于无需消耗Z处理器核心周期来处理I/O功能开销的优势。

片上DPU具有更好的性能、延迟表现和吞吐量。

从系统中移除此前提到的大量ASIC芯片(根据I/O卡类型和客户需求的不同,有时数量可达数百个)有助于节省电力。

从I/O卡中移除ASIC芯片,使IBM能够转向适用于光纤通道/FICON等协议的高端口密度卡,从而减少卡的数量,这可以减少I/O抽屉的数量,在某些配置下甚至能减少Z机架/机柜的数量,克里明斯指出。

“过去我们大约每十年才发布一次这些I/O ASIC芯片。它们需要大量额外投入,而且会导致我们在I/O领域不同代际之间积累技术债务,”克里明斯说,“通过将这一功能整合进主处理器芯片——当然,我们每一代大型机都会发布新版本的主处理器芯片——这意味着我们每次迭代都有机会进行创新。这让我们处于更灵活的地位,能更快地为客户提供新技术。”

转向100GB以太网

大型机网络产品组合的另一项近期升级,是为IBM Z和IBM LinuxONE系统新增了100GB以太网适配器。据IBM介绍,该适配器配备两个带有QSFP(四通道小尺寸可插拔)SR光模块的100 GbE端口,可直接插入中央处理器复合体抽屉,从而无需外部I/O抽屉即可实现高速网络连接。

尤其是在LinuxONE大型机方面,IBM鼓励客户将数百甚至数千台Linux虚拟机整合到单台大型机上,将原本可能是分散的分布式服务器集群,转变为一个集中式的网络服务器。

“与普通的‘披萨盒’式1U服务器不同,IBM Z和LinuxONE是I/O密集型系统。要在这方面做到最佳,并以无与伦比的弹性来处理这些任务,从而让客户放心地将最关键的工作负载托付给这一平台,就需要能够以高速、每一层都具备冗余性的方式实现大量数据的进出。当拥有如此多的冗余能力时,系统远不会像只配备一两个网卡的‘披萨盒’服务器那样受到带宽限制,”克里明斯说。

“100GbE主要是由在该平台上运行Linux的客户(LinuxONE或Linux on Z客户)提出需求的。Z和LinuxONE通过将超过10000个x86核心的工作负载整合到数百个IFL(Linux核心)上,带来了巨大的可持续性优势,”克里明斯表示。他举例说,花旗银行将其“庞大的x86系统部署”迁移到几台LinuxONE服务器上,“获得了更好的性能、安全性,并实现了巨大的可持续性节约。”

“许多其他客户看到这一案例后,也希望尽可能多地将Linux工作负载如法炮制,”克里明斯说,“我们从多位客户那里清楚地了解到,缺乏100GbE支持使他们无法接入其所在机构混合云环境中的某些部分,从而影响了他们争取这些工作负载的竞争力。因此,我们提供了100GbE以消除这一障碍。”

另一项重要升级是IBM在2025年z17系列发布中推出的Network Express融合适配器。该融合适配器将此前两种独立的网络架构——OSA以太网和基于融合以太网的RDMA(RoCE/RDMA)——以及对Coupling Express 3长距离功能的支持,整合到同一块物理适配器上。该适配器支持10G到25G的传输速率,并可连接单模光纤(LR/LX)和多模光纤(SR/SX)。该耦合功能包括一张基于以太网的双端口长距离耦合卡,用于连接远程操作。

克里明斯表示,Network Express融合适配器等新增功能,使得物理I/O能进一步整合,也为客户提供了更大的灵活性,所需硬件更少。这同时也意味着更低的硬件配置负担,以及可能更少需要管理的网络连接。

此外,Network Express采用了名为增强型队列直接I/O(EQDIO)的技术来加速以太网流量。QDIO技术最初是为早期几代Z大型机的以太网速度和I/O架构而设计的。EQDIO重新设计了这一路径,以利用z17的片上I/O处理能力,更高效地处理吞吐量更高、延迟更低的以太网流量。

克里明斯表示,综合来看,这些增强功能进一步推动大型机从多个专用适配器的模式,转向一种融合的、基于以太网的I/O架构,在这种架构中,传统IP网络与高性能RDMA共享同一套物理基础设施。

保持大型机的相关性:分析师的看法

HyperFRAME Research首席执行官兼首席分析师史蒂文·迪金斯(Steven Dickens)表示,IBM在网络方面取得的进展有助于让大型机继续成为现代IT环境中的一流参与者。“IBM需要通过多种方式持续推进大型机的演进,以保持其相关性,而且IBM已经一次又一次成功做到了这一点。”

“大型机曾经被视为某种怪异、不寻常事物的时代已经过去了。如今它只是现代网络环境中的又一个组成部分,”迪金斯说。

因此,安全性方面的要求也在提高。例如,对大型机周边网络进行分段和安全防护,是大型机用户需要更加关注的事项,迪金斯表示。“曾几何时,企业或许每12个月才对连接大型机的网络做一次安全渗透测试,但这种频率显然已经完全跟不上战略需求了,”迪金斯说。补丁更新也成了需要更频繁跟进的工作,他补充道。

今年夏天,IBM推出了zSecure Detection套件,整合了威胁监测、网络洞察、AI驱动的访问异常检测以及针对z/OS的自动化响应功能。该套件包括自动化网络微分段能力,可根据观察到的网络行为生成定制化的分段策略。IBM表示,这些策略可帮助企业减少不必要的连接性,限制横向移动的机会,并增强关键环境中的安全控制。

AI与大型机

随着AI渗透到越来越多的技术环境中,IBM认为大型机仍将持续发挥作用。“企业级AI很少会仅在单一平台上运行。模型、应用程序和数据将分布在大型机、云平台、加速器以及其他基础设施之间,”克里明斯说。

“IBM Z差异化的角色在于,它能够将AI能力应用于该平台上已经存在的高度敏感、高交易量数据,”克里明斯说,“这可以减少不必要的数据迁移,同时支持更快的决策和更强的数据治理。”

“因此,大型机可以通过差异化的平台内AI能力、高速网络以及与更广泛AI生态系统的互操作性相结合,继续保持其作为重要AI平台的地位,”克里明斯说。

网络之外:节省时间的可视化与配置工具

除了网络相关的进展之外,IBM的克里明斯还提到了另外两项旨在帮助客户管理和扩展基础设施的大型机新技术。

第一项是I/O拓扑可视化工具,该工具能够生成图形化地图,展示IBM Z系统的I/O基础设施在物理和逻辑上的连接方式,并显示系统、适配器、结构、交换机和终端节点之间的连接关系。该工具是IBM“Z和LinuxONE基础设施管理”套件的一部分。

“我们有一份长达50页的研究摘要,其中客户分享了一个又一个案例,展示他们如何在PowerPoint或Visio等工具中费心费力地手工绘制其环境图,展示从大型机到网络(局域网/存储区域网络)再到存储,以及其间所有连接的端到端示意图,”克里明斯说。

“客户告诉我们,这是一项手动工作,令人头疼,占用了团队中经验丰富人员的大量时间,而且到头来总是容易出错。然而这些图表有许多用途(例如规划新设备接入、故障排查、向管理层展示系统弹性状况等),因此无法回避绘制并持续更新这些图表的需求。我们刚刚发布了I/O拓扑可视化工具的第一个版本,它能自动为您完成这项工作,我们的路线图上还有一长串功能清单,将在未来对其进行增强。”

第二项新技术是通过IBM基础设施管理器和IBM Terraform套件实现的基础设施即代码(Infrastructure as Code)。

“虽然配置大型机基础设施能让用户获得非常精细的控制权,这是优点,但它也有专用工具普遍存在的缺点——需要专门的技能,”克里明斯说,“面向IBM Z和LinuxONE的IBM基础设施管理功能最近刚实现全面上市。这是一个现代化的接口,还可以与IBM Terraform搭配使用,使用户首次能够在我们的平台上广泛利用基础设施即代码。”

基础设施即代码在分布式计算领域十分普遍,许多大学和学院毕业的年轻人已经具备这方面的技能,“这使得他们在我们平台上达到熟练程度所需的时间,相比从零开始学习专有工具要大大缩短,”克里明斯说。

“基础设施即代码支持对I/O资源和逻辑分区进行配置,同时也能很好地与业界标准自动化工具(如Ansible剧本)协同工作。这对于客户设置环境的敏捷性而言是一次巨大飞跃——他们可以通过预先编写好的剧本来运用最佳实践,并让诸如搭建相同环境之类的操作实现可重复执行,耗时从数周或数月缩短到几个小时。”

Q&A

Q1:IBM大型机新增的100G以太网适配器有什么作用?

A:该适配器为IBM Z和LinuxONE系统提供两个100 GbE端口,可直接插入中央处理器复合体抽屉,无需外部I/O抽屉即可实现高速网络连接,主要满足在大型机上运行Linux工作负载的客户需求。

Q2:DPU架构相比之前的ASIC方案有哪些优势?

A:DPU架构集成在Telum II处理器中,不占用Z处理器核心周期,具备更好的性能、延迟和吞吐量表现,同时能减少ASIC芯片数量以节省电力,并支持高端口密度I/O卡,减少硬件数量。

Q3:AI技术如何与IBM大型机结合?

A:IBM Z的差异化优势在于能将AI能力直接应用于平台上已有的高敏感、高交易量数据,减少数据迁移需求,支持更快决策和更强数据治理,同时与云平台、加速器等更广泛AI生态系统保持互操作性。

Networkworld