NVIDIA BlueField-4架构支持Scale-In网络基础设施
AI生成摘要
NVIDIA推出了Scale-In网络基础设施,它是NVIDIA AI网络的第五大支柱,为代理式AI工厂的安全、管理和运营带来专门的加速。
NVIDIA BlueField-4通过64核Grace CPU、在线加速引擎和800 Gb/s网络接口提供独立于主机的基础设施处理能力,以线速处理安全、数据传输和操作。
NVIDIA DOCA通过容器化微服务和SDK提供Scale-In服务,在BlueField-4系统中实现网络、安全、存储和遥测的统一操作。
NVIDIA Spectrum-X以太网在Scale-In访问路径中提供高性能网络,支持拥塞管理和性能隔离功能,可实现一致的存储和访问吞吐量。
Scale-In用例包括采用基于DOCA主机网络(HBN)的隔离AI工厂虚拟私有云(VPC)、通过DOCA Argus和DOCA Vault实现硬件增强的安全性、加速存储访问实现高达1.45倍性能、通过DOCA平台框架实现DPU原生控制平面编排,以及通过DOCA Telemetry实现全局可观察性。
后续步骤
探索NVIDIABlueField平台产品架构、规格和资源。
详细了解NVIDIA Spectrum-X以太网以及NVIDIA DOCA软件框架。
开始对BlueField进行编程:下载NVIDIA DOCA,按照DOCA入门指南构建DOCA示例。
传统的云基础设施为可预测的通用工作负载和标准接口而设计。代理式AI工厂连接不同的用户、代理、应用、数据源和存储系统,以每台服务器数Tb带宽实现大规模加速计算,从而使专用DPU处理成为线速网络、存储和安全的关键。NVIDIA推出Scale-In网络基础设施,这是NVIDIA AI网络的第五大支柱,可为代理式AI工厂的安全、管理和运营带来专门的加速。
Scale-In将南北向网络发展成为AI工厂的协调基础设施域。由NVIDIA BlueField-4以及NVIDIA DOCA并通过NVIDIA Spectrum-X以太网进行连接,Scale-In可加速保护整个AI堆栈的服务,为AI工厂中移动应用、数据和存储流量保驾护航。专用加速处理将这些基础设施服务独立于主机CPU之外,防止安全、数据访问和操作成为AI计算扩展时的瓶颈。其结果是更安全、更高效的共享AI基础设施,随着需求的增长,能够持续访问AI服务和数据。
本文将探讨BlueField-4架构,并解析Scale-In如何为代理式AI工厂提供安全访问、高性能数据移动、租户隔离、简化操作和更可预测的性能。
Scale-In加速南北向AI工厂基础设施
AI工厂在不同的规模上有不同的基础设施要求:
Scale-Up (纵向扩展):NVIDIANVLink将GPU整合为一个加速器整体。
Scale-Out (横向扩展):NVIDIA Spectrum-X以太网和NVIDIA Quantum InfiniBand连接AI工厂中的服务器。
Scale-Across (跨域扩展):NVIDIA Spectrum-XGS以太网连接分布式AI工厂。
上下文记忆存储:NVIDIA CMX,基于NVIDIA STX为AI原生存储提供模块化基础,在AI工厂内提供共享的KV缓存存储。
Scale-In (全局互连网络):NVIDIA BlueField-4、NVIDIA DOCA和NVIDIA Spectrum-X以太网加速与AI计算相关的访问、安全、数据传输和基础设施运营。
南北向网络提供进出数据中心的访问路径,将用户、应用、数据源、存储系统和服务连接到各个系统。传统的云数据中心围绕软件定义的基础设施、可组合性和弹性构建这些网络,因此可以根据需求变化调配和扩展资源和访问权限。
代理式AI提高了对这种基础设施的需求。软件定义网络、可组合性和弹性仍然至关重要,但它们已无法满足需求。AI工厂将大规模加速计算与越来越多的用户、智能体、应用、企业数据源和存储系统结合在一起,并且这些组件都在持续进行大规模交互。
基础设施必须作为AI工厂的一部分进行加速和协同设计。安全性、多租户网络、数据和存储访问以及基础设施运营不能仅仅依靠在通用主机CPU上运行的软件,或额外运行的管理层。这些功能必须作为一个统一的基础设施域协同工作,使运营人员能够对整个AI工厂的访问、数据移动、安全性、调配和可观察性进行一致的控制。
Scale-In通过将南北向访问发展为整个AI工厂的统一、加速的基础设施域来满足这些需求。BlueField-4提供独立于主机的加速和卸载,DOCA提供用于编程和运营基础设施服务的统一模型,Spectrum-X以太网在Scale-In访问路径中提供高性能以太网连接,包括外部存储和数据源。它们共同助力运营团队在支持加速计算和数据存储的基础设施中对访问、数据移动、安全性、调配和可观察性进行一致控制。

图1.纵向扩展、横向扩展和跨域扩展可扩展计算连接,Scale-In可连接、保护、调配和监控围绕计算域的基础设施
AI工厂依靠互补的存储基础设施来处理持久性数据和推理上下文。Scale-In提供对AI原生存储的高性能访问,包括用于训练、推理和分析的AI工厂存储,以及用于检索和多模态索引的企业AI数据系统。另外,CMX为AI工厂内的共享KV缓存和可重复使用的推理状态提供Pod级存储。BlueField-4既可用作Scale-In的基础设施处理器,也可单独用作CMX的数据和存储处理器。Scale-In将AI工厂和企业数据连接到AI计算,而CMX则保留和共享上下文,从而实现更快、更高效的推理。
这五大基础设施支柱共同为整个AI工厂的不同需求提供支持。只有在数据访问、存储、网络安全和运营相应随之扩展时,扩展GPU、机架和数据中心才能带来应有的价值。
BlueField-4为Scale-In基础设施提供支持
BlueField-4可加速跨GPU服务器、代理式CPU系统、AI工厂存储系统和云服务的Scale-In服务。在NVIDIA Vera Rubin NVL72系统中,NVIDIA ConnectX-9SuperNIC通过Scale-Out网络传输租户工作负载流量,而BlueField-4则运行和加速基础设施服务,以连接、保护和管理每台服务器。BlueField-4为企业运营提供了租户主机之外的独立基础设施处理域,他们可以在其中管理安全策略、服务状态和遥测,而无需依赖主机CPU或消耗其资源。
NVIDIABlueFieldAstra将可信控制从南北向访问扩展到东西向横向扩展网络。Astra为服务提供商提供了一个独立于主机的统一控制点,用于跨两个域的调配、租户隔离和网络策略。BlueField-4安装和更新策略并监控遥测,而ConnectX-9直接在数据路径中执行这些策略。此闭环在Scale-In和Scale-Out之间提供一致的控制,而无需在租户主机中运行设备管理。
BlueField-4将可编程控制平面处理与加速数据路径处理相结合。软件做出基础设施决策,而内联引擎则在本地执行这些决策,而无需将工作返回主机CPU。这种设计使整个工厂能够协调策略,并以线速在本地执行。表1总结了主要组件如何支持此处理模型。
| 组件 | 角色 | 优势 |
| 64核NVIDIA Grace CPU | 运行策略、调配、遥测和基础架构编排软件 | 与上一代产品相比计算能力提高6倍,轻松同时运行多个基础设施服务 |
| 内联加速引擎 | 处理数据包、RDMA、存储协议、加密、防火墙规则和策略执行 | 以800 Gb/s线速处理操作,同时减轻Grace CPU和主机CPU的处理负担 |
| LPDDR5X内存子系统 | 为基础设施软件提供数据和服务状态 | 提供高内存带宽和节能高效的操作,消除访存瓶颈 |
| PCIe Gen6主机连接 | 将BlueField-4连接到主机服务器 | 在主机和Scale-In基础设施处理域之间提供高带宽路径 |
| 800 Gb/s网络接口 | 将服务器连接到Scale-In网络 | 支持高吞吐访问、安全、数据移动和存储流量 |
表1. BlueField-4组件在Scale-In处理路径中平衡控制平面处理、数据路径加速、内存访问、主机I/ O和网络带宽。
与BlueField-3相比,BlueField-4提供4倍的内存带宽和2倍的网络带宽。这种能力增强可支持更多并发服务、更大的策略和遥测数据集,以及更高的流量处理和安全吞吐量。
NVIDIA DOCA编程实现Scale-In服务
NVIDIA DOCA将BlueField-4的硬件加速器转变为可编程和可部署的Scale-In服务。可用于生产的容器化DOCA微服务可以直接在BlueField-4上运行,而DOCA库和SDK支持开发者访问用于自定义服务的加速网络、安全、存储和遥测功能。DOCA Flow为硬件数据包处理工作流编程,DOCA PCC支持可编程拥塞行为,DOCA Telemetry提供设备和服务运行状况,DOCA Platform Framework (DPF)管理调配、部署和更新。BlueField-4的多服务架构和原生服务功能链通过所需的服务序列引导每个流量流。这些功能为跨BlueField-4系统操作服务提供了统一的软件模型,而无需管理单独的服务器工作流。
NVIDIA Spectrum-X以太网连接Scale-In网络
NVIDIA Spectrum-X以太网为Scale-In访问路径提供高性能网络,包括外部存储。BlueField-4处理每个系统的基础设施服务,而Spectrum-X以太网在AI工厂与相关的用户、应用、数据源、服务和外部存储之间传输流量。Spectrum-X以太网可在大规模网络解决负载平衡冲突和拥塞问题,提高资源利用率,帮助保持高效带宽,并隔离并发流量,从而使访问和存储流获得更一致、更可预测的性能。
BlueField-4 DPU、DOCA微服务和Spectrum-X以太网与NVIDIA Vera Rubin协同设计,因此处理器性能、内存带宽、PCIe连接、网络带宽、加速和软件都可以与时俱进。它们共同服务于Scale-In路径,处理传输、服务处理和控制,避免消耗分配给AI工作负载的资源。
代理式AI工厂的典型Scale-In用例
代理式AI工厂必须安全地共享加速基础设施,为其提供企业数据、支持系统上线,并持续监控性能。以下用例展示了BlueField-4加速和DOCA服务如何满足这些生产需求。
构建隔离的AI工厂虚拟私有云
AI工厂虚拟私有云(VPC)可在共享物理基础设施上隔离租户和应用程序流量。DOCA基于主机的网络(HBN)可在BlueField-4上加速南北3层路由和多租户隔离。DOCA Flow为流量分类和访问控制规则编程,而DOCA加速的OpenvSwitch(OVS-DOCA)在东西向接口上应用了相应的策略。BlueFieldAstra在东西向横向扩展(Scale-Out)接口之间扩展了相同的VPC策略,因此只需一个策略模型即可控制访问流量和横向扩展(Scale-Out)流量。
在Vera Rubin中,此协调模型的聚合接口带宽达到7.2 Tb/s,其中南北BlueField-4路径的带宽为800 Gb/s,每个计算托盘的东西向路径带宽为四个1.6 Tb/s,为访问和Scale Out流量提供一致的策略覆盖,无需通过800 Gb/s接口路由所有东西向流量。运营侧集中调配隔离的AI工厂VPC,而租户则继续使用加速网络。此架构提供类似云的弹性、一致的隔离、更低的主机CPU开销,更高效地使用共享AI基础设施。
在芯片中实现安全性
BlueField-4将执行点置于主机操作系统之外的硬件中。租户软件无法禁用或绕过这些管控,而卸载安全处理可保留主机CPU资源,避免额外的软件跳转。BlueField-4可加速安全检测,并以线速执行网络、文件和对象访问策略。DOCA Argus提供运行时安全检测,DOCA Vault执行文件访问策略,DOCA Flow编程线速网络执行。BlueFieldAstra可跨服务器上的不同网络协调加密、隔离和策略。Astra可跨南北向和东西向流量同步策略、遥测、密钥和执行,在租户主机之外保持特权安全控制,为共享AI服务提供一致的保护,并为AI工作负载保留主机资源。
加速存储访问
Scale-In将AI计算连接到训练数据、模型资产、企业知识和来自外部存储的应用数据。如果存储协议处理、存储虚拟化或数据移动无法跟上步伐,GPU就会发生等待,即使仍然具备可用计算和Scale-Up/ Scale-Out网络带宽资源。
BlueField-4可在专用基础设施上通过RDMA和TCP加速NVMe-oF、文件和对象存储协议、存储虚拟化以及数据移动。Spectrum-X以太网在整个存储路径中提供面向AI优化的以太网架构,其中拥塞管理和性能隔离有助于在并发存储流中保持高效带宽,与通用以太网相比存储吞吐量可提高1.45倍。这降低了主机CPU负担,有助于保持AI计算的供给,并提供对企业数据的一致访问,以进行训练、检索和推理。这些外部数据路径是对CMX的有效补充。
图2.协同设计的NVIDIA BlueField-4和Spectrum-X以太网Scale-In存储路径与通用以太网相比可将吞吐量提高1.45倍
运行AI工厂控制平面
在运行AI工作负载之前,必须对AI工厂节点进行调配、配置、安全保护和连接。BlueField-4板载节点,调配网络和存储资源,启动服务器,并通过网络加载主机操作系统。由于此控制平面独立于主机运行,因此它会在租户软件启动之前制定策略并调配资源。DOCA平台框架是一个Kubernetes原生编排框架,可将BlueFieldDPU作为Kubernetes节点进行调配、管理和扩展。它管理整个AI工厂的DPU发现、调配、服务部署和更新。这样可以缩短部署时间、提高配置一致性、保留主机CPU资源,并更快地实现新的AI能力上线。
观察和优化AI运营
运营大规模AI工厂需要持续监控网络流量、存储访问、服务运行状况、性能和资源利用率。DOCA Telemetry收集这些信息并将其导出到网络监控平台,而DOCA库支持将相同的基础设施信息集成到客户自己的观察监控工具中。通过BlueField-4收集遥测数据,运维人员可以独立于租户主机软件保持对系统的可见性。当基础设施遥测扩展到GPU和网络利用率时,运营人员可以识别与访问、流量、存储、策略执行或工作负载相关的限制条件。这种全视野可见性有助于检测异常、定位瓶颈,并在事件影响AI工作负载之前将其解决。
Scale-In将扩展计算转化为AI工厂性能
Scale-In将南北向网络发展为协调、加速的基础设施域,用于数据访问、安全和运营。NVIDIA BlueField-4提供网络加速、DOCA编程和运营服务,而Spectrum-X以太网则在Scale-In访问和存储路径中提供高效的带宽和性能隔离。它们共同帮助将扩展计算转变为安全、可运营的AI工厂平台。
后续步骤
探索NVIDIABlueField平台产品架构、规格和资源。
详细了解NVIDIA Spectrum-X以太网以及NVIDIA DOCA软件框架。
开始对BlueField进行编程:下载NVIDIA DOCA,按照DOCA入门指南并构建DOCA示例。
关于作者
Ronil Prasad 是 NVIDIA 数据中心网络解决方案的高级产品营销经理,致力于帮助企业和 AI 客户采用为现代数据中心提供支持的高性能网络平台。
Itay Ozery 是 NVIDIA 网络产品营销总监。他为 Mellanox 的云网络解决方案推动战略性产品营销和产品管理计划。 Itay 在网络安全领域领导了大规模的业务和项目,并与数据中心和电信服务提供商在 IT 系统和网络工程领域担任过多个职位。
