NVIDIA BlueField-4驱动智能体AI工厂的Scale-In网络基础设施

发布时间:2026-08-25 21:53  浏览量:1

传统云基础设施专为可预测的通用工作负载和标准接口而设计。智能体AI工厂将多样化的用户、智能体、应用程序、数据源和存储系统,以每台服务器多太比特带宽连接到大规模加速计算,这使得专用DPU处理对于实现线速网络、存储和安全而言不可或缺。NVIDIA正在推出Scale-In网络基础设施,这是NVIDIA AI网络的第五大支柱,为智能体AI工厂的安全保障、管理和运营带来专用加速能力。

Scale-In将南北向网络演进为AI工厂的协调基础设施域。该方案以NVIDIA BlueField-4和NVIDIA DOCA为核心驱动,通过NVIDIA Spectrum-X以太网连接,加速保护完整AI栈的各类服务,并在AI工厂内传输应用程序、数据和存储流量。专用的独立于主机的处理机制,将这些基础设施服务从主机CPU上卸载,有助于防止安全、数据访问和运营在AI计算扩展时成为瓶颈。最终实现更安全、更高效的共享AI基础设施,在需求增长时也能持续稳定地访问AI服务和数据。

本文将深入探讨BlueField-4的架构,并阐述Scale-In如何为智能体AI工厂提供安全访问、高性能数据传输、租户隔离、简化运营以及更可预测的性能表现。

AI工厂五大基础设施支柱

AI工厂在不同规模层面具有各异的基础设施需求:

Scale-Up:NVIDIA NVLink将GPU整合为统一的相干加速器。

Scale-Out:NVIDIA Spectrum-X以太网和NVIDIA Quantum InfiniBand在AI工厂内跨服务器互联。

Scale-Across:NVIDIA Spectrum-XGS以太网连接分布式AI工厂。

上下文内存:NVIDIA CMX基于面向AI原生存储的NVIDIA STX模块化基础构建,在工厂内提供共享KV缓存存储。

Scale-In:NVIDIA BlueField-4、NVIDIA DOCA和NVIDIA Spectrum-X以太网加速AI计算周围的访问、安全、数据传输和基础设施运营。

南北向网络提供进出数据中心的访问路径,将用户、应用程序、数据源、存储系统和服务连接到各个系统。传统云数据中心围绕软件定义基础设施、可组合性和弹性构建这些网络,以便随需求变化动态配置和扩展资源与访问。

智能体AI的兴起大幅提升了对这一基础设施的需求。软件定义网络、可组合性和弹性依然不可或缺,但已不再充分。AI工厂将大规模加速计算与日益增多的用户、智能体、应用程序、企业数据源和存储系统汇聚在一起,这些组件持续地大规模交互。

基础设施必须作为AI工厂的组成部分进行加速协同设计。安全、多租户网络、数据与存储访问以及基础设施运营,不能仅依赖运行于通用主机CPU上的软件,也不能作为独立管理的层次运作。这些功能必须作为统一的基础设施域协同运转,为运营者提供跨AI工厂访问、数据传输、安全、配置和可观测性的一致控制能力。

Scale-In通过将南北向访问演进为跨AI工厂的统一加速基础设施域来满足上述需求。BlueField-4提供独立于主机的加速与卸载能力,DOCA提供统一的基础设施服务编程与运营模型,Spectrum-X以太网则在Scale-In访问路径(包括外部存储和数据源)上提供高性能以太网连接。三者协同,为运营者提供跨支撑加速计算和数据存储基础设施的访问、数据传输、安全、配置和可观测性的一致控制能力。

存储基础设施集成

AI工厂依赖互补的存储基础设施来支撑持久化数据和推理上下文。Scale-In提供对AI原生存储的高性能访问,涵盖用于训练、推理和分析的AI工厂存储,以及用于检索和多模态索引的企业AI数据系统。此外,CMX为工厂内的共享KV缓存和可复用推理状态提供Pod级存储。BlueField-4既是Scale-In的基础设施处理器,也是CMX的数据与存储处理器。Scale-In将AI工厂和企业数据连接到AI计算,而CMX则保存并共享上下文,从而实现更快、更高效的推理。

这五大基础设施支柱共同满足AI工厂各层面的差异化需求。只有数据访问、存储、网络安全和运营与之同步扩展,GPU、机架和数据中心的扩展才能真正发挥价值。

BlueField-4架构解析

BlueField-4为GPU服务器、智能体CPU系统、AI工厂存储系统和云服务的Scale-In服务提供加速。在NVIDIA Vera Rubin NVL72中,NVIDIA ConnectX-9超级网卡通过Scale-Out网络承载租户工作负载流量,而BlueField-4则运行并加速连接、保护和管理每台服务器的基础设施服务。BlueField-4为运营者提供主机外部的独立基础设施处理域,可在不依赖主机CPU或消耗其资源的情况下管理安全策略、服务状态和遥测数据。

NVIDIA BlueField Astra将可信控制从南北向访问延伸至东西向Scale-Out网络。Astra为服务提供商提供跨两个域统一的、独立于主机的配置、租户隔离和网络策略控制点。BlueField-4负责安装和更新策略、监控遥测数据,而ConnectX-9则直接在数据路径中执行这些策略。这一闭环机制在不将设备管理置于租户主机的前提下,实现了对Scale-In和Scale-Out的一致控制。

BlueField-4将可编程控制平面处理与加速数据平面处理相结合。软件负责制定基础设施决策,而内联引擎则在本地执行这些决策,无需将工作返回主机CPU。这一设计使策略能够跨工厂协调并以线速在本地执行。与BlueField-3相比,BlueField-4提供4倍内存带宽和2倍网络带宽,支持更多并发服务、更大的策略与遥测数据集,以及更高的流量处理和安全吞吐量。

DOCA软件框架

NVIDIA DOCA将BlueField-4的硬件加速器转化为可编程、可部署的Scale-In服务。生产就绪的容器化DOCA微服务可直接在BlueField-4上运行,DOCA库和SDK则为开发者提供加速网络、安全、存储和遥测能力,用于构建自定义服务。DOCA Flow用于编程硬件数据包处理流水线,DOCA PCC支持可编程拥塞行为,DOCA Telemetry提供设备和服务健康状态,DOCA平台框架(DPF)管理配置、部署和更新。BlueField-4的多服务架构和原生服务功能链将每条流量引导通过所需的服务序列。这些能力为Scale-In提供了统一的软件模型,用于跨BlueField-4系统运营服务,而无需管理独立的服务器流水线。

Spectrum-X以太网

NVIDIA Spectrum-X以太网在Scale-In访问路径(包括外部存储)上提供高性能网络。BlueField-4在每个系统处理基础设施服务,Spectrum-X以太网则承载AI工厂与其周边用户、应用程序、数据源、服务和外部存储之间的流量。Spectrum-X以太网解决大规模负载均衡冲突和拥塞问题,提升资源利用率,有助于维持高有效带宽,并隔离并发流量,使访问和存储流获得更加一致、可预测的性能。

BlueField-4 DPU、DOCA微服务和Spectrum-X以太网网络与NVIDIA Vera Rubin协同设计,确保处理器性能、内存带宽、PCIe连接、网络带宽、加速能力和软件能够相互匹配。三者共同提供一条Scale-In路径,在不消耗AI工作负载资源的前提下,处理传输、服务和控制。

智能体AI工厂的核心应用场景

智能体AI工厂必须安全共享加速基础设施、为其提供企业数据、完成系统上线并持续监控性能。以下应用场景展示了BlueField-4加速与DOCA服务如何满足这些生产需求。

多租户AI工厂VPC

AI工厂虚拟私有云(VPC)在共享物理基础设施上隔离租户和应用程序流量。DOCA主机网络(HBN)在BlueField-4上加速南北向三层路由和多租户隔离。DOCA Flow用于编程流量分类和访问控制规则,而DOCA加速的Open vSwitch(OVS-DOCA)则在东西向接口上应用相应策略。BlueField Astra将相同的VPC策略延伸至东西向Scale-Out接口,由此实现单一策略模型同时管控访问和Scale-Out流量。

在Vera Rubin中,这一协调模型覆盖7.2 Tb/s的聚合接口带宽,由南北向BlueField-4路径上的800 Gb/s和每个计算托盘四条1.6 Tb/s的东西向路径构成。这一设计在无需将所有东西向流量路由至800 Gb/s接口的情况下,实现了对访问和Scale-Out流量的一致策略覆盖,为运营者提供云级弹性、一致隔离、更低主机CPU开销以及更高效的共享AI基础设施利用率。

安全与多域策略执行

BlueField-4将执行点置于硬件内部、主机操作系统之外。租户软件无法禁用或绕过这些控制,而卸载的安全处理保留了主机CPU资源,避免额外的软件跳转。BlueField-4以线速加速威胁检测并执行网络、文件和对象访问策略。DOCA Argus提供运行时威胁检测,DOCA Vault执行文件访问策略,DOCA Flow则编程线速网络执行。BlueField Astra协调每台服务器不同网络上的加密、隔离和策略,同步南北向和东西向流量的策略、遥测、密钥和执行,将特权安全控制置于租户主机之外,为共享AI服务提供一致保护,同时为AI工作负载保留主机资源。

高性能AI存储访问

Scale-In将AI计算与来自外部存储的训练数据、模型资产、企业知识和应用数据相连接。若存储协议处理、存储虚拟化或数据传输无法跟上节奏,即便拥有可用计算资源和Scale-Up/Scale-Out网络带宽,GPU也将陷入等待。

BlueField-4在专用基础设施上加速NVMe-oF、基于RDMA和TCP的文件与对象存储协议、存储虚拟化以及数据传输。Spectrum-X以太网在存储路径上提供AI优化的以太网网络,其拥塞管理和性能隔离能力有助于在并发存储流中维持高有效带宽,相比现成以太网可提升最高1.45倍的存储吞吐量。这一方案降低了主机CPU开销,有助于持续为AI计算供给数据,并为训练、检索和推理提供更一致的企业数据访问能力,与CMX形成互补。

自动化配置与编排

AI工厂节点在运行AI工作负载之前,必须完成配置、设置、安全加固和网络连接。BlueField-4负责节点入网、配置网络和存储资源、启动服务器并通过网络加载主机操作系统。由于这一控制平面独立于主机运行,它能够在租户软件启动之前建立策略并配置资源。DOCA平台框架是一个Kubernetes原生编排框架,将BlueField DPU作为Kubernetes节点进行配置、管理和扩展,负责管理整个AI工厂的DPU发现、配置、服务部署和更新,从而缩短部署时间、提升配置一致性、保留主机CPU资源,并更快地将新AI容量上线。

全栈可观测性

在规模化运营AI工厂时,需要对网络流量、存储访问、服务健康、性能和资源利用率保持持续可见性。DOCA Telemetry收集并将这些信息导出至网络监控平台,DOCA库则使可观测性提供商能够将相同的基础设施信号集成到自有工具中。通过BlueField-4收集遥测数据,运营者可在不依赖租户主机软件的情况下保持可见性。当基础设施遥测扩展至GPU和网络利用率时,运营者可识别与访问、流量、存储、策略执行或工作负载放置相关的约束。这种全集群可见性有助于检测异常、定位瓶颈,并在影响AI工作负载之前解决故障。

总结

Scale-In将南北向网络演进为用于数据访问、安全和运营的协调加速基础设施域。NVIDIA BlueField-4提供网络加速,DOCA负责服务的编程和运营,Spectrum-X以太网则在Scale-In访问和存储路径上提供高有效带宽与性能隔离。三者协同,有助于将大规模计算转化为安全、可运营的AI工厂平台。

Q&A

Q1:NVIDIA Scale-In网络基础设施是什么?它有什么作用?

A:Scale-In是NVIDIA AI网络的第五大支柱,由BlueField-4 DPU、DOCA软件框架和Spectrum-X以太网共同构成。它将传统南北向网络演进为AI工厂的统一加速基础设施域,负责处理安全、多租户隔离、数据与存储访问以及基础设施运营,同时将这些任务从主机CPU卸载,避免其成为AI计算扩展的瓶颈。

Q2:BlueField-4相比BlueField-3有哪些提升?

A:BlueField-4相比上一代BlueField-3提供了4倍的内存带宽和2倍的网络带宽。这些提升使其能够支持更多并发服务、处理更大规模的策略与遥测数据集,并实现更高的流量处理和安全吞吐量,从而满足智能体AI工厂日益增长的基础设施需求。

Q3:DOCA平台框架在AI工厂中如何简化运营?

A:DOCA平台框架(DPF)是Kubernetes原生编排框架,可将BlueField DPU作为Kubernetes节点统一管理。它负责DPU的自动发现、配置、服务部署和版本更新,整个控制流程独立于主机运行,在租户软件启动前即可完成资源配置,从而缩短部署时间、提升配置一致性,并更快速地将新AI算力上线。