NVIDIA Vera Rubin 提升每瓦性能,为全球合作伙伴实现最低 Token 成本
在全球 300 多家合作伙伴的支持下Vera Rubin 正加速在全球范围内扩大部署。CoreWeave、Google Cloud、Microsoft Azure 和 Mistral 等 NVIDIA 合作伙伴正纷纷部署 Vera Rubin该平台在每瓦性能和最低 Token 成本方面树立了基准测试的新标杆。NVIDIA Vera Rubin 正式登场正迈向十亿瓦级规模部署。Vera Rubin NVL72 的量产正全面加速CoreWeave、Google Cloud、Microsoft Azure 和 Oracle Cloud Infrastructure 等合作伙伴的机架已投入运行。Vera Rubin 的供应链覆盖 30 个国家的 350 多家工厂拥有迄今为止规模最大、最成熟的机架级供应链旨在全面满足客户的算力需求。Vera Rubin 平台从芯片到电网进行了全栈协同设计旨在提供最高的每瓦性能和最低的 Token 成本。CoreWeave 针对 DeepSeek-R1 的首次基准测试结果充分证明了这一点其每兆瓦吞吐量比 Grace Blackwell NVL72 提升了 10 倍——这直接切中了电力受限的 AI 工厂最关心的核心指标。通过极致协同设计提升性能取得这一突破的关键在于七款芯片和五种机架托盘之间的极致协同设计。五种机架系统包括 Vera Rubin NVL72、Vera CPU 机架、Groq 3 LPX、Spectrum-6 SPX 和 Vera BlueField-4 STX。它们被作为一个完整的系统进行工程研发而非由通用产品简单拼凑而成。NVIDIA Vera CPU 正是其核心所在。它重新定义了“AI 工厂 CPU”应有的形态。专为智能体时代设计其定制 Olympus 核心相较竞品的芯粒chiplet方案单线程性能提升 2 倍、核间带宽提升 3 倍、内存延迟降低 40%使其成为面向最关键智能体负载时最高效的单线程 CPU。以专属定制网络加速 AI 工厂建设在网络方面该平台的第六代 NVLink 纵向扩展技术在处理复杂工作负载时相比通用以太网吞吐量提升超过 2 倍、延迟降低 1/3、数据包处理速率提升 10 倍。在横向扩展方面Spectrum-X 以太网集成 102.4T 的 Spectrum-6 交换机系统、1.6T 的 ConnectX-9 SuperNIC、自适应路由、高级拥塞控制、遥测技术以及开放的操作系统支持使其 RDMA 带宽比通用以太网高出 1.6 倍。包括 CoreWeave、微软、SpaceXAI 和 Tesla 在内的全球领先的 AI 基础设施建设者率先采用 Spectrum-6 交换机以加速其 AI 工厂的建设。此外采用 NVIDIA 光电一体化封装CPO技术用于横向扩展这是全球首款实现量产的同类型交换机与传统可插拔收发器相比其能效提升了 5 倍平均无故障间隔时间MTBI提升了 10 倍。CoreWeave、Lambda 和 OCI 率先采用该技术。Spectrum-XGS 以太网跨站点吞吐量提升 1.9 倍实现跨站点性能增强。满足十亿瓦级 AI 工厂的建设不再局限于单一建筑的需求。同时NVLink Fusion 向第三方 XPU 开放了 NVIDIA 基础设施平台为合作伙伴能够借助成熟的 NVLink 纵向扩展堆栈和生态系统实现产品的快速上市。节省部署时间节约水资源经过三代机架级协同设计的迭代NVIDIA 打造出的 Vera Rubin NVL72 系统实现了托盘内无电缆、无风扇、无液冷软管的极简设计将计算托盘的组装时间从过去的数小时大幅缩短至仅需 1 分钟。45 摄氏度的液冷进水温度设计使得系统无需冷水机组仅靠干式冷却器即可运行。对于新建的 AI 工厂而言这种高温干式冷却结合闭环液冷系统每兆瓦每年可节省数百万加仑的水资源。NVIDIA Vera Rubin驱动欧洲开放模型时代Vera Rubin 正为欧洲的 AI 基础设施注入下一代性能。Vera Rubin 也是微软与 Mistral 新一轮深化合作的基石。该合作将前沿 AI 带到了欧洲把开放的欧洲模型与云环境及客户管理的环境相结合使各国政府和重点监管行业能够按照自身需求采用 AI 技术。Mistral 正在扩充其 GPU 算力通过引入数千个最新的 NVIDIA Vera Rubin GPU增加面向客户的 AI 算力供给并为训练、推理和大规模部署提供共享平台。NVIDIA Vera Rubin 正迈入全面量产阶段。这款机架级 AI 超级计算机将七款协同设计的全新芯片整合为一个统一系统它将调用数万个 GPU为新一代 Mistral Compute 和微软欧洲的 AI 基础设施提供动力。打造真正适配当地语言、文化与法规的 AI 不应要求组织在创新、经济效益与控制权之间做出取舍。以 Vera Rubin 为计算基础依托微软和 Mistral 提供的自主云基础设施与欧洲开放模型欧洲完全可以三者兼得。CoreWeave 基准测试显示NVIDIA Vera Rubin 系统每兆瓦Token 吞吐量达 Blackwell 的 10 倍通过与 NVIDIA 进行极致的协同设计CoreWeave 正依托 Vera Rubin NVL72 实现数量级的性能跃升。与 CoreWeave 等合作伙伴的紧密协作对于将新一代 NVIDIA 加速计算成功部署至 AI 工厂至关重要。经过数月的联合工程研发CoreWeave 成为首家完成 Vera Rubin NVL72 部署与验证的 AI 云服务提供商——他们首次公布了基于实际运行硬件测得的性能数据。CoreWeave 在 Vera Rubin NVL72 上运行了 DeepSeek-R1 基准测试。结果显示与 Grace Blackwell NVL72 相比Vera Rubin NVL72 每兆瓦每秒 Token 吞吐量提升了 10 倍。每兆瓦 Token 吞吐量是决定 AI 基础设施能否实现大规模盈利的核心指标。每兆瓦产出的 Token 越多意味着在同等电力预算下能产出更多的智能算力或者在显著降低功耗的情况下处理相同的工作负载。Jane Street 等 AI 实验室和企业将采用 Vera Rubin 平台在 CoreWeave 云上扩展其 AI 工厂。NVIDIA Vera Rubin 系统驱动全新 Google Cloud A5X 实例助力 Ineffable Intelligence 发展NVIDIA Vera Rubin NVL72 正在为 Google Cloud 的首个 A5X 实例提供算力支持该实例现已由伦敦初创公司 Ineffable Intelligence 率先采用。Ineffable Intelligence 致力于开发新一代智能“Superlearner”系统该系统能够通过经验持续学习从而在各个领域实现新的突破。NVIDIA Vera Rubin NVL72 专为这类智能体训练而设计能够提供可预测的低延迟、高利用率以及远超上一代系统的单位智能算力产出。这使其成为大规模强化学习的理想平台选择。在 Google Cloud Next 上发布的 Google Cloud A5X 实例是基于 NVIDIA Vera Rubin NVL72 机架级系统构建的裸金属实例。与上一代相比其每 Token 推理成本降低至 1/10每兆瓦 Token 吞吐量提升了 10 倍。NVIDIA Vera CPU助力 DeepInfra AI 云实现编排速度翻倍DeepInfra 的基准测试结果显示NVIDIA Vera CPU 的运行速度是其他 CPU 的 2 倍以上并且能够支持更多并发的 AI 智能体。作为 NVIDIA 开放 AI 生态系统的早期伙伴云平台 DeepInfra 基于其生产级 AI 智能体基础设施独立设计并运行了基准测试。DeepInfra 每周处理近 5 万亿个 Token其中约 30% 由智能体系统驱动。其云平台专为高吞吐量的 AI 推理而打造。基准测试表明在保持相同服务质量的前提下Vera CPU 支持的并发 AI 智能体数量比其他 CPU多出高达 1.6 倍编排速度快 2.2 倍同时还能提高基础设施的利用率和成本效益。这些结果充分证明NVIDIA Vera CPU 能够提供生产级智能体 AI 所需的成本效益、低延迟和高吞吐量。DeepInfra 的基准测试充分凸显了 NVIDIA Vera CPU 如何帮助云服务提供商提升基础设施利用率、提高成本效益并在保持相同服务质量的前提下支持更多并发的 AI 智能体。