英伟达 CEO 黄仁勋展示薇拉・鲁宾(Vera Rubin)服务器机柜
作者:刘菲比
各家云服务商近来搭建数据中心屡屡受阻,如今终于迎来利好:英伟达新一代芯片大概率不会再给部署添堵。
多家采购英伟达 AI 服务器的云厂商高管向我证实,经过首轮实测,他们预计即将落地的薇拉・鲁宾服务器机柜,安装难度会远低于 2025 年的格蕾丝・布莱克威尔(Grace Blackwell)机柜。去年,英伟达头部客户被一大堆从未接触过的全新技术折腾得焦头烂额。相关落地难题此前一直对外秘而不宣,直到我的同事做了相关报道才公之于众。
云厂商在硬件上动辄投入数十亿美元,服务器每多一周调试排障,面向 AI 客户的高收益算力资源上线时间就多一周延迟;部署延期还会造成数据中心承建方订单交付滞后、利润被压缩。
目前薇拉・鲁宾机柜刚小批量交付客户,一切尚处早期阶段。真正的大规模落地考验将在明年到来,届时客户会大批量收货,单次交付可达数百乃至上千台机柜。
英伟达计划在明年下半年推出性能更强的升级版机柜,但这款高配产品大概率会带来新麻烦:整机功耗大幅提升,服务器之间组网所需交换机、线缆数量也会显著增加。
现阶段客户测试的基础版机柜单台内置 72 块 GPU、36 颗 CPU,本质属于英伟达第三代成熟产品,并非从零研发的全新架构,硬件配置和布莱克威尔机柜高度趋同。(可支持 144 颗、576 颗 GPU 互联的高性能版薇拉・鲁宾机柜目前尚未投产。)
一位云行业高管表示:“坦白来讲,我们认为大规模部署薇拉・鲁宾不会太过棘手,机械结构与散热方案都已经迭代到第三代,成熟度很高。”
英伟达称,薇拉・鲁宾系统和客户现有适配布莱克威尔服务器的软件兼容性良好。不过两名云厂商高管坦言,企业仍需要花费数月调试软件,才能支撑大批量集群稳定运行薇拉・鲁宾机柜。
业内戏称部署如同 “玄学操作”
薇拉・鲁宾机柜采购成本至少是初代布莱克威尔机柜的两倍,但英伟达给出的数据显示,以每瓦每秒 AI 词元产出量(tokens per second per watt)为衡量标准,新硬件能效提升整整 10 倍36氪。
当然,薇拉・鲁宾机柜安装依旧算不上轻松。一名云厂商高管表示,该机柜大量零部件都是全新设计;整机零部件总数达 130 万个,而初代布莱克威尔机柜为 120 万个。
英伟达薇拉・鲁宾 NVL72 计算托盘,内含 4 块鲁宾 GPU、2 颗薇拉 CPU。今年 3 月英伟达 GTC 开发者大会上,黄仁勋展示了用于鲁宾芯片互联的全新网络交换机,坦言这类硬件研发难度极高:“想要做好这套硬件难如登天,这件事本身就极具挑战。”
黄仁勋并未说明这套全新芯片互联网络会不会给客户落地制造障碍,但正是同类网络技术拖慢了去年布莱克威尔机柜的大规模落地进度。甲骨文负责大型算力集群(包含即将上线的鲁宾服务器)的员工称,排查这类集群的网络故障极其困难,全靠经验摸索,堪称 “玄学排查”。
鲁宾机柜单机功耗较布莱克威尔机柜上涨 75%,运行发热更高。有意思的是,新机柜配套散热系统本身功耗低于布莱克威尔的散热方案,但安装调试流程更复杂。一名长期跟踪英伟达的分析师透露,散热工程问题导致首批薇拉・鲁宾服务器量产延期约两个月。英伟达官方发言人回应:“产品规划与此前对外披露的信息保持一致,无任何变动。”
除此之外,鲁宾服务器顺利上线不只取决于英伟达硬件本身。大量客户按照英伟达推荐的机房布局、布线方案、管理软件新建专属数据中心,以此适配鲁宾机柜高效部署。
GPU 云服务商 Vltr 首席营销官凯文・科克伦表示,客户必须从零搭建整套全新基础设施适配鲁宾设备,改造现有老旧机房成本过高,得不偿失。
Ultra 高性能版本暗藏新挑战
另一大变数是明年即将推出的薇拉・鲁宾 Ultra 高配机柜。这款机型新增多项全新设计,适配调试需要耗费大量时间。常规服务器托盘是横向插入机柜,而 Ultra 机型的芯片托盘改为竖向插入,如同书架摆放书籍,重力会给整套系统带来完全不同的受力负荷。
Ultra 机柜最多可实现 576 块 GPU 互联互通,单机功耗接近普通版的三倍,这些变化都可能催生新的落地难题。
英伟达硬件高级副总裁安德鲁・贝尔本月早些时候表示,当年布莱克威尔架构几乎重构了整套 GPU 体系,软硬件全部推倒重来,让客户落地苦不堪言。
与之相比,薇拉・鲁宾改动更温和,“量产制造难度大幅降低”。贝尔给出数据:鲁宾芯片托盘一次组装合格率可达 95%,而初代布莱克威尔整机初次组装成功率仅 20%。
并非所有人都认可这套乐观判断。另有云厂商高管对此存疑,认为高性能版鲁宾依旧会重蹈布莱克威尔的覆辙,部署难度不相上下。