核心要点
- 英伟达宣布 Groq 3 LPX 芯片已进入全面量产,标志着这笔公司史上最大收购所获得的技术正式实现商业化落地。
- 英伟达加紧生产该芯片并交付客户,凸显低延迟推理的重要性 —— 只有低延迟,AI 智能体才能给用户反应灵敏的使用体验。
- 这家芯片厂商在去年 12 月斥资 200 亿美元收购了 Groq 的相关资产。
英伟达周一宣布,Groq 3 LPX 机柜已经全面量产,这代表该公司史上最大一笔收购所获取的技术正式走向商用。
英伟达高级总监迪翁・哈里斯向媒体透露,Groq 机柜将与 Vera 中央处理器、Rubin 图形处理器一同部署在 Nebius(NBIS,新型云服务商)的数据中心,将于今年晚些时候正式上线。
英伟达全力赶工生产 Groq 芯片、尽快交付客户,反映出低延迟推理的地位愈发关键。想要让 AI 智能体做到响应迅速、不给用户带来明显等待时延(尤其是代码开发场景),低延迟推理必不可少。英伟达表示,云服务商可以为这类高速 Token 输出服务收取更高费用。
哈里斯在电话会议中表示:“对于提供 Token 输出服务的厂商而言,该产品让他们可以面向对延迟极度敏感的客户,推出高端增值服务套餐。”
去年 12 月,英伟达斥资 200 亿美元收购 Groq 资产,这是该公司有史以来规模最大的一笔收购。
Groq 芯片架构在芯片裸片内置 500MB 高速静态随机存储器(SRAM),以此缓解内存带来的性能瓶颈。Groq 芯片由三星代工生产;而英伟达 GPU 则由台积电(TSM)制造。
英伟达在单台 LPX 机柜内集成 256 颗 Groq 3 芯片。引用 Artificial Analysis 的基准测试数据,Groq 3 LPX 机柜每秒可输出 3400 个 Token。
该赛道竞争激烈。规模相对较小的 GPU 厂商 AMD 今年早些时候宣布,会将自家机柜级系统与近期完成上市的 Cerebras(CBRS)芯片结合,主打低延迟推理场景。OpenAI 新推出的 “极速模式(Ultrafast)” 正是由 Cerebras 硬件提供算力,每秒输出 750 个 Token。
低延迟芯片并不会取代 GPU。GPU 是 AI 领域的主力芯片,同时兼顾训练与推理任务,灵活性强,能够适配新技术与各类大模型。Groq 这类低延迟芯片,主要专门负责模型服务流程里的解码阶段(decode phase)。
哈里斯称:“这并不是要取代 GPU。而是针对不同业务负载,选用最合适、性价比最优的处理器。”
英伟达目前正在扩大 Vera Rubin 系统的出货量,该系统于今年启动生产。在今年 3 月的 GTC 大会主题演讲上,英伟达 CEO 黄仁勋预测,到 2027 年,当前一代 Blackwell 芯片加上全新 Vera Rubin 系统,累计订单规模将达到 1 万亿美元。
黄仁勋当时表示,计划把面向代码开发业务的数据中心四分之一的机柜空间分配给 Groq 芯片。 “数据中心其余全部机柜,100% 部署 Vera Rubin。” 黄仁勋说道。
英伟达将于本周三发布财报。