
当地时间周一(8 月 24 日),英伟达高级总监 Dion Harris 表示,Groq 机架将与 Vera 中央处理器和 Rubin 图形处理器一同部署在新型云服务商 Nebius 的数据中心,并将于今年晚些时候上线。
英伟达加速生产 Groq 芯片并向客户提供产品,凸显出低延迟推理的重要性日益提升。低延迟推理能够让 AI 智能体更快响应,避免用户长时间等待,在编程等应用中尤其重要。
Harris 说道,云服务商可以针对这类 token(词元)收取更高费用," 对于那些提供 token 服务的企业而言,这让他们能够为那些对延迟极其敏感的用户和客户提供高级服务套餐。"
去年 12 月,英伟达与 Groq 达成 200 亿美元交易,获得了 Groq 的芯片技术授权,多位核心员工也加入了英伟达,创始人 Jonathan Ross 更是担任了英伟达首席软件架构师。
今年 3 月,英伟达发布了为 Vera Rubin 平台研发的推理加速器 Groq 3 LPX。Groq 架构在芯片裸片上集成了 500 兆字节的高速静态随机存储器(SRAM),以减少与内存相关的瓶颈。
据了解,Groq 芯片由三星制造,而英伟达的 GPU 则由台积电生产。每一个 LPX 机架可整合 256 颗 Groq 3,英伟达援引 Artificial Analysis 的基准测试称,整合后的机架每秒可处理 3400 个 token。

近期,OpenAI 推出的 "Ultrafast" 模式承诺每秒可处理 750 个 token,由 Cerebras 提供支持。
需要指出的是,低延迟芯片并不能取代作为 AI 芯片主力的 GPU。GPU 既能够执行训练,也能够进行推理,同时具备足够的灵活性,可以适应新技术和新模型。
Groq 这类低延迟芯片则主要专注于模型服务中的一个环节,即 " 解码 "(decode)阶段。Harris 也提到:" 这并不是要取代 GPU,而是要针对工作负载的不同环节,使用价格合适、处理能力合适的处理器。"
英伟达目前正在加快 Vera Rubin 系统的出货速度。黄仁勋先前曾预计,到 2027 年,当前一代 Blackwell 芯片和新一代 Vera Rubin 系统的累计销售额将达到 1 万亿美元。
黄仁勋当时表示,他计划将面向编程应用的数据中心空间中约四分之一分配给 Groq 芯片。" 我的数据中心其余部分将 100% 采用 Vera Rubin。"