关于ZAKER Skills 合作
钛媒体 16分钟前

对话芯展速许玮:“内存墙”下,AI 缺的是 GPU 的“放大器”

Token 经济时代,衡量 AI 价值的标准,正从模型能力转向 Token 生产效率。AI 因此从工具演变为新的关键生产要素,而存储也从单纯的资源供给,升级为支撑 Token 持续、高效生产的系统能力。

过去几年,AI 行业信奉一个朴素的逻辑:算力不够,就堆更多的 GPU、更贵的 GPU。但对于中小企业和个人开发者来说,通常只能是望 " 卡 " 兴叹。而在算力欠缺的背后,更需要搞明白一个事实,那就是 GPU 有效算力利用率仅 30%-60%。

2026 年 5 月 Dell World 大会上,NVidia CEO 黄仁勋对彭博表态:" 当前 AI 产业最大的制约因素根本不是 GPU 算力,而是存储 ",并解释 "GPU 大部分时间都在等待数据 "。当大模型推理从 " 以算力为中心 " 走向 " 以效能为核心 ",数据和存储才是下一阶段 AI 基础设施的核心命题。

"AI 的竞争,本质上是算力效率的竞争。" 芯展速产品副总裁许玮表示,推理成本的优化已从单纯堆叠算力,转向数据和存储 " 存算协同 " 的系统级效率提升。要做的是如何在有限的条件下,去尽最大可能挖掘每一块 GPU 的利用率,从而去实现算力的平权。

内存墙,AI 发展的新瓶颈

算力,是 AI 时代绕不过去的词语。

这几年,AI 产业的竞争几乎围绕 " 算力 " 展开。无论是英伟达 GPU 持续供不应求,还是云厂商不断扩建 AI 数据中心,行业普遍认为,只要拥有更多 GPU,就意味着拥有更强的算力能力。然而,随着大模型推理和 AI Agent 进入规模化应用,一个越来越明显的现象开始出现:GPU 越来越强,但真正能够释放出来的算力却没有同步提升。

许玮透露,即便是英伟达最新一代 GPU,在实际推理场景中的有效算力利用率也普遍只有 30% 至 70%,大量昂贵的计算资源并没有持续处于计算状态,而是在等待数据。

问题的根源,在于 AI 计算体系出现了越来越严重的 " 算存失衡 "。

AI 推理并不是一个单纯的计算过程,而是一个完整的数据流动过程。模型参数需要不断读取,KV Cache 需要持续更新,数据需要在 GPU、显存、CPU 以及存储系统之间频繁交换。计算、存储、通信三个环节环环相扣,任何一个环节跟不上,都将拖慢整个系统的效率。

过去二十年间,GPU 计算能力实现了跨越式增长,整体算力提升约 6 万倍。相比之下,显存容量却仅增长几十倍。计算能力与存储能力增长速度的巨大落差,使得数据供应速度远远赶不上 GPU 计算速度,一道越来越宽的 " 内存墙 " 由此形成。

许玮指出," 内存墙 " 让昂贵的算力芯片普遍处于 " 吃不饱 " 的等待状态,正在成为 AI 推理性能的核心瓶颈。现在,这一矛盾进一步被放大。算力越堆越多,能用的却越来越少。

随着模型参数不断增加、上下文窗口持续扩展,以及 AI Agent 需要处理更长、更复杂的任务链路,推理过程中 KV Cache 规模迅速膨胀,占用大量 GPU 显存。当显存资源不足时,系统不得不频繁在 GPU、CPU 内存和存储之间进行数据交换,甚至重复计算历史 Token,不仅增加了推理延迟,也进一步降低了 GPU 利用率。

从本质上来看," 内存墙 " 并非单纯的存储容量不足,而是计算能力增长速度远远超过数据供给能力所形成的系统性瓶颈。当算力与存储无法保持同步演进,GPU 便难以持续 " 吃饱 ",整个 AI 基础设施的性能天花板也不再由计算芯片决定,而开始受到存储架构和数据流动效率的制约。

" 因此,对于当前 AI 产业而言,真正需要解决的问题,已经不是如何继续堆叠更多算力,而是如何打破‘内存墙’,让已有算力得到更充分、更高效的释放。" 许玮说道。

不堆算力,用存储扩展显存

事实上,无论是消费级的 RTX 5090 还是数据中心的 B300,都同样面临 " 内存墙 " 带来的制约。GPU 计算能力不断提升,但显存容量和数据供给能力的增长却相对有限,导致算力增长与系统整体效率并不同步。

当下,大量开发者和企业希望利用消费级 GPU 进行 AI 推理与微调,但面临两个核心瓶颈:一个是多卡并行效率受限:消费级 GPU 默认 P2P 通信被限制,多卡数据需经 CPU 中转,延迟高,数据传输路径被迫拉长。资源消耗大,大量的 PCIe 带宽被低效的数据搬运所浪费,系统整体性能被卡在 " 通信 " 环节。

另一个则是长上下文处理困难:传统 KV Cache 显存利用率通常低于 40%,极大地限制了单卡兵法能力。并有严重的内存碎片化问题,超长文本(8K+ token)易触发 OOM,长文档问答几乎不可用。

面对日益突出的 " 内存墙 ",行业并非没有应对方案。最直接的路径,依然是继续提升算力,去堆更贵的芯片。只是,这样的做法虽然能够提升性能,但成本却呈现非线性增长——投入不断增加,性能收益却难以保持同样幅度的提升。

" 你可以极端地去堆最贵的 GPU 卡,也不能说他错,只不过这种所谓的标准配置是一种商业妥协。" 在许玮看来,用户不应该只看 GPU 参数,而要看整个系统的效能。

所谓系统效能,不仅包括 GPU 自身的计算能力,更包括数据如何流动、显存如何利用、多卡之间如何通信,以及整个推理过程能否保持高效率。对于企业而言,真正需要关注的不是拥有多少 TOPS,而是在训练和推理过程中,能够以多高效率完成 Token 生成。

在这样的背景下,行业开始出现另一条技术路线——用存储扩展显存,不是做更贵的专业卡,而是释放消费级 GPU 的潜力。芯展速也是选择的这一路径,并在 WAIC 2026 上展示了 AI90 解决方案。许玮称," 推理成本的优化已从单纯堆叠算力,转向数据和存储‘存算协同’的系统级效率提升。"

据介绍,针对 P2P 通信的缺失,AI90 通过智能 P2P 互联技术解锁硬件 P2P,优化 GPU 间的数据通路,使消费级 GPU 在跨卡通信时无需再经过 CPU 和主机内存中转,实现 GPU 直连,实现 GPU 之间的直连,提升多卡并行效率。

至于 KV Cache 的不足问题,AI90 通过将 KV Cache 从 HBM 卸载至高性能 SSD,构建 "HBM+DRAM+SSD" 三级存储体系,让原本受限于显存容量的大模型推理拥有更大的缓存空间,缓解长上下文场景下的显存压力。

"AI 的竞争,本质上是算力效率的竞争。" 许玮表示,当大家都在堆 GPU 的时候,我们选择从存储侧切入,是为了让每一块 GPU 都能真正发挥出全部算力。

算力平权,仍需整个产业链作答

不做 GPU,但做 GPU 的 " 放大器 ",AI90 更强调的是 AI 部署成本的下降,中小企业、开发者甚至个人用户,也能够基于消费级 GPU 部署本地 AI,而不必完全依赖昂贵的数据中心资源。

根据芯展速在 WAIC 展会上公布的数据,在 AI90 的解决方案下,Llama 3 70B 模型推理,4 卡 5090 集群吞吐量从 120 tk/s 提升至 610 tk/s;64K 上下文首 Token 延迟从 27.99 秒降至 0.564 秒,显存利用率从 30%-40% 提升至 85%-95%,支持上下文从约 8K 扩展至 128K+。

不过,现阶段仍然有很多工作要做,比如异构 GPU 架构的适配,以及更多生态伙伴共同支持。

在许玮看来," 这是一个超千亿的市场,用存储扩展显存,本质不是为了和谁竞争,更多的是希望让每一块钱的算力投资产出更多 Token,让每一家中小企业和开发者都用得起大模型。"

" 将存储变为‘算力的放大器’,这不仅是技术选择,更是 AI 基础设施走向普惠的必然路径,算力平权的‘ iPhone 时刻’也终会到来。"(文 | 志读科技,作者 | 杜志强,编辑 | 杨林)

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容