
AI 大推理时代已经到来,旧有衡量尺度正在失效,从模型到芯片,各环节都在探索新的范式。7 月 18 日,云天励飞董事长兼 CEO 陈宁在 2026 世界人工智能大会(WAIC)的一场论坛主题演讲中,给出了自己对芯片发展方向的最新判断。
在他看来,2012 到 2025 年是 AI 训练的时代,模型和芯片都专注在 " 做大做强 " 这件事上,NPU 曾与小模型共同起舞,而具备超大规模并行计算单元的 GPGPU 则最终在大模型潮起之际唱上了主角。但推理和训练不同,面向的是大量不同的模型、应用和服务等级,核心需求要看能否覆盖多场景,并实现高吞吐、低成本。
如此复杂的需求,还能否找到通用解法?
陈宁给出的答案就是 GPNPU,融合 NPU、GPGPU 以及近存计算和算力积木,在保持高性能、灵活性的基础上挖掘效率、降低时延,并为大规模互联、算力扩展打下基础。
他还进一步表示,在推理时代,AI 算力的竞争会在从单颗芯片性能走向 Token 生成效率,想要打造极致的 Token 性价比,除了新的推理芯片,更需要重构 AI 基础设施。
我们了解到,在今年的 WAIC 上,云天励飞也正式公布了面向 AI 推理芯片与集群的技术路线图,并披露计划未来推出三款云端大算力推理芯片:DeepVerse100P、DeepVerse100D 和 DeepVerse100L,针对不同推理环节进行专用优化,并共同提升系统效率。根据该规划,云天励飞将进一步探索面向万卡异构集群的分离式推理芯片与集群方案,并持续完善 IFWA 软件栈。
资料显示,云天励飞成立于 2014 年,是国内最早探索 AI 推理芯片的企业。2023 年,公司登陆科创板,成为 "AI 推理芯片第一股 "。
陈宁在 WAIC 期间对我们介绍称,公司一直坚定聚焦 AI 推理,坚持芯片算法化的技术主线,早在 2024 年就率先开始布局第五代 GPNPU 架构,定位是以 GPNPU 为核心架构,以 Token 性价比作为最终评价尺度,推动 AI 推理芯片、集群与配套软件栈协同优化。
陈宁还表示,公司将持续联合产业链、科研机构及生态伙伴共同发起 "1001 计划 ",以 " 百亿 Token 一分钱 " 为长期目标,推动 Token 生成效率和成本的协同优化,让 AI 算力走向规模化、普惠化应用。
推理时代需要什么样的芯片?
就连芯片巨头,也在忙着卸下思维惯性的包袱。
英伟达就是最佳例证。在 AI 训练时代,Hopper、Blackwell 都是在单颗芯片的性能上做文章。但迭代到今年年中刚刚全面启动量产的 Vera Rubin 时,英伟达在这套架构中 " 塞 " 了 7 颗不同芯片,除了 CPU、GPU 等,还包括从推理芯片厂商 Groq 处获取的 LPU,而 LPU 实际上也是 NPU 的一种,主打超低延迟的推理场景。知名半导体研究机构 SemiAnalysis 就曾分析称,英伟达在新产品中集成 LPU 旨在战略互补,补齐推理短板,是具有时代指标性质的关键战略举措。

在推理芯片领域,云天励飞也给出了类似的解题思路。
以其最新公布的三款芯片为例,它们分别针对 Prefill、Decode 和 Decode FFN 环节进行了专用优化,又最终组成一个推理集群。
具体拆解来看,Prefill 和 Decode 是推理的两大关键环节,前者主要是跑大量文本,对计算能力要求高,后者则是利用这些数据生成 Token,内存带宽和数据访问效率更敏感。在 MoE 模型中,Decode 中的 " 访存密集型 " 任务 Attention 容易被带宽卡住,而 " 计算密集型 " 任务 FFN 则对算力更敏感。
资料显示,DeepVerse100P 是面向百万级上下文 Prefill 场景打造的产品,针对 Prefill 和 Decode" 抢资源 " 的 " 老毛病 " 进行了优化,主要用在企业级 AI Coding、长视频生成等场景。
第二款 DeepVerse100D 则主要面向 Decode 环节,重点提升内存带宽和互联效率,降低多节点通信阻塞及尾延迟,主要面向大规模的 AI Chat 和 Agent 应用,以及一些更加复杂的 AI Coding 任务上。
第三款 DeepVerse100L 聚焦 FFN 环节,用 3D Memory 架构大幅提升内存带宽,并通过低延迟芯片互联和激活数据快速传输,提高计算与通信的并行效率,计划应用在更加复杂的长周期 Agent 任务中,也被寄望于提供给未来能自主化的 Agent。
而这三款针对性优化的芯片,最佳用法则是共同组成推理集群、多卡超节点,通过集群服务更多样化、大规模的场景,并打造极致性价比的推理工厂,共同构建面向万卡异构集群的分离式 AI 推理基础设施。
AI 价值落地,Token 经济起飞
今年的 WAIC 上,几乎所有人都在谈论 Token,几乎所有关切,都指向 AI 如何落地兑现经济价值。
但花样翻新的应用尝试和层出不穷的商业探索,往往都会碰上共同的瓶颈:Token 的价格太高,这也让 AI 在垂直产业的落地难以凸显经济效益。
而高价 Token 的背后,一方面是 AI Coding 和 Agent 的火爆,让推理需求迅速膨胀,另一方面则是供给侧算力增长有限,跟不上需求增速。更加值得注意的是,这不仅导致了 Token 价格的震荡,还引发了 Token 质量的波动,甚至出现了 " 钱越花越多,买到的 Token 质量却越来越差 " 的问题。不少专家认为,Token 服务如果继续 " 野蛮生长 ",将极大影响市场环境,让消费者、需求方对 Token 经济产生负面情绪。
无论从供需还是从质量来看,这个时代都在呼唤新的算力基础设施。
陈宁也将之视为云天励飞做 AI 推理基础设施的重要意义。此次云天励飞发布的推理芯片与集群规划显示,该方案设施将按照不同推理环节的负载特征,配置相应芯片和资源池,并通过高速互联实现协同运行。其优化范围由单颗芯片扩展至计算、访存、互联、调度和软件等系统环节。

这一路线重构也衍生出了 "Token 经济学 " 的新解。
陈宁分析称,AI 算力的衡量标准已由峰值性能,进一步延伸至 Token 生成效率和单位 Token 成本。最终,对于 AI 落地这个大命题来说,无论是模型厂、应用层还是算力方,真正影响商业化效率的,是在一定时间和成本条件下,能够稳定生成多少有效 Token。
" 只有 Token 像水和电一样想当然的存在,不用担心成本,一场工业革命的拐点才会真正到来 ",而为了这场人们翘首以盼的革命,云天励飞还提出了一项更加 " 大胆 " 的计划:把百亿高质量 Token 的价格打到一分钱。
一分钱如何搞定百亿 Token?
今年 5 月,云天励飞曾联合联想集团、无问芯穹、生数科技等近 30 家单位发起 "1001 计划 " 联合倡议,彼时就引起过圈内广泛关注。
根据陈宁的解释,所谓 "1001" 有三层含义,第一层是现实情况,目前在最佳的 AI 落地实例中,每百万 Token 要一元钱的成本;而第二层,就是云天励飞这份路线图近期想实现的,两年内让百万 Token 成本降到一分钱;第三层则是长期目标,计划在 2030 年实现 " 百亿 Token 一分钱 "。
陈宁还对我们着重强调,相关目标的重点不在便宜的价格,而在极致的性价比。" 便宜并不代表有用,如果为了降本牺牲模型效果、生成速度、响应延迟或者服务稳定性,这样的低成本就没有实际价值。"
他称,自己关注的,是在成本持续下降的同时,如何让每一个 Token 能够承载更强的智能、更高的效率和更大的实际价值。
" 云天励飞真正希望推动的,是 Token 性价比持续提升,让高质量的 AI 能力最终能够被更多企业和普通用户用得起、用得好。" 陈宁表示。
但无论在哪个行业,想要画出百万倍的成本下降曲线都十分不易,更何况如今的 Token 价格还起伏不定,不时飙涨。
陈宁也坦诚,大幅降低 Token 成本无法靠一家公司或一个环节来完成,需要芯片、互联、软件、模型、应用及产业链各环节的共同参与。
换句话说,降本要在生态里做。
在陈宁看来,国产 AI 目前单点突破能力已经较强,但在生态建设层面还面临重复适配、上下游反馈链路长、缺少足够多的真实规模化验证这三大关键卡点。而想要建好生态,最关键的就是从过去的 " 逐个适配 " 走向 " 共同演进 "。" 只有做到这一点,国产 AI 生态才不仅是可用,而能持续快速迭代。" 陈宁称。
值得注意的是,云天励飞也表示,接下来将围绕 DeepVerse 系列芯片和 AI 集群方案,持续建设 IFWA 软件生态,并通过 "1001 计划 " 汇聚产业链上下游力量,建立长期生态合作机制。

我们的时代正处在名为 AI 的转折时刻中,人们已习惯了将之视为新一轮的工业革命,而从蒸汽革命到电力革命再到信息革命,其演进大体都经历过 " 个性化需求 - 专业化分工 - 规模化应用 " 的路径。如今,AI 产业自身也处在全新的转折点上,推理时代的一大特点就是个性化需求的涌现;而从芯片到模型,从 Agent 到应用,我们也看到了越来越多专业化分工模式浮出水面;最终,通过 AI 算力基础设施的重构,通过生态协同的合力,性价比更高的 Token 会让 AI 的规模化落地应用成为现实。
在人们争相谈论 AI 落地的这一年,不少 AI 从业者已经大踏步地向那个未来迈开步子,但他们也同时在思考着 "AI 与人 ""AI 普惠 " 的课题。
"AI 最终不应该只是让强人变得更强,而应该让更多普通人拥有过去无法拥有的能力。" 陈宁称,在他看来,只有每个普通个体都能随时拥有一支属于自己的 "AI 团队 ",获得过去只有大型机构才能拥有的知识和能力,才是这轮 AI 革命最有意义的结果。