文 | 节点财经,作者 | 梁添
过去几年,AI 行业的主流叙事是一场基于 Scaling Law 的狂热竞赛。
数据中心的 GPU 堆积如山,模型参数轻松越过万亿大关,玩家们在算力、数据和算法的牌桌上疯狂加码。
一个极其现实的问题浮出水面,这些庞然大物,只能运行在数据中心,然而现实生活中,各种终端设备才是最贴近消费者的产品。
可惜,算力与应用之间,隔着一道物理鸿沟。
好在,一股去中心化的力量蓄势待发。
搭配了终端小模型的 AI 手机、AI PC、智能汽车、机器人乃至 AI 眼镜迎来了集体井喷。面壁智能 CEO 李大海将 2026 年定义为端侧 AI 商业化元年。Gartner 预计,2026 年全球 AI PC 出货量将占 PC 市场的半壁江山;Counterpoint 也预测,具备生成式 AI 能力的智能手机将在同年拿下 45% 的全球份额。
新的产品分野正在成型,最顶尖的超级大脑依旧坐镇云端,而那些高频、低延迟、与个人隐私深度绑定的任务,正下沉到终端。
为什么模型开始离开云端?
云端 AI 与端侧 AI 的区别,简单概括为外包和内置。
大众熟知的 DeepSeek、kimi、ChatGPT,大多发布的是参数量动辄数千亿、上万亿大模型。我们需要付费调用 API key,哪怕免费的 Chatbot 也是模厂把模型封装为聊天机器人。推理过程并不是在本地完成,而是设备将需求发送至云端,数据中心的 GPU 集群完成计算后,再将结果传回。
而端侧 AI,则小得多,参数量级通常只有几 B,推理过程直接在终端本地离线完成,相当于设备有了一个本地部署的大脑。
端侧模型虽然没有云端大模型聪明,但轻量级 + 本地部署的特点,让端侧 AI 在成本、延迟与隐私上具备独有优势。
想象一个长期运行的 AI Agent,它能帮你规划行程、整理会议记录、甚至回复邮件。方便是方便,但一次任务可能包含几十个步骤,若每一步都要在云端往返,累积的延迟将影响用户体验,持续燃烧的 Token 也会堆积为天文的算力成本。
更致命的是隐私。
当 Agent 真正进入 PC 和手机后,它触及的不再是互联网上的公共语料,而是用户的私人照片、账号权限、聊天内容。这些信息高度敏感。
数据到底要不要离开设备?这个大众广为关注的隐私问题,成为悬在云端模型厂商头上的达摩克利斯之剑。
或许你会说大模型都开源,直接本地部署不就可以了?这里要说明,大模型哪怕本地部署对算力有极高要求,是企业级玩家的专属,对 C 端消费者来说,本地小模型与云端大模型协同,才是兼顾能力、隐私与成本的现实方案。
这时候问题来了,都知道端侧 ai 方便,可为什么大模型兴起几年后,端侧 ai 的声量才起来呢,因为落地并不简单。
为什么偏偏现在挤进终端设备?
要把小模型塞进小小的智能设备并非易事。
模型都需要芯片支持计算、存储与通信,虽然现如今的数块 GPU 的算力能支持千亿万亿大模型推理运行,但要让芯片跑在狭小逼仄的 C 端设备上,给小模型做推理依然是个难题。
若芯片昂贵,虽能承载的模型聪明,但成本往往过高且功耗过大,物理空间逼仄的 pc 和手机难以承载,若芯片功耗达标,往往可能无法保障智能。
总体来看,端侧 AI 想要落地并且实现商业化,通常面临性能、功耗、成本的不可能三角。
好在过去几年底层硬件与算法的迭代,可以在不可能三角之间寻找到平衡点。
首先是算力结构的升级。
在端侧,跑得快还不够,如何降低数据读写带来的巨大功耗,是芯片厂商比拼的内功。NPU 技术成熟,正成为消费电子的标配。比如,针对终端模型,高通、瑞芯微、华为等厂商已经开始针对推理场景进行极致优化,通过共享内存减少数据搬运,甚至专门为长上下文和 MoE 模型调整芯片架构,通过软硬一体,服务更多模厂。
其次是模型能力密度的跃升。
早期的小模型往往是人工智障的代名词,但现在,端侧模型也可以小身材大能量。厂商通过蒸馏提升小模型能力,量化降低模型存储与计算开销,稀疏注意力等技术进一步压缩长上下文推理成本。
清华大学与开源社区 OpenBMB 提出的密度定律指出,大模型的能力密度随时间呈指数增长,约每 3.3 至 3.5 个月翻一番,即每隔约一百天,只需一半参数量的模型即可达到当前最优性能。
以面壁智能开源的 MiniCPM5-2B 为例,仅 2B 参数便能在评测中领跑小模型赛道,甚至具备了调用工具和代码生成的能力。
最后是操作系统的底层重构。
如果端侧 AI 只停留在一个对话框里,它永远只是个玩具。Agent 要真正发挥价值,必须拥有读取系统上下文、接管摄像头以及调用第三方 APP 的权限。
阶跃星辰的 Step AOS、vivo 的蓝心大模型,都在试图打通这层壁垒,将成千上万的操作系统的原子能力转化为 AI 可调用的工具。
芯片提供算力底座,模型拔高能力上限,操作系统开放执行权限,端侧 AI 的技术闭环,终于在当下正式合拢。
谁能吃到端侧 AI 的红利?
端侧 AI 不是单一产品,而是分布在芯片、模型、infra、终端。当 AI 能力从云端向终端下沉之后,中国端侧 AI 市场也开始出现不同的路线分化。
在《节点财经》看来,谁控制其中关键层,就能获得不同的议价权和分发权。表面上看,厂商们都在押注端侧 AI。仔细瞧,它们并不是孤军奋战,只不过策略并不相同。
第一类是模型供应商。
这类公司的核心逻辑,是把模型做到足够小、足够强,并适配尽可能多的硬件平台。
面壁智能早在 2023 年就放弃千亿级云端基座模型,全面转向端侧,并提出 " 能力密度 " 概念。其 MiniCPM 系列持续沿着小参数、高能力方向迭代。9 月 7 日开源的 MiniCPM5-2B 参数规模仅 2B,主要面向手机、PC 等终端本地部署,同时强化了 Agent 能力。
与手机或汽车厂商不同,面壁本身并不掌握终端,它希望扮演独立第三方模型供应商的角色,将同一套端侧模型能力部署到手机、汽车和机器人等不同设备。
目前,MiniCPM 已经进入三星 Galaxy AI 相关端侧能力,汽车端智能座舱助手 cpmGO 也随长安马自达 MAZDA EZ-60 量产;在具身智能方向,MiniCPM-Robot 则进入展厅导览、园区巡检等场景。
这类企业竞争力并不只是模型 Benchmark,而在于能力密度、量化压缩、跨芯片适配和模型生态。它们要证明的是,一家独立模型公司也可以成为不同硬件厂商共同使用的 AI 能力供应商。
科大讯飞同样在推动小模型端侧化,但路径有所不同。
9 月 1 日,科大讯飞开源星火 X2.5-4B/1.7B 两款端侧模型,支持最长 100 万 Token 上下文,并将重点放在 AI 办公等已有优势场景。
相比面壁试图成为横向模型供应商,讯飞更接近于用端侧模型强化自身在语音、办公和企业生产力领域的既有产品。
第二类是芯片玩家。
瑞芯微这类厂商主要提供 SoC、NPU 和配套工具链,服务手机、机器人等不同终端,其核心价值是把模型以可接受的功耗、成本和性能部署到硬件中。
与这种相对通用的芯片供应模式相比,地平线进一步向软件和场景纵深延伸。它不仅提供征程系列芯片,还拥有辅助驾驶系统、模型和软件栈,因此更接近软硬一体的计算平台。其竞争力不只来自芯片本身,而来自芯片、模型和算法的协同优化。
第三类是 Agent 入口型玩家。
比如,时下大热的豆包手机。
传统智能手机中,用户先打开 APP,再完成打车、点餐、支付等任务;Agent 时代,用户可能只需要一个自然语言指令,就能让 AI 在不同应用之间完成任务调用。
这也是豆包联合中兴努比亚持续推进 AI 手机的重要背景。在首代豆包手机努比亚 M153 之后,双方将方案从跨 App 操作进一步转向端侧 MCP,希望让 Agent 更加深入地调用手机能力。第二代豆包手机 NaviX Ultra 试图通过语音 Agent 完成打车、点餐等任务,并增加视觉感知能力。
虽然现阶段可调用的第三方服务仍然有限,支付等高权限场景也受到安全约束,但其战略方向已经比较明确:手机只是载体,把模型装进手机,是字节争夺的 Agent 时代的 C 端入口的策略。
第四类是以阶跃星辰为代表的纵向整合玩家。
与面壁主要提供模型、豆包主要争夺入口不同,阶跃星辰希望进一步打通基座模型、Agent 系统和硬件终端。
7 月 13 日,阶跃星辰发布终端品牌 STEPX 及 Agentic Phone STEPX Neo。与此同时,公司与千里科技、吉利在汽车领域展开合作,并推动 Step AOS 进入车端。
这意味着阶跃的目标并不只是把模型卖给设备厂商,而是希望从底层模型开始,一直延伸至 Agent 操作系统和终端产品。
它代表的是另一种端侧 AI 路线:通过纵向整合,尽量控制模型如何感知环境、如何调用工具,以及最终如何与手机、汽车等硬件结合。
以上路线都有一定技术门槛,让企业应接不暇,自己的业务用哪些芯片、用哪些模型,怎么和企业生态结合成为难题。因此市场上,衍生出交付型玩家。客户提需求,他们负责把这些东西组合成一套可交付的方案。
比如,在汽车这种对安全要求极高的场景,德赛西威可以根据车型价格、芯片算力和客户需求,决定哪些功能放在本地,哪些任务交给云端,并提供不同规格的模型和计算方案。
相比起大模型追求智能的上限,端侧 AI 这些问题更偏向工程优化,这决定了端侧产品到底是一个用来在发布会上炫技的 Demo,还是真正能走进生活的产品。
过去三年,云端证明了 AI 能有多聪明,但最聪明未必与生活场景最接近,接下来端侧要证明的,是如何在智能、成本、功耗上把握一个平衡点,让 AI 真正成为设备的一部分。