关于ZAKER Skills 合作
虎嗅APP 10小时前

除了数学,还要那该死的直觉

本文来自微信公众号:翔哥趋势研究,作者:翔哥,题图来自:AI 生成

如果 LLM 是 " 高端制造业 ",那马斯克输在哪呢?

因为如果 LLM 是 " 高端制造业 ",那么马斯克应该是全球最强的玩家才对,他人多,卡多,熟悉制造业全流程,供应链之王,但最终 Grok 路边一条,十万卡租给 Anthropic。

如果 AI 的终点是电力,那么坐在座谈会上应该是电力公司的老总,而不会是梁文锋、杨植麟,是该前者享有高等级安保,而不是后者中的一员。

直到今天,很多人还以为拥有海量工程师、撒钱、买卡、调整组织架构,像制造业那样搞,等效智能的 LLM 就水到渠成,全然不知那些造 LLM 者的价值,以及他们的直觉有多么重要。如果没有 DeepSeek、Kimi 团队的直觉,那就没有 MLA 带来的极致压缩与成本骤降,也没有 KDA 对长程推理一致性的提升,国内的 LLM 就仍会是一坨。

我们无数次复盘,如果没有这两个团队对 LLM 底层技术的数学直觉、工程化能力,今天国内的 LLM 会是什么样子,最后得出了个结论:会被锁死在公版开源框架里,在墙内自娱自乐,距离最前沿水平越来越远。

外推得出结论:中国资产也因此会被锁定在 " 旧时代 ",应抛尽抛。其实,并非 924 改变了资产定价,而是 DeepSeek-R1 改写了全球资产定价叙事和历史线。

这不是夸张,也并非我的偏爱,自有中国科学院的官网报道、市场反应为我辩经。

前段时间,我参加雪球的活动,在饭叙中,我抛出了我们两个月多前就下的判断:LLM 是由数学 / 应用数学构造的压缩 - 预测概率生成器,它应以实现等效智能的长程推理一致性为最大化目标,前沿 LLM 竞赛是一场数学 / 应用数学竞赛。

正是 DeepSeek 用 MLA+GRPO+ 开源权重,在数学层面证明了中国团队可以原创," 可以工程化、可以规模化、可以成本优化,但不能原创,在 AI 竞赛中被封锁 " 的旧叙事才会瓦解;Kimi K3 以 KDA+AttnRes+ 混合布局,在长程推理一致性上进一步证明,中国团队不仅能定义范式,还能在等效智能的维度上做出差异化壁垒。

没有 DeepSeek 的开源框架,就没有智谱;没有 V4、K3 就不能打破 OpenAI、Anthropic 的垄断,他们尽可以提高价格、拉长垄断租金久期,哪像现在这样 LLM 百花齐放,搞出个 " 高端制造业 "、"AI 终点是电力 " 的叙事。

你得先有最先进的 LLM,才能谈算力、电力的价值,你得有领先的开源架构,才能谈人人手搓 LLM。

但是,其实架构、权重、技术报告可以开源,但直觉永远模仿不了。所以,经过数昼夜的研究和对话,我又修正了下:LLM 是数学 / 应用数学、工程化的直觉竞赛。

比如,标准的注意力机制中,KV Cache 是高维向量,从线性代数角度看,这个矩阵是满秩或接近满秩的,梁文锋团队直觉跳跃意识到,高维向量在序列维度上不是独立的,它们共享一个低维的潜在结构,看到了高维数据流形上的低维嵌入。

从数学角度,低秩近似是标准技术(SVD、PCA、随机投影),一个懂线性代数的研究生都能写出公式,但知道可以做低秩分解和知道 KV Cache 适合做低秩分解之间,隔着一堵墙。这堵墙就是 KV Cache 在序列维度上的冗余,不是可以压缩,是本来就在低维流形上。

前者是优化工程师的思维,后者是物理数学的思维,得拥有在复杂系统中识别简正模式的能力,这正是看到高秩表象下低秩本质的直觉来源。

同理,长程推理一致性绝非加功能组件,而是数学骨架层面的重构:注意力机制能不能在扩展上下文时抑制误差积累,是残差连接能不能在深层网络中保持梯度语义,是 MoE 路由能不能在跨文档推理时不把关键信息路由到错误的专家。它不是让模型多记几页上下文的产品功能,是自回归误差的指数衰减能不能被架构设计对冲的数学问题。

K3 的 KDA 重新设计了注意力核函数,AttnRes 在注意力层和 FFN 层之间重新建立了信息流的几何结构。没有经过数学优化的 LLM 长程推理一致性差,是因为误差积累到语义空间发生了漂移。所谓的幻觉,本质是概率分布在高维空间里的随机游走,游走出了吸引域。

所以,我在给某大厂递交的 X 报告里写道:LLM 竞赛不是抄功能,而是 " 发现数学 ",你们应该多招募精通非凸优化、矩阵计算 / 数值线性代数、编码理论、组合优化、微分方程 / 动力系统的数学人才。

其实,我现在发现少了一句:并且,祈祷你们招到的人,有奇特的思维,有不同凡响的直觉。

这种人不是训练出来的,不是制造业流水线上的打工仔,是天生的天赋怪,他们的出现存在一定的概率。

比如信息几何学之父甘利俊一,他独立提出了随机梯度下降和多层感知机训练算法,1998 年提出自然梯度下降,用微分几何研究概率分布流形上的优化,是深度学习的数学基础。还有福岛邦彦,1980 年提出卷积神经网络(CNN)的直接前身层级化多层神经网络模型。法国是概率论和优化的故乡,布尔巴基学派奠定了现代数学的严谨性。

只是,后来无论是日本还是欧洲,都没能在 LLM 领域出现天赋怪接班人。他们的种子在沙漠里发了芽,却在美国、中国的土壤里结了 LLM 之果。

所以,那些改写历史线的 DeepSeek、Kimi 里的天赋怪们,有直觉,能安静推公式、敢大胆试错,这个耦合带有太强烈的偶然性,偶然到近乎国运。

直觉,真的很重要。你对 LLM 的本质琢磨越深,就越是发现,此时此刻的 LLM 得以创生,本身就是一部直觉锻造为犁的历史。

OpenAI 最早意识到 Scaling Law,Anthropic 最早意识到长上下文是推理的基础设施。但其实无论哪家模型厂,迄今为止都是在沼泽地里摸索,并且都撞上了校准墙,能力高但幻觉率也高。其实,前面的墙还有很多,符号接地的墙、因果推理的墙,以及最终那堵在数学映射的算法实现自我审视的墙。

一堵堵高墙,困住的不仅是 LLM 演进的路,还困住了人类实现等效智能的野心。并且,更扎心的是,炸墙的任务只能人类自己来,因为 "LLMs can't jump",目前只有人类拥有直觉。

而之所以沼泽密布,最根本原因是,LLM 整个结构并未被严格数学化证明,有太多现有数学工具覆盖不到的地方。

这个判断,你从 DeepSeek、Kimi 的技术报告里,都能读到,他们写道:尽管对其底层机制的全面理论理解,目前仍是一个开放问题。

1948 年,香农发表《通信的数学理论》,他直觉意识到,信息是消除不确定性,是概率的负对数。于是," 信息 " 第一次有了数学定义,他用一页纸的公式定义了信息是什么、能压缩多少、信道容量在哪里。在此之前,工程师们已经造出了电话、电报、收音机,但没人真正知道自己在做什么。

香农之后,通信从手艺变成了科学。今天的 LLM,正处在香农之前的那个世界。

我们有一堆 work 的东西:Transformer、MLA、GRPO、MoE 路由、KDA。每一篇技术报告都写满了公式,看起来很像科学,但拆开来看:

注意力机制为什么必须是这样的,试过别的核函数吗?试过,但不知道哪个在数学上更优,只能跑 benchmark 碰运气。

Scaling Law 为什么是双幂律?拟合得很漂亮,但这个数字有什么物理意义?万亿参数之外还成立吗?不知道,先训了再说。

GRPO 为什么能收敛?DeepSeek 说 " 我们试了,没崩 ",然后行业跟着用。但严格证明呢?开放问题。Jin et al. 2025 年发现它实际上估计的是旧策略的梯度,加一个无法消除的偏差项。我们用一个理论上不知道对不对的算法,在训练价值数十亿美元的前沿模型。

然后价值十万亿美元的 AI- 硬件市场,其实是建立在仍靠经验在黑箱里不断摸索试错的基础上的。

这一滑稽的结果就是,人类最强模型 Anthropic 的旗舰 Fable 5,准确率高,幻觉率也高。因为它的 RLHF 奖励函数里,猜测的期望收益永远大于拒绝。这不是工程失误,是数学基础的缺失,因为没有一个严格的框架,能让模型在答对和说不知道之间做出最优决策。

是的,可能有工程师们会说:这有什么关系?飞机发明的时候,空气动力学也没建立,莱特兄弟不也飞起来了?算法迭代,大力出奇迹。就像湍流问题没有数学形式化,但靠经验公式堆出来的空气动力学、风洞实验、数值计算,人类依然能造出各种各样的飞机。

有必要非要把 LLM 严格数学形式化吗?靠堆经验、堆参数、堆数据,人类不照样造出相当不错的 LLM 吗?

但技术报告里的那些开放问题,其实是一朵朵可能动摇整个十万亿美元市场的雷暴乌云。

倘若 LLM 最终撞上了 Scaling Law 的墙,倘若压缩 - 预测 token 最终被证明是难以验证的拟合游戏,那么,所有建立在 "AGI 终将到来 " 信仰上的估值,会同时崩塌,市场将陷入股债双杀。这一剧本其实正是这两个月来市场多空绞肉机轰然转动的核心原因。

借助 K3 的推理帮助,我们在两个月多前得出了个结论,并构造了模型,对市场走势有了直接的判断,并且有朋友运用到了持仓里。好消息是解释力很强,坏消息是靠自回归公式构造的 LLM 可能实现不了等价 AGI。

市场并未意识到这点,但市场用价格反应了对这个结果的担忧,而各家的 ARR 用钱映射了这个结果的隐忧。

也正因如此,我们才会下新结论:LLM 竞赛的后半程,数学 / 应用数学将更重要。

湍流问题是没有严格解,但飞机设计师知道风洞实验的边界,马赫数多少会抖振,攻角多少会失速,这些是靠无量纲数(雷诺数、马赫数)严格标定的。但 LLM 的 " 风洞 " 在哪里?没有。我们不知道多少参数会触发幻觉雪崩,不知道多长的上下文会导致语义漂移,不知道 RLHF 的奖励函数在哪个临界点会从对齐变成欺骗。

我们连无量纲数都还没有。

没有数学形式化,你就不知道 LLM 的路径、边界、可验证在哪里。

映射到市场,大厂不知道它们心心念念的超大参数模型会在哪个点崩溃,烧到自由现金流转负的巨额投入可能只是买到一堆会折旧的芯片,市场以 ARR 给模型定价却不知道下一代模型的定价,万亿级资本开支背负着太平洋两岸赌国运的叙事,最终的杠杆支点其实是一群拿着有限的数学工具的年轻人。

然后,在迷雾之中,就出现各种简化的奇特暴论:LLM 是制造业,AI 尽头是电力。

抱着这种想法的诸多大厂,有钱、有人、有卡,在前沿 LLM 竞赛上半程输了,并且看样子还要输掉下半程。因为他们既没有数学,也没有直觉,更没有信仰。

这条路究竟有出口,还是前方有墙,固然可以用试错法无限逼近,但仅有试错法,那么最终我们不过是在优化一个永远无法自检的概率生成器,豢养了一只会复述的鹦鹉。

香农的伟大,在于他用数学形式化了直觉,定义了可能性空间的边界,有了信息论,电信、互联网、半导体乃至今天的 LLM 才得以创生。

LLM 还没有到 " 香农时刻 "。我们有太多不知道的,比如万亿参数下的数值误差传播,有没有闭合形式解?十亿参数、百 T 数据,为什么训出来的模型不在测试集上崩塌?给定 X 参数、Y 数据、Z 架构,最大可实现的推理能力是多少?

以及所谓 VLA、世界模型、物理 AI ,本质上就是个像素生成器,连 LLM 级的明确的损失函数、可量化的 benchmark、可规模化的训练管线都没有,没有物理因果的归纳偏置,不懂能量守恒,不懂牛顿定律,只是在拟合人类拍摄的像素分布。

截至目前,人类的 AI 军备竞赛其实不过是蒙眼狂奔,拿着形式上没有严格化、输出结果难以验证的 LLM,去写文章,去写代码,生成医疗、法律、交易建议,等等。结果不准确,那么付费逻辑就必然受限,谁会为 " 胡编乱造 " 支付长期溢价呢,在可信性被数学严格证明之前,MaaS 的高毛利叙事都值得被怀疑。

比如本文,它是我和 Kimi 一段段共创的,看上去像那么回事,其实不过是经过我调教后的模型的概率编织物。

所以悖论就是:如果本文论述为真,那么 LLM 确实要继续补数学课;如果本文纯粹胡说八道,那么 LLM 确实还要补数学课。

所以,既然那么多钱都花出去了,与其卷补贴卖 token 的办公市场收几两碎银,真不如顺手多招几个数学、物理怪才,让他们推 LLM 公式去,让他们爆发直觉去,让他们去完成 AI 不可能做到的 jump,让他们去探索人类理性计算的边界,让他们去证明碳基生物依然是智慧之光。

有志于再次改写历史线的年轻人,如果有天赋,自信有直觉,那就去学数学,去学物理吧。

也许哪天,你们当中就有人能写出 LLM 的 " 香农定理 ",以简洁的公式,告诉我们等效智能的压缩极限、推理一致性的信息论下界,以及自回归误差积累能否被架构设计对冲的临界条件,甚至创造出全新的数学语言,构造出 " 理解 "、" 反思 "、" 跳跃思维 " 的数学表达。

那才是人类真正需要颤栗的时刻。

那是钱买不到的创世纪。

本文来自微信公众号:翔哥趋势研究,作者:翔哥

最新评论

没有更多评论了
虎嗅APP

虎嗅APP

有视角的商业资讯与交流平台

订阅

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容