关于ZAKER Skills 合作
钛媒体 6小时前

张一鸣的 10 万亿参数大模型:还能跑赢时间吗?

文|AI 商业评论

2026 年 7 月底的一个傍晚,字节跳动 Seed 团队的全员会气氛凝重。

创始人张一鸣罕见地出现了。这位自 2021 年卸任 CEO 后便淡出日常管理的创始人,平时不在国内,"AI 部门是他最关心和接触最多的 "。

但这一次,他不是来打气的。

" 不要用别人的输出,换一时的榜单排名。" 张一鸣对台下约 2000 名 Seed 研究人员说。他明确反对通过蒸馏竞争对手的模型来追赶,认为字节应该 " 为长期目标牺牲一部分短期利益 ",坚持 " 长期主义和延迟满足 "。

话音落下,会议室里有人松了一口气,也有人握紧了拳头。

他们都知道,这不是一次普通的战略宣导。就在这次会议之前,Seed 内部至少发生过三次关于 " 是否采用蒸馏路线 " 的激烈讨论—— DeepSeek-R1 发布后一次,Blackwell 芯片部署后一次,Kimi K3 发布后又一次。每一次,张一鸣都投了否决票。

而此时,豆包大语言模型在全球 LLM 排行榜上仅列第 21 位,远低于 Kimi K3(第 2 位)和阿里 Qwen 3.8 Max(第 4 位)。

CEO 梁汝波在不久后的年中全员会上也不得不承认:" 大语言模型和海外领先模型的差距有所拉大。"

那么问题来了:当竞争对手用蒸馏这条 " 捷径 " 在榜单上狂奔时,张一鸣的 " 不蒸馏 " 宣言,究竟是高瞻远瞩的战略定力,还是追赶无力之下的一块遮羞布?

01 三次否决,顶层的固执与底层的焦虑

蒸馏在大模型圈是一条心照不宣的捷径。

用市场上先进的大模型训练自己的小模型,成本低、见效快,能在短时间内把能力提上来。DeepSeek、Kimi、阿里 Qwen,或多或少都走了这条路。甚至 Anthropic 已经公开指控多家中国公司蒸馏其 Claude 模型。

张一鸣的逻辑是:蒸馏只能逼近对手,永远无法超越;沿着别人的轨迹走,最多成为 " 更好的模仿者 "。

技术上,这套说辞站得住脚。牛津大学和 Meta 的研究表明,过度依赖合成数据会导致 " 模型坍缩 ",尾部信息不可逆丢失。蒸馏还会带来词表依赖和奖励模型错位的问题——你继承的是别人的价值观,而不是自己的商业逻辑。

但技术正确不等于商业正确。

当 Kimi K3 以 2.8 万亿参数横扫榜单、阿里 Qwen 3.8 Max 以 2.4 万亿参数紧追不舍时,字节拿得出手的语言模型是什么?Seed 2.1 Pro,在全球 LLM 排行榜上仅列第 21 位。CEO 梁汝波在年中全员会上不得不公开承认:" 大语言模型和海外领先模型的差距有所拉大。"

张一鸣从去年下半年开始,将一半精力倾注在 Seed 团队,定期参加核心技术复盘会。这种级别的创始人介入,在字节历史上极为罕见。但高度介入的另一面是:当创始人把个人技术洁癖注入公司战略,组织的容错空间还有多大?

02 10 万亿参数的豪赌

大力出奇迹 2.0?

否决蒸馏之后,字节给出的替代方案是一个让全行业侧目的数字:10 万亿参数。

据英国《金融时报》报道,字节正在预训练一个参数规模最高可达 10 万亿的超大模型,体量是 Kimi K3 的三倍以上,对标 Anthropic 最先进的 Mythos 系统。项目由 Seed Foundation 负责人项亮主导,目前仅处于预训练初期,完整周期预计 3 至 6 个月,能否正式发布仍是未知数。

但这里有一个被刻意回避的问题:10 万亿参数,拿什么喂?

2022 年 DeepMind 的 Chinchilla 论文已经证明:参数规模翻倍,训练数据量也应同步增加。研究机构 Epoch AI 估算,全球公开的人类高质量文本大约只有 300 万亿 Token,按照当前消耗速度,可能在 2026 年至 2032 年间被 " 吃干抹净 "。字节一边拒绝蒸馏抄答案,一边要训练全球最大的模型之一,这意味着它必须自己准备海量 " 教材 "。为此,字节甚至将数据团队整合升格为一级部门 "AI 数据与安全 "。

但就在这个节骨眼上,原 AI 数据与安全负责人傅越被传离职。核心数据负责人的出走,给 10 万亿参数模型的 " 教材供应 " 蒙上了一层阴影。

更值得追问的是:字节是不是在重复自己最熟悉的那套打法——大力出奇迹?从今日头条到抖音,字节过去十年的成功公式是海量资源 + 快速迭代 + 流量变现。但大模型不是短视频。参数堆到 10 万亿,如果数据质量、训练框架、优化方案跟不上,可能只会造出一个更昂贵的 " 笨蛋 "。业内已有声音指出," 将参数规模一次推到同行数倍以争取领先位置的举措,像一场赌博 "。

而这场赌博的筹码,是天文数字的钱。

2025 年,字节全年资本开支超过 1500 亿元,其中约 900 亿用于 AI 算力采购。2026 年,这一数字被曝超过 2000 亿元。豆包 App 月活 3.45 亿,日均 Token 调用量达 180 万亿,但光鲜的用户数据背后是一张触目惊心的成本账单:单次推理成本中,硬件折旧占 58%,电力消耗占 29%,每天算力消耗达数千万元。

收入方面,每天 2 亿多人使用的豆包,日收入不足百万元,主要来自电商佣金。唯一能让账面好看一点的是 Seedance ——这款视频生成模型的年化收入已达 20 亿美元(约 135 亿元人民币),单月超 10 亿元,刚好能抵消豆包的算力成本。

也就是说,字节 AI 业务的财务现状是:视频模型赚钱养语言模型,语言模型烧钱换用户规模,用户规模换不来同等收入。

当张一鸣说 " 愿意为长期目标牺牲短期收益 " 时,他牺牲的究竟是谁的收益?

03 偏科与动荡,Seedance 的光环照不亮 LLM 的短板

字节并非一事无成。恰恰相反,它在 AI 视频生成领域做到了全球顶尖。Seedance 2.0 原生支持多模态混合输入,火山引擎 MaaS 收入的一半以上由其贡献。但是,字节真正能拿得出手的 AI 成果集中在视频(文娱)内容生成,而 B 端产业客户真正看重的通用基座能力——长文档理解、逻辑推理、代码生成、复杂任务拆解——恰恰是字节的短板。

这种 " 偏科 " 直接反映在了商业战场上。2026 年夏天,在上海举办的 WAIC(世界人工智能大会)——国内最重要的 to B 与产业 AI 公共舞台——字节跳动继续选择放弃独立官方展台,仅以第三方合作微弱露出。而就在同一时期,字节却在 ChinaJoy(游戏展)上为抖音直播和朝夕光年设置了超大展台,布展面积超过了腾讯。

一个想做企业 AI 服务巨头的公司,在 to B 主舞台上隐身,在 to C 游戏展上狂欢。这不仅仅是市场策略的选择,更是底层能力缺位的外化——当你的语言模型还不足以支撑 B 端客户的复杂工作流时,你确实没什么可展示的。

比技术路线更耐人寻味的是人的动荡。2025 年 6 月,豆包大模型大语言模型团队负责人乔木因合规问题被辞退。随后,顾全全离职创业,傅越离职,周畅从阿里 " 挖角 " 过来却引发竞业诉讼。更剧烈的是组织层面的 " 挥刀 ":成立近十年、数千人规模的飞书 " 一夜拆分 ",产品团队并入豆包,GTM 团队并入火山引擎。飞书负责人谢欣—— 2014 年字节只有 300 人时的第一任 HR 负责人、张一鸣时代的元老——从直接向梁汝波汇报,改为向豆包负责人赵祺汇报。

梁汝波解释这是为了 " 更好地打造面向办公与生产力场景的优质产品 "。但一个无法回避的事实是:当一家公司的 AI 战略需要靠 " 拆分元老业务 " 来推进时,这究竟是资源整合的魄力,还是底层焦虑的应激反应?

04 考场还在吗?

让我们回到张一鸣的那句话:" 不要用别人的输出,换一时的榜单排名。"

这句话放在技术伦理的框架下无可指摘。但放在商业竞争的语境里,它暴露了一个危险的假设——时间站在字节这一边。

现实是,AI 大模型的竞争正在呈现 " 赢家通吃 " 的特征。用户心智一旦形成,迁移成本极高。当 Kimi 和 DeepSeek 用蒸馏快速迭代、占领市场时,字节却在坚持 " 自研 " 的清白。这种清高,用户会买单吗?

答案正在浮现。2026 年 5 月,豆包启动付费,推出 68/200/500 元三档会员。社交平台上很快出现 " 豆包笨还收费 " 的质疑。一位用户的吐槽很直白:" 既然收费了,免费的肯定会打折扣,完全可以 Kimi 或智谱换着用,总有还在免费的大厂。"

付费用户不会容忍 " 略好于免费版 " 的差异化,他们要的是质的飞跃。而豆包目前的能力,显然还没准备好回答这个问题。

更微妙的是政治风险和美国监管。利用美国公司拥有的西方模型的输出结果来训练本地模型已成为一个重大的地缘政治热点,避免这种做法可以保护公司免受被列入贸易黑名单或遭受华盛顿制裁的风险。2026 年以来,Anthropic 连续指控 MiniMax、月之暗面、DeepSeek、阿里蒸馏 Claude 模型,字节恰好不在名单上。有人解读为 " 提前避险 ",但另一种解读同样成立:字节之所以没被指控,可能是因为它的语言模型能力还不足以引起 Anthropic 的警惕。

张一鸣说,要 " 延迟满足 "。但延迟满足的前提是,你知道那个 " 满足 " 终将到来。如果 10 万亿参数模型在预训练中遭遇瓶颈,高质量数据真的在 2032 年前就被耗尽——那么,延迟满足会不会变成无限期拖延?

8 月 6 日,梁汝波在全员会上说,公司战略要 " 高度优先,粗主干,优化长期 "。他否认 " 字节因为外部压力才坚持自研 ",表示是希望团队 " 延迟满足,打好技术基础 "。

但叙事之外,有一组冰冷的数字不容忽视:豆包日均 Token 消耗 180 万亿,距离内部目标 250-300 万亿仍有差距;豆包 LLM 全球排名第 21,语言模型能力 " 落后半年 ";2000 亿年投入,日收入不足百万;10 万亿参数模型还在预训练初期,3-6 个月后能否发布仍是未知数。

张一鸣把 " 不蒸馏 " 上升到了产品文化的高度。但文化不能当饭吃,技术洁癖也不能自动转化为市场份额。

在 AI 这场考试中,有人选择抄答案,有人选择自己写。张一鸣选择了后者,这值得尊重。但一个残酷的问题是:当你终于写完自己的答案时,考场还在吗?

2000 亿买一张 " 不蒸馏 " 的清白,值不值?答案可能要到 2027 年才能揭晓。但那时,榜单上的对手,还会给你留位置吗?

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容