文 | 划重点 keyPoints
这趟行程密度很大,后劲很足,回到上海后满脑子还是 15 天里的各种画面:
一边,有 Frontier Lab 研究员波澜不惊地向我描述他的日常:" 我的工作主要就是监督和鼓励我的 1 万个 agent。" 有数学博士对我说:" 数学已经死了。"
在 Mountain View 的 Red Rock Coffee 里,连续几天见的多位 " 天才少年 " 都坚定表示 " 一定会创业 ",也有不到 30 岁的一线研究员开玩笑地说 " 要退休了 "。
另一边,则是热火朝天的科技新闻:OpenAI 发布了 Astra、公布 Navier – Stokes 千禧年难题解答、Meta 推出了用户增速超过 ChatGPT 的 AI 个人助理 Muse、Dario 大声疾呼 "pace the frontier" 居然得到了 Elon 和死对头 Sam 的响应 ......
新闻里的未来,和眼前研究员的日常,正在以一种奇妙的方式重叠。

对于 SevenX,我们始终相信,对任何技术和产业的理解,一定要站在最前沿、最一线,要和那些真正在其中挣扎过、绝望过、成功过的人去对话,才能完成一个关于未来的更全面、也更接近真实的拼图。于是 9 月初,带着新一轮的好奇和疑问,我在 15 天里横跨硅谷、洛杉矶、西雅图、波士顿和纽约,高密度地和 101 位新老朋友进行了不同颗粒度、但都非常有意思也极具启发的交流。
平均每天约 7 场对话,或是清晨的早餐,或是深夜的啤酒,或是三五人的咖啡小聚,或是十人的火锅分享,我们与北美 AI 一线从业者完成了一场从前沿方向到价值和梦想的对齐。

最年轻的一位 21 岁,2023 年高中毕业,疫情之后才上大学,大三就选择从 UPenn drop out 开始创业,现在是北美一家 AI 应用公司的 co-founder。
经历最丰富的一位,已经在 " 大厂—创业—大厂—创业 " 之间来回了两轮且横跨中美两地,归来仍在当打之年,财富早已不是追求,出于热爱,仍置身 AI 浪潮最前线。
有很多超级学霸和 " 天才少年 ",但又分别有着独特而有趣的人生经历:有人本硕博集齐了 CMU、Stanford、MIT,在校期间就已经参与很多前沿机器人项目;有 MIT 的博后转向业界投身于大厂数据中心的高性能计算;有 Stanford 物理 PhD,毕业便加入了 Infra 方向的创业公司;也有拥有生物背景的 Georgia Tech PhD,正在探索如何将 AI 与心理健康 / 脑科学结合。
有的直接向 Sam Altman、Jensen Huang、Satya Nadella、Mark Zuckerberg 等汇报或者合作;有的则是在创业和工程一线去解决一个零部件、一个运维问题。


这篇手记,就是从这样的时间差开始的。
先说我的观察:一线研究者对模型能力持续发展相当乐观——这种乐观不只来自在现有架构里继续堆数据和算力,更来自强化学习(RL)、任务环境(environment)乃至新架构打开的新扩展路径;但更强的模型,不会自动变成更好的交付,也不会让物理世界按同样的速度迭代。下一阶段的机会,可能不只在能力曲线最前端,更在能力、交付与现实之间尚未填平的落差里。

行程中,GPT-6 Astra 正好发布。比发布会更让我印象深刻的,是好几场聊天里,各家大厂 Frontier Lab 的研究员们描述自己工作状态的变化:
" 半年多前,觉得它还是 research intern 的水平,现在感觉已经超过我了。"
" 我的工作主要就是监督和鼓励我的 1 万个 agent。"
" 每天工作时间很长,但也不算很满,因为有些时间就是去接杯咖啡,等我的 agent 出结果。"
还有不到 30 岁身价可能上亿的一线研究员半开玩笑地说,自己一两年后可能也可以 " 退休 " 了。
一位 Lab 的研究员朋友给了一组对比:" 过去一个预训练团队一两百人,现在差不多二十人左右就能推进,一年后也许只需要五个人。"

一边是 AGI 在具体任务中已经无所不能的体感,另一边则是在大型组织的系统性实践中对于 AI 的投入、产出和客户的需求之间仍存在的落差:
Mert Demirer 等人对超过 50 万名开发者的研究,把这种落差量化了。自主编码智能体带来的代码提交活动增幅为 240%,项目数量增幅为 80%,实际发布增幅则为 30%。从提交到发布,提升一层层变薄。

朋友解释,之前把 " 用 AI 的量 " 放进考核,比如代码里有多少比例要由 AI 写,结果出现了大量 bug;AI 写的代码量又大,review 起来非常困难,检查和修复的成本快速上升。硅谷甚至为此发明了一个词:Tokenmaxxing,也就是为了好看的指标刻意消耗 token。
有同样变化的不只这一家。年初大家看到的是 token 价量齐升;后来发现,用了很多 token,产出却好像一般。我们已经从 " 用更多 " 走到了 " 怎么用更好、ROI 更高 " 的阶段。这一点不仅针对各家公司,也针对更多行业的下一步:Token 是投入,代码量是中间产出,客户愿意付费的结果才接近价值。三者不能混为一谈。
Scaling,还能接着 up 吗?
从数据到智能,AGI 的涌现正是 scaling up 的奇妙结果。那么,这件事儿如今到哪一步了?
两年前,我问过同一位硅谷核心模型研究员同一个问题:" 数据是不是快用完了?还能 scale 吗?"这一次,他依旧给了我肯定的答案:
" 一两年前我们训练数据的规模最多大概 10T、20T,现在大家一般都在 100T。目前看来还没有到天花板,估计还可以再往下走一代。现在的模型参数量基本上在 1T 到 3T 这个区间,下一代基本上是 10 到 20T,应该在半年之内。"

" 两三年前,大家还把 RL 看作垂直领域的‘精加工’;后来 lab 把多个垂直领域的 RL 合成一个大 RL,它在训练中的比重逐渐超过了很多人的预期,有一些模型之所以明显更好,也因为在 RL 里放了更久。"
这带来一个根本变化:训练材料正在从静态的内容,扩展为可执行、可反馈的任务环境。模型不再只是 " 读 " 人类写下的东西,而是在沙盒里做事、观察结果、修正错误。谁能持续提供有价值的问题、真实多样的环境和可信的反馈,谁就可能在下一阶段占据重要位置。" 环境 " 本身正在成为一种资产。
值得一提的是," 继续 scale" 并不只有一条路。正如 Google Research 负责人 Yossi Matias 说:" 就在几年前,我们甚至还没有今天这样的架构,为什么要假设这就是唯一的路径?" 就像 Google 几年前提出的投机解码(speculative decoding),在不牺牲质量的前提下,把大模型推理效率提升两倍以上。如今,已衍生出数百种变体,被业界视为理所当然。" 但我在等 10 倍、100 倍的提升,在等新的架构。"
所以," 还能不能 scale" 这个问题本身需要拆开看:在同一套架构里堆卡、加大预训练,边际收益确实在变化;但 RL、环境,甚至全新架构,正在打开新的扩展维度。一线研究员的乐观,更多来自后者。
" 数学已死 "?下一个是谁
可能被作为 AGI 已经到来的另一个例证。近期,OpenAI 宣布给出困扰了人类 90 年的纳维 - 斯托克斯方程(Navier – Stokes)千禧年难题解答(据 OpenAI 披露,动用了上万个 agent、耗时 88 小时)。正是在那之后的几天,在波士顿一家超级火爆的川菜馆里,我和几位数学 PhD 聊起了 AI 和数学。
" 数学已经死了。" 这是我听到的最简短、也最直接的回应。另一位说:" 半年前,AI 对我的科研已经有非常大的帮助,但我不会的它也不会。现在,我不会的它会。"
对 Frontier Lab 来说,数学重要、基础,又天然可验证,因此投入了大量资源。但对于数学研究者来说,这种感受比新闻更私人,也带有很强烈的情绪。
" 两三百年前,有数学家一辈子就做一件事,把一张对数表写成一本书。后来有了计算机,一辈子的事变成了一行代码。现在我们最聪明的数学家已经快比不过了。这只是一年之内发生的事。一两年前,AI 第一次做出奥数题,大家还觉得稀奇。明年会是什么样子,不晓得。"
一道题的突破,让一个学科开始重新讨论贡献和未来。 当检索文献、提出假设、推导验算这些执行环节越来越便宜,价值就理应更多地流向提出问题、选择方向和判断结果的人。AI 正在改变知识生产的分工,也在改变知识生产的权力分配。
然后,跳出实验室和数学界,和更广泛行业的从业者交流时,大家相对没那么悲观。原因很朴素:智能的背后依托数据与反馈。但人类社会有太多领域,标准说不清楚、结果模糊难以判定、无法形成数据闭环。
另一位前沿Lab 的研究员也提到:"Coding 通过用户交互和 API,很容易形成 flywheel,但在很多领域都没那么容易。如果要在其他领域也达到类似 AGI 的水平,按现在的配方,每个领域都需要一个 flywheel。"
通用能力的提升,并没有自动消除这些困难——如何建立 flywheel,依旧在很多行业中值得思考。正如新生代 AI 投资人代表 Sarah Guo 提到的:能被测量的,就能被训练;能被训练的,迟早会变成商品。而那些存在于私有环境、难以被简单量化,为客户连接系统、明确责任、保留状态、验收结果的 " 承重墙 ",则可能长期存在价值。
对创业公司来说,需要思考的是随着模型能力继续发展,什么是在未来 5 年、10 年后仍然存在的价值空间。尽管 AGI 已经把数学逼到墙角,也在 coding 上展现了绝对的统治力,但能回答好类似下面这些问题的创业公司,也许能有机会驾驭 AGI 或至少与 AGI 在商业世界中协同发展:
客户为什么把这件工作交给你?你能真正进入业务系统和工作流,而不只是给建议吗?什么叫完成,什么叫出错,如何验证?能否合法、持续地获得独有的结果数据并用于改进?
每瓦电力,能产生多少有效智能?
" 能阻止 AI 毁灭人类的,可能恰恰是人类的无能 " ——这个脱胎于科幻小说《三体》的梗,已经照进了现实,因为我们连足够的电力和电网都无法提供给它。
AI 算力基础设施已经从 " 比拼芯片采购与资本开支的扩张周期 ",全面转向以电力容量、并网排期、供配电及液冷交付能力为核心约束的 " 硬约束周期 "。正是在这个大背景下,在北美,我听到的两个瓶颈最为突出:
社会接受度成为约束:电费、用水与电网稳定性,越来越频繁地出现在数据中心周边社区的讨论甚至抗议里。
并网周期成为硬约束:一些朋友谈到,新增电力容量与输电设施的等待,要以五年甚至更长时间计算。
这在与我展开交流的工程师眼里,其实是一连串实实在在影响工程进度的追问:卡买到了,电什么时候到?电接上了,散热和网络跟得上吗?集群扩大后,故障怎么定位和修复?有多少设备在有效工作,而不是在等待或停机?更高的性能,能不能转化成更低的单位任务成本?
矛盾在逐渐放大,一方面是电力与交付的困难逐步上升,一方面是并没有衰减的胃口。一位在北美做 GPU 集群的朋友说的话,我至今印象深刻:" 客户觉得这个 cluster 还得再乘个 5,想要 100 万张卡,甚至更大的集群。我的天,谁给你来做 100 万张卡?"
这句 " 谁给你来做 ",难的不是钱,而是物理瓶颈。粗略估算,一张高端 GPU 连同配套的网络和散热,功耗约 1.5 – 2 千瓦,百万卡集群就是 1.5 – 2 吉瓦,接近一到两座大型核电机组的出力;再叠加前面提到的 5 年以上并网等待,以及这种规模下的互联、故障定位和运维,它已经不是一个简单的采购清单,而是一项需要多年、跨越电网与土地审批的基建工程。


新的能源或用能方案:核能和 " 算力上天 "。后者已不再只是概念,但一位这个领域的朋友也提醒:" 数据中心里的东西经常坏,搬上天,这整套运维体系都要重新定义。" 而这里面,可能也是新的机会点。
提升能源转化效率:通信带宽、冷却、算电协同等,都有很多空间。这也是诸多大厂和创业公司探索的方向,正如来自头部数据中心大厂的朋友和我说的:" 电力利用效率,空间还很大。"
AI 基础设施的竞争单位,正从 " 卡 " 变成 " 瓦 "。能源侧的储能与柔性负载、数据中心运维、液冷、光互连,以及半导体设备链上的单点突破,都值得与模型机会放在同一张投资地图上看。
先造 AGI,再造 Robotics?
AI 将如何最直接地影响原子世界,所有人的答案都指向了机器人(在此作为更广义的 Physical AI 的代表),而当聊到机器人时,北美的朋友们问我最多的一个问题是:" 为什么国内这么疯狂?" 这次交流的 8 位机器人从业者里,有头部大厂的资深科学家,也有一线做工程化的创业者。整体来看,他们对具身智能和世界模型的判断,都比国内谨慎不少:
第一,技术路线没有收敛。研究本身都还没有收敛,需要什么样的数据,大家还在 " 调配方 "。决策者目前主要是研究员,他们更看重合作方能否理解需求、快速沟通和调整。硬件路线同样在争论。
第二,验证链条长。大模型可以快速迭代验证,具身的验证却需要真机,链条更长、复杂度更高。硬件的鲁棒性往往被低估:有时是硬件出了问题导致数据有偏差,最后却被误判成模型的问题。
当然,在北美,机器人迭代确实会更慢一些。" 美国硬件不好搞,缺一个零件都买不到。"" 很多采购的东西往往被其他美国公司套两三层壳,最终东西还是从中国出来。" 但是," 具身相关的软件人才密度高很多 ",好几位受访者都提到这一点。
不论目前的现状,Frontier Labs 都正在具身上加码。OpenAI、Anthropic 等都在大量招人、投入资源到具身,大家也就顺着开玩笑讲,或许确实是先造 AGI,再造 Robotics。
当然这个玩笑本身值得商榷。人的智能并不是先有大脑、再配身体,二者是在与物理世界的交互中共同演化的。更聪明的 " 大脑 " 可以缩短学习过程,却跳不过物理世界的反馈。从这个角度看,具身智能真正稀缺的,可能不是更强的基座模型,而是更快、更便宜的真机验证闭环——这恰恰是中国硬件供应链最有优势的地方,也是 " 国内这么疯狂 " 背后更理性的一面。
北美的大家状态如何?
这两周,我一边收到各种科技圈和投资圈的头条新闻,一边和新闻中相关公司的工程师和高管吃饭、喝咖啡,产生了一种很强的割裂感。那些 AI 进化论的叙事和资本市场的起伏,与研究员和工程师们的日常工作之间,温差很大。
9 月,几位核心 AI 大厂 CEO 因担心 AI 失控而号召 " 给 AI 发展踩刹车 ";7 月以后,二级市场相关股票大幅下调并出现波动;一级市场更是几乎每 3 个月就完成一次热度周期转化。
与此同时,大厂和实验室的日常:该做的内部项目照样在做,该推动的进展依旧在进行,似乎并没有太大的波动。正如一位做 infra 硬件相关的朋友说:" 身边情绪波动最大的都是搞二级,搞投资的,我们没啥变化。" 而对于更多优秀的年轻人,也能看到他们依旧在认真思考如何更好地深入这股浪潮中,有人已然投身创业,有人在酝酿新项目,还有某些知名高校博导的学生刚入组已被预定,还没毕业就已经 " 财富自由 "。
在绝大部分参与交流的一线科研人员身上,能感受到兴奋与压力的交织。跟我说可能要被 AI 取代、准备 " 退休 " 的科研大神,说这话时其实显得挺轻松。反而是聊到自己能参与这场巨大的盛宴时,能感受到他们发自内心的、很纯粹的满足感。
但同时,这种纯粹的背后,正如一位核心研究员的朋友所说:" 少量业余时间打打单机游戏之外,基本没有生活,绝大部分时间都扑在模型研发上,也憋着一股做出新一代最强模型的劲儿。可能稍微不留神,别人就赶上来了。当然后来也习惯了,这是常态。"
另外,这次各个领域的受访者,对国内相关公司的情况都非常了解,甚至往往站在一个更客观、更全面的视角,无论是模型、机器人还是基础设施。我听着某大厂研究员对国内具身公司的实际技术水平和内部组织情况如数家珍,而且少了资本狂热带来的那层滤镜。同时也能感受到,在不少领域,中国本土的技术进展还是很被认可的。
结语:越来越强的 AI,让什么样的人更重要?
把不同层次的现实放在一起,我对 AI 能力的持续进步更加乐观,也更清楚价值落地的难度。对于 SevenX 这样的早期投资者,很多交流发生在公司还没有成立、产品还没有成形的时候。我们需要理解一个人为什么看到了这个问题,以及更重要的,是每个人的特质、状态,以及如何应对这暴风骤雨般的变化:研究员的审美与抗压,工程师的务实与对交付的执着,博士们对职业路径和研究方向的重新思考,创始人走出成熟组织、从头创造一家新公司的勇气,以及对于所有人而言,当执行力被 AI 放大后变得更重要的判断力。
这次见到的很多人,已经有了令人羡慕的履历和工作,却仍在认真考虑下一步。有的准备离开成熟组织,有的继续留在实验室,也有人专注于一个看起来很小、却影响整套系统的问题。我想继续了解的,是他们如何把最初的兴奋变成持续的投入,以及在新的证据出现时,如何修正自己的判断。对 SevenX 来说,我们也一直在寻找有着这种精神底色的人:他们热爱驱动,独立判断,敢于挑战共识,也敢于否定昨天的自己,他们会长期留在游戏里。
下一次见面,我想问他们:这段时间,你把什么问题往前推进了一步?
模型还在加速。世界如何跟上,会逐渐体现在这些人的工作里,也体现在他们正在做出的选择中。
彩蛋:Fun Facts

