
作者丨高允毅
编辑丨岑 峰
最适合鞭打 AI 干活,还得是 AI 啊。
英伟达今早开源了一套提高工作效率的 Harness ——SoL-Pi,它让 AI 亲自当监工,去 Agent 工作流中吹毛求疵,把每一处可能 " 摸鱼、浪费 Token" 的环节进行修复,自我迭代优化。
效率提升后,Token 消耗最高减少了 64%,API 调用成本下降 50% – 54%,在实际开发中每小时能帮企业省下 8.75 到 13.5 美元。
它之所以能有这么好的效果,是因为英伟达让 AI 提出了 152 个优化工作流的想法,通过严苛的自动化流水线层层淘汰,最终只有 4 个机制活了下来。这 4 个机制就成为了 SoL-Pi 的核心。
因为它是基于开源项目 Pi 改造的,所以名字里也带上了这个关键词。
现在大家都在想办法降本增效,英伟达的这次创新,实实在在为企业省了不少钱。
01
AI 怎么发现 AI 偷懒的?
AI 是怎么找到 AI 偷懒的?这件事要从两个层面讲,一个是眼前的浪费,一个是长远的困境。
在真实业务中,现在 AI 的工作早已进化成成千上百个 Agent 协作,干个几天几夜,都不需要人插手了。不过,这也意味着,如此长的周期,上下文堆积的历史记录会越来越臃肿,调用的工具也越来越多。
每次调用模型,都要把这些历史内容重新读一遍,必然藏着巨大的冗余。而且 AI 缺乏人类的变通能力,有时候很多可以连续完成的操作,它可能就会死板的拆成两次决策。这些零散的浪费积累起来,烧掉的都是真金白银。
目前行业都在聊 RSI,即 AI 自己优化自己,但每一次尝试都是要消耗 Token 的,而且 90% 以上的尝试最终都会失败。这种盲目试错的成本太高了,企业可能还没等到 AI 进化成功,资金链就先断裂了。
那英伟达的思路是,效率我要提升,但钱我也要省。他们没有让 AI 盲目地在线去改代码,先让 AI 批量提出 152 个优化工作流程的想法,然后放进一个严苛的自动化沙盒里进行筛选。这个自动筛选的过程,被称为 " 自动研究循环 "。
英伟达还探索了3 种 AI 管理 AI的方式。
一个是计划经济模式,即你是老板,我照做。由人或者主模型定死每一个步骤,但很快因为死板的规则被放弃。
第二是中心化管理模式,即有一个超级主管 AI,在运行时现场写代码、开会、给底下的 Agent 派发任务、实时调整流程。这种模式非常灵活,但会累死主管,主模型核心代码库变得无比庞大臃肿。
第三个是共享快闪模式,整个系统只维护一个最简化的 " 工作模板 " 和说明书。每个 AI 实验启动时,直接复制一份这个模板,在里面随心所欲地改代码、跑实验。一旦这个实验结束,这套临时改出来的指挥代码就被直接丢弃。
第三个方案被采用,跑完了 152 个实验。最终,只有 4 个最有效的机制活了下来,成为了 SoL-Pi 的核心骨架。
▎机制 1:动作融合
之前 AI 改完一行代码,要先停下来思考一次 " 接下来我要不要跑个测试验证一下?",做出决定后,再发指令调用终端跑测试,这中间多了一次 AI 推理。
系统识别后,直接把 " 改代码 + 跑测试 " 这种固定的连续动作,两步并做一步,省掉那次多余的决策开销。

Transformer 的机制,决定了 AI 的记忆,是线性累加的,每做完一个任务,都要把前面的积累 " 上下文 " 都看一遍,这样成本会越拉越高。
优化后,系统会把大任务拆分成一个个独立的小任务,每做完一个小任务,就把这段历史压缩整理成精简版,只保留关键结论。平常只开 " 摘要 ",需要核对细节了,再把原始记录调取出来。

每次工具输出的结果,也会完整地塞进上下文里,比如跑测试生成的几百行日志。后面每次讨论到这个结果,都要带着这一大段内容,非常占用空间。
优化后,系统会把完整的输出结果存在本地,上下文里只留一个简短的 " 摘要 + 索引 ",AI 如果想看具体详情,再专门调取对应段落即可。

在分析错误日志、排查问题时,都需要主模型从头读到尾,这有点 " 杀鸡焉用牛刀 "。
优化后,系统会用成本更低的小模型把日志提炼成 " 诊断报告 ",而这份报告的每一个结论,都能对应回原文的具体位置。主模型只看这份精简报告,如果有疑问,再去核对原始原文。

比 Pi 更省钱的 Harness,
将大模型性价比推向极限
为了验证这 4 个机制效果如何,英伟达搭出535 个可验证环境。
其中,495 个任务是英伟达团队去 GitHub 上翻找了 真实的开源项目 bug,它们把代码仓库 " 一键还原 " 到当年程序员还没修这个 Bug 时的历史状态,并在离线环境里装好依赖。同时,把当年人类程序员是怎么修好这个 Bug 的 " 正确答案 " 藏起来不让 AI 看到。
另外 40 个任务是 " 盲盒通关题 ",英伟达先用代码写好一个 " 验证器,然后把 AI 丢进一个开放式的沙盒里,没有剧本,全靠 AI 自由探索去触发这个通关条件。
然后让 4 种 Harness 同台竞赛,分别是用原生框架驱动的 GPT-5.6 Sol、Claude Opus 5、开源智能体底座 Pi 以及英伟达自己的 SoL-Pi 。
结果,SoL-Pi 在保住基本盘情况下,展现出了惊人的省钱效率。

对比模型原生的官方代理框架,SoL-Pi 的 Token 消耗最高骤降 64%, API 价格最多降了 54%


与其一味追求让 AI 更聪明,不如先让 AI 干活更有效率。这样省下来的预算可以用来跑更多实验,尝试更多想法,最终反过来加速 AI 能力的泛化和进步。论文里把这个叫"Efficiency for efficiency"——效率既是结果,也是下一轮研究的资源。
而真正的效率并不是刷题来的,这四个机制,本质上都是挖出了 AI 工作流中普遍存在的 " 通病 "。哪怕你换了模型、换了任务,这些通病依然存在。
而这四个想法之所以能诞生,全靠广撒网、多尝试,如果只盯着一个方向深挖,很容易钻进死胡同。在这个阶段," 广度比深度更重要 "。
以后这种 "AI 改进 AI 工具 " 的事情会越来越多,哪怕你不用 SoL-Pi 这个工具,这四个优化思维也可以直接套用到你自己的 AI 工作流里了。
参考链接:https://nvlabs.github.io/SoL-Pi/
上车,雷峰网带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲 PPT
大会报告全文
热门论文解读
学术新星访谈
扫描上方二维码
或点击「阅读原文」关注专区。