关于ZAKER Skills 合作
钛媒体 20小时前

一切皆插件,DSH 在“自进化”之路上狂飙

文 | 字母 AI

千呼万唤始出来,DeepSeek V4 Pro 正式版和传说中的 DeepSeek Harness(DSH)终于问世了。

说起 DSH 这个产品,它曾于 8 月 1 日开始招募内测。招募采取筛选制,优先吸纳具备大型项目开发、AI Agent 二次开发经验的工程师,申请人需要提交代码托管平台账号和过往项目代表作品,入选者还要签署保密协议。

现在终于算是见到了 DSH 的庐山真面目。经过字母 AI 一晚上的测试,结论是这个产品性能很好、响应速度快,关键是还非常省 token。

只能说,还得是 DeepSeek,老配方老味道!

再看 V4 Pro 正式版这边,虽然 8 月 13 日时,由于 DeepSeek 修改了 API 文件的表述,以及在 DeepSeek 官网增加公告,导致 8 月 13 日上午,全网都在热传 V4 Pro 正式版已经发布。

可事实上,此次发布实则为一场乌龙,所谓的 DeepSeek V4 Pro 正式版不仅性能堪忧,而且价格还保持着此前的价格不变。

8 月 13 日下午,DeepSeek 官方撤下了首页关于 DeepSeek V4 Pro 正式版发布的公告。

而 8 月 13 日晚间发布的,才是真正的 DeepSeek V4 Pro 正式版。

Agent 能力大幅提升。DeepSWE 从预览版的 12.8 分直接飙到 62.7 分,涨幅接近五倍;DSBench-Hard 从 31.1 冲到 67.2;DSBench-FullStack 从 41.8 提升到 71.1。尤其是在 Agent 领域影响力最大的基准 Terminal Bench 2.1 上,DeepSeek V4 Pro 正式版性能比肩当下最强的 Claude Fable 5。

话又说回来了,虽然此前 DeepSeek 公告称价格上调,但谁也没想到涨价涨得这么多。

输出方面,高峰时段价格为原价的 4.5 倍,为 27 元 / 百万 token,空闲时段为原价的 2.25 倍,为 13.5 元 / 百万 token。以单日 20 万输出 token 的代码审查场景为例,调价前单日成本约 1.2 元,高峰时段将升至 5.4 元,空闲时段升至 2.7 元。

缓存未命中输入方面,高峰时段为原价的 3 倍,为 9 元 / 百万 token,空闲时段为原价的 1.5 倍,为 4.5 元 / 百万 token。缓存命中输入方面,高峰涨幅最高,达到原价的 12 倍,为 0.3 元 / 百万 token,空闲时段为原价的 6 倍,为 0.15 元 / 百万 token。

无论如何,不妨先来一起看一下这个产品。

它不是下一个 Codex,它是第一个 DSH

应了梁文锋那句 " 我们不在乎 C 端 ",DSH 的安装门槛非常高,不仅要有 node.js 环境,还需要用户自己去 GitHub 上面用 npm 命令安装。像是 Codex、Workbuddy 这样的 Harness,都是可以直接双击安装的。

之所以有安装门槛,是因为 DSH 既不是桌面 GUI,也不是 TUI、CLI,而是走了一条几乎没人走过的路,DSH 是 BS 架构的 Web UI,打开就是个网页,网页里带一块 Agent 干活的区域。

要理解 DSH 为什么这么 " 反用户 ",就得先理解支撑它的那篇论文《A Programming Paradigm for Spatiotemporal Composability》,由北京大学和 DeepSeek 联合署名。

DSH 的思路叫做一切皆插件,任务需要什么,就调用什么插件,用完立马卸载腾空间。

打个比方,Claude Code 是一辆车,你可以给它装上装甲、防滑胎甚至是武器,但它归根结底就是一辆车。Codex 同样是一辆车,可你只能给它改改内饰和车漆。DSH 只是一个底盘,你可以给它加轮子让它变成车,但你同样可以给它加螺旋桨让它变成直升机。

为了满足这个核心设计理念,论文提出了两个维度。

第一个维度叫时间可组合性。意思是,当一个组件被移除时,它对共享环境造成的所有修改,必须能被完全、安全地撤销。

论文引用了 " 效应 " 这个概念,传统的效应指的是一个程序在跑出结果之外,还会动手改变外面的世界,比如创建了一个文件,那么磁盘里就会记录这个文件的内容。

DSH 是把运行办法、撤销办法全都记录在了效应之中,还专门给它起了个名字,叫做可逆效应。

这个很好理解,经典 " 效应 " 像是你买东西时收银台给你开的小票,它只记录你买了什么,如果你想退货,你还得走一些程序。而 DSH 论文中的可逆效应,就像是你在胖东来买东西,你退货的时候不需要走程序,直接把商品交给客服,剩下的他们(系统)会替你解决。

每一次上下文变换都自带一个逆变换,运行时全程追踪,组件卸载时自动回滚。

第二个维度叫空间可组合性。

这是一种运行时的组件组合模型。和传统的静态依赖注入不同,组件的依赖关系不是在代码编写时或启动时固定的,而是在一个共享的运行时 " 空间 " 中动态建立、动态消解的。

举个例子,假如说你想让 DSH 给你念一本书。DSH 上有视觉相关的插件,它可以充当眼睛,把书的内容记录下来,但是它没办法念出声。同时 DSH 还有声音相关的插件,它只会读却不会记。将视觉插件和声音插件放在同一个空间内,它们就会自动关联,视觉插件负责把记录的文字给声音插件,声音插件再将其读出来。

论文里拿 VS Code 当反例,VS Code 的扩展全部跑在一个共享进程里,装了就不能热卸载,想停用一个带代码的扩展,就得重启整个扩展宿主。

按论文统计,安装量前 100 的扩展里,有 87 个包含可执行代码,都得靠重启来卸载。

可是一旦重启,进程内积累的缓存、连接、部分计算结果全部作废,重建要花上几秒到几分钟;为了维持可用性,还得养冗余副本,以供重启之后 Vs Code 调用。

DSH 采用了一套 Cordis 系统,实现了热模块替换,改完插件直接原地替换,缓存和活动连接都给你留着,改炸了还能事务性回滚。

但 DSH 真正让人惊艳的,并不在这套理论本身,而是它把理论用在了哪里。

DSH 定义了四套完全不同的执行模式:普通任务直接做;长程任务进入 Goal,可以跨多个自主轮次(autonomous rounds)持续执行;一两个任务可以丢给子 Agent,默认后台运行;大规模并行任务进入 Workflow,用一段 JavaScript 去编排多个 Agent。

小事,比如 " 帮我把这个文件改一下 ",AI 直接上手就干,不搞流程、不折腾。

大事,比如 " 给我写一个完整项目 ",可能得干好几个小时。为了防止过程中出错,所以 DSH 给它定制一个 " 总目标 ",让它能连续干好多轮,直到目标达成才收工。就像带了个 KPI,没完成不许下班。

为了能更好地完成任务,DSH 甚至还有一个单独的 Ralph Loop,每一轮都创建一个完全 " 失忆 " 的新 Agent,不继承上一轮对话,只通过共享的 Workspace 保留长期记忆,然后一轮轮迭代。

DSH 也是为了 AI 自进化设计的。

插件化意味着架构解耦,任何模块都可以独立演化;AI 注意力受限,又是大规模并发,解耦设计能最大限度发挥这种高并发优势,还避免了把自己搞崩溃的问题。

传统软件里,模块之间经常 " 你中有我,我中有你 "。改一个地方,可能连带弄坏十个地方。

插件化就不一样,每个功能都是一个独立的插件,只通过一个标准接口跟系统相连。插件之间不直接认识、不互相扯皮。

正因为这样,任何一个插件都能单独升级、单独替换、单独进化,不用动其他插件。

假如按照传统模块 A 干活必须等模块 B 先干完,那大家排着队,互相干等。但解耦之后,每个模块都是独立的,谁也不挡谁的路,几十个任务可以同时撒出去跑,互不干扰。

AI 注意力有限没关系,因为每个模块是独立的小任务,AI 分头指挥、同时推进,效率拉满。

同样的任务,便宜 120 倍

相同的任务,差不多的效果,Fable 5 一共花了 9.8 美金的 token,约合人民币将近 70 块钱。用 DSH 配上 DeepSeek V4 Pro 正式版跑,只花了 5 毛 9 分钱人民币。

此前根据 Artificial Analysis 的测算,DeepSeek V4 Flash 正式版在相同的任务条件下,比 Claude Fable 5 便宜了约 100 倍。

但 V4 Flash 毕竟只是个轻量模型,并不能完成复杂任务。这次随着 V4 Pro 正式版以及 DSH 的组合,已经比 Claude Fable 5 便宜将近 120 倍了。

Artificial Analysis 曾预测,随着 DeepSeek V4 Pro 正式版发布,DeepSeek 斩杀线将会覆盖全球超过 70% 的模型。现在看来 Artificial Analysis 预测的非常准确。

不过我也得 " 唱个反调 ",由于我测试的时间段属于非高峰时间段,所以 token 价格相对便宜,如果换做高峰时间段,那么 V4 Pro 正式版的 token 费用将比 Fable 5 便宜不到 100 倍。

在我测试的过程中发现,DSH 的缓存命中率能高到离谱,有时候甚至能高到 99%。

要知道,无论是高峰还是非高峰,命中缓存都比非命中缓存便宜整 30 倍。

除了前文提到的热替换和可逆效应以外,还有一点就是论文里的 " 增量协调 "(Incremental Reconciliation)。

配置层是一棵由 " 档案卡 "(entry)组成的树,每张档案卡声明一个插件,里面的信息包括它叫什么、跑哪份代码、带什么配置。

传统做法是,档案一改,就把对应的整个实例连根拔起、全部重来。

增量协调不是这样。它先看改动落在档案卡的哪一格,再做最小动作,只有代码地址变了,才重建整个实例。如果只是隔离方式变了,那就单独调一下隔离域。如果改的是配置本身,就交给插件自己比对,只有真动到实质内容才重载。标成停用就卸掉,取消停用再装回来。插件底下还挂着子插件的话,就按各自的编号 " 按名对账 ":新增的装进来、删掉的卸下去、没动的原样留着,一层层递归下去。

这样一路修补下来的最终状态,和把整个系统推倒重建再加载的最终状态完全一致。

用人话说,就是改东西的时候只动该动的,没动的原地继续干活,而且最终效果跟全部推倒重来一模一样。

在以前,把宫保鸡丁变成宫保鸡丁(微辣),需要将整个餐馆停业,重新培训厨子、服务员和大堂经理。然而这样显然是浪费算力,增量协调相当于是检查一下宫保鸡丁(微辣)的菜谱,发现好像只要撒一点辣椒进去就可以了,于是就让所有流程保持不变,多增加了一道撒辣椒的程序。

DSH 在 " 省 token" 这件事上,还留了一整套后手。它的 PTC 模式(程序化工具调用),让模型生成一段代码去组合多轮工具调用,原本要五次模型往返的操作序列,一次就完成了。

相当于是把五次的输入输出,压缩成了一次。

诚然,DeepSeek 涨价了,还涨了不少钱。就算是梁文锋也没办法让 DeepSeek 永远便宜,但 DSH 能让 " 便宜 " 这件事在涨价之后依然成立。

模型定价是 DeepSeek 说了算,DSH 能做的,是把每一分钱榨出最大价值,贵可以贵,但绝不白贵。

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容