关于ZAKER Skills 合作
钛媒体 15分钟前

DeepSeek Harness 开启内测?看来 V4 正式版也不远了

文 | 字母 AI

从 2026 年 3 月崔添翼加入 DeepSeek 开始组建 Harness 团队到今天,憋了 5 个月,DeepSeek 的 Harness 工具这回真的要来了?

一张截图在各大 AI 社区流传,内容是 DeepSeek Harness 的内部测试招募通知。

按照截图的说法,Harness 计划于本周晚些时候开启内测,首批用户从小范围群组中筛选,入选者需要提交个人资料、签署《保密承诺函》,才能拿到产品访问权限。

并且截图显示,一旦泄密,不只是当次资格取消,还会影响日后 DeepSeek 各类模型、产品内测以及合作机会的入选。

虽然截图真伪无法验证,但结合 DeepSeek 此前关于 V4 正式版发布日期的公告,以及崔添翼曾表示 Harness 将和 V4 同时发布,那么这条传闻很有可能是真的。

然而目前市面上没有任何关于 DeepSeek Harness 产品形态的报道,按照 DeepSeek 以往的作风来看,Harness 是重要产品,它的研发与设计一定是严格保密的。

不过我们还是能通过 DeepSeek 的各种蛛丝马迹,大致推断出这个产品大概长什么样。

DeepSeek Harness 到底长什么样

DeepSeek Harness 究竟长什么样?目前公开的信息只有两块,第一块是负责人崔添翼的量化背景,第二块是 DeepSeek 关于 Harness 部分的招聘职位描述(JD)。

先来说第一块,崔添翼不是做 AI 出身的。他在 Jane Street 做了九年的量化交易系统。

在量化交易系统里,最值钱的是执行系统。它讲究的是软件能不能在毫秒级别把策略变成交易?能不能在出了异常的时候自动恢复?能不能在每一步都留下可追溯的日志?

如果把这个思维搬到 Harness 上,那么其大体逻辑可能会是这样的:

量化交易里,慢一毫秒,钱就被别人赚走了。所以系统的每一步都得抠着毫秒级优化,不能有多余的步骤。

所以 Agent 循环的每一轮推理 - 执行 - 反馈都要快,不能有冗余开销。你跟 AI 说一句话,它不能半天没反应。从它想一下、到调用工具、到拿到结果、到再想下一步,整个循环必须得快。

同时,量化系统必须得非常可靠。如果量化系统崩了,那亏的是真金白银。所以哪怕行情再诡异、数据再离谱,系统本身不能挂,得能自己恢复。

模型可能会犯错,甚至输出一些离谱的东西给你,但 Harness 这个框架本身不能崩,得能兜住结果,想办法把模型拉回来继续干活。

其实在量化交易里,网络断了、交易所接口挂了、行情数据异常了,这些都是家常便饭。系统不能一遇到问题就死,得有重试、有备用方案、实在不行就降级,比如实时行情拿不到,就先用延迟数据顶着。

模型也是同理,调用工具失败了、文件读不出来、网络超时了,这些都是常事。好的 Harness 不会因为一个工具调用失败就整个任务废掉,它会自动重试、换个方法、实在不行就降级处理,继续推进任务。

另外,由于量化系统涉及大量的金钱,交易出问题了,得能查到是哪一步出错的,可能是下单的时候错了,也有可能是行情解析错了。每一步都得有日志,这样才能复盘。

Harness 也一样,AI 把活干砸了,你得能回看它是怎么一步步走到坑里的。是哪一步想错了?哪个工具调用返回了异常结果?它为什么做了那个错误的决定?

在整个量化系统里,订单状态也非常重要。不能出现 " 我以为下单了但其实没下 " 或者 " 重复下单 " 这种情况,每一步的状态都得是确定的、一致的。

放到 Harness 上,在所有人都押注长程任务、复杂任务的当下,能否维持模型中间的状态,将决定整个 Harness 的成功率。不能前面改了 A 文件,后面改 B 文件的时候把 A 的改动忘了。

最后是风控和安全了,量化交易有熔断机制,行情异常的时候自动停止交易,防止一个 bug 把钱亏光。另外,高风险的操作必须有审批,不能说下单就下单。

那么回到 Harness 里,在让 AI 删文件、格式化硬盘、跑 sudo rm -rf 这种高危操作之前,就必须得停下来进行确认。不能它自己想干啥就干啥,Harness 得有个安全闸门。

从 DeepSeek 的 JD 里看产品

说完了第一块再说第二块,DeepSeek 官方挂出来的岗位 JD。

JD 里提到了 KV Cache、长上下文裁剪与压缩算法,说明 Harness 会做智能的上下文管理。

配合 DeepSeek V4 的前缀缓存能力,相同上下文的任务不重复计算。长对话中自动对历史消息做摘要,保留关键信息,释放 token 空间。根据任务复杂度动态调整上下文策略,简单任务用短上下文省成本,复杂任务拉满百万 token 的长上下文。

相当于是把每一份算力都花在刀刃上,小事能省则省,大事算力拉满。

JD 里还提到了向量存储方案选型、会话状态持久化与回放,这也就意味着 Harness 有长期记忆系统,会记住你项目的架构、编码规范、常用模式,下次打开项目自动加载。

会话持久化代表就算你关掉终端后再打开,之前的对话状态、修改记录、执行轨迹依然都在。甚至 DeepSeek Harness 还可能记住你的命名风格、喜欢的框架版本,跨对话记忆你的各种习惯。

JD 里提到了 Tool Use 链式调用、错误回退与自动重试,这是指 Harness 有完整的工具调用编排能力,能编排多步工具调用的有向无环图。工具调用失败自动重试,重试不行就降级换方案,再不行就回滚到上一个稳定状态。

划重点,DeepSeek Harness 还可能支持动态注册新工具,Agent 能自动发现并学会使用。

JD 里提到了多 Agent 间通信协议设计、任务分解与结果聚合。这说明 Harness 有子 Agent 架构,一个主 Agent 负责任务规划和协调,多个子 Agent 负责具体执行。

不同子 Agent 有不同的系统提示词、工具权限、上下文窗口。主 Agent 把复杂任务拆成子任务,分发给子 Agent,再把结果聚合成最终输出。每个子 Agent 运行在独立上下文或进程中,互不干扰,出错了不影响主流程。

JD 里还提到了任务规划图生成、执行路径在线优化。这意味着 Harness 有规划与自进化的能力。

规划说的是接到任务后先生成执行计划,分几步、每步用什么工具、预期产出是什么。执行过程中根据实际情况动态调整,不是死板地按原计划走。每完成一步就自我检查,不对就自动修正。

而且,DeepSeek Harness 很可能有一套内部 benchmark,每次架构改动都跑一遍,看是进步了还是退步了,以此实现工具的自我进化。

最有意思的一点在 JD 最后,DeepSeek 说,要让模型与 Harness 共同进化,实现模型与 Harness 的深度适配。

这也就代表了,Harness 会利用 DeepSeek-V4 模型的特性,比如 V4 的稀疏注意力、前缀缓存。它不是通用 Harness 框架,而是跟 DeepSeek 模型深度绑定的一体化产品。

其实这也是 OpenAI 现在的理念。

此前。OpenAI 是有两条独立的后训练线。一条是代码专用的 Codex 线,一条是通用推理的 GPT 线。到 GPT-5.5 的时候,两条线合并了,GPT-5.5-Codex 将代码能力和通用推理能力整合进了同一个模型。

这就好比汽车,原厂就像汽车厂家自己做发动机 + 变速箱,知道发动机的扭矩曲线、转速特性,变速箱换挡逻辑可以精准匹配。但是如果把这事交给第三方来做,发动机对他们来说是黑盒,只能凭感觉调变速箱,这就导致永远调不到原厂那么丝滑。

V4 正式版,跳票一个月

Harness 不是一个人来的。崔添翼曾表示,V4 正式版和 Harness 将同步发布。

4 月 24 日,DeepSeek 发布 V4 Preview,Pro 和 Flash 两个版本同步开源。两个月后,在 6 月 29 日那天,DeepSeek 向 API 用户发送邮件,明确说 V4 正式版计划于 7 月中旬上线。结果眼瞅着要到 8 月了,依然没有任何关于 V4 正式版的消息。

曾有传闻称,由于 7 月 24 日,DeepSeek 旧的 API deepseek-chat 和 deepseek-reasoner 正式退役,所以 V4 正式版将会同期发布。毕竟更换 API 接口,通常是给新版本让路的前置动作。

可 V4 正式版依然没有发布。只是两个旧模型名正式停用,所有调用必须换成新的 deepseek-v4-flash 和 deepseek-v4-pro。换句话说,API 接口名换了,但模型本身还是预览版那套。

那么正式版比预览版强在哪?

综合多个内测信源的说法,称 V4 正式版在三个方向上做了升级:

核心推理能力再上一个台阶。

日常对话的响应速度明显优化。

Agent 能力针对性迭代。

有参与灰度测试的人总结,V4 正式版整体表现接近 Opus 4.8 级别,编码能力不弱于 GPT-5.6 Sol,Agent 能力和 3D、SVG 生成能力大幅提升。同样的任务比 Claude Fable 5 迭代轮数还少。

不过这些说法都来自非官方渠道,DeepSeek 没有公开确认。

预览版的问题其实社区里讨论得不少。V4 Preview 在编程能力上和 Kimi K2.7、GLM 5.1 接近,但仍然逊色当前的主流模型。

尤其是在那些复杂的任务上。有测试者发现,即便要求模型 " 不使用外部依赖 ",模型依然引用了外部 CDN。

遇到真正复杂的任务,需要手动加 reasoning_effort=max(推理强度最高)才能拿到更深的思考深度,但变成 agent 往往会忽略这个提示词,导致模型思考的强度不够。

还有一点,虽然目前 DeepSeek 已上线识图模式(OCR),不过 DeepSeek-V4 的多模态能力也是短板。

按照 DeepSeek 官方的说法,预览版是纯文本,正式版首次原生支持图像推理,DeepThink 引擎可以在同一个思考流程中分析图片、解读截图。这变相也增加了 Harness 工具的压力。

以及 V4 正式版会加入一些企业功能,但具体如何,DeepSeek 官方并没有进一步透露。

再说价格,这是争议最大的部分。

V4 正式版将引入峰谷定价机制,高峰时段(北京时间 9:00-12:00 和 14:00-18:00)API 价格直接翻倍。具体来看,V4 Pro 缓存命中输入平时 0.025 元 / 百万 token,高峰 0.05 元;缓存未命中平时 3 元,高峰 6 元;输出平时 6 元,高峰 12 元。V4 Flash 缓存命中平时 0.02 元,高峰 0.04 元;缓存未命中平时 1 元,高峰 2 元;输出平时 2 元,高峰 4 元。

峰谷定价这件事,往好了说是把算力选择权还给用户,不急的任务挪到低谷时段跑,成本更低。可另一方面,在平时的办公时间,跑相同的任务,成本就会增加。

这不是 DeepSeek 第一次在定价上换思路。

2025 年 2 月搞过夜间错峰优惠,V3 五折、R1 二五折。2025 年 9 月 V3.1 发布,取消夜间优惠,全天统一价,输出价格还往上抬了 50%。

但关键问题不在于价格涨没涨,而在于结合 Harness 之后,整体使用成本会如何?

第三方测试显示,不同的 harness 在完成同样任务时,token 消耗差异巨大。测试机构用 DeepSeek V4 Flash,分别测试了 Claude Code、OpenCode 和 Pi 这三个市面上最常见的 Harness 工具。发现,三种工具的代码质量基本一致,但 Claude Code 每个任务平均跑约 70 次工具调用,OpenCode 只有约 22 次。

此外,同一个任务,在弱 Harness(Pi)里失败了,换到强 Harness(Claude Code)里居然成功了。

因此,如何去平衡价格与性能,这是 DeepSeek 做 Harness 必须要面对的问题。

不过有一点我很放心,在省钱这件事上,梁文锋还是太权威了。

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容