关于ZAKER Skills 合作
钛媒体 15分钟前

V4.1 Flash 内测,梁文锋又当回了梁圣

文 | 字母 AI

没有任何预告,DeepSeek V4.1 Flash 的中间版本 deepseek-v4.1-flash-expires-on-0910 开始内测了。

DeepSeek 官方表示,"DeepSeek V4.1 Flash 采用了新的模型结构,原生多模态支持、能力更强、速度更快、且成本更低。"

没有技术报告,也没有性能参数表,可是官方给出的信息已经挺让人震惊的了。

V4.1 Flash 是 DeepSeek 第一款原生多模态模型,V4 Flash Vision-Exp 虽然也支持多模态,但它属于 " 外挂式 ",在 V4 Flash 0731 纯文本底座上,外接了一个视觉编码器,以及一个对齐器(Aligner)。

V4.1 Flash 是出厂就自带图文一体化输入输出。

并且 V4 正式版到 V4.1 才过了 40 天,就采用新结构,还能在提高性能的时候降低成本……这难道不该叫 V5 Flash 吗?

在经过社区多位技术博主的测试后,即使这个模型只是 V4.1 Flash 的中间版本,还不是正式版,它的表现却是相当惊艳。

DeepSeek V4.1 Flash 牛在哪里?

就在招聘信息公布的前后,DeepSeek 内部代号为 DeepSeek-v4.1-flash-expires-on-0910 的中间测试版本突然开启测试,测试时间截止到 9 月 10 日。

DeepSeek 没有发布这个模型的技术报告,但是在官方发起的《V4.1 Flash 中间版本邀测反馈问卷》中,有这样一道题很有意思。

题目是 " 你觉得这个模型能全面替换线上的 DeepSeek V4 Pro 么?",选项分别为 " 可以 "、" 不可以 "、" 不确定 "、" 其他 "。

到底能不能替代 V4 Pro 得先让我看看它到底怎么样。

在经过测试后发现,V4.1 Flash 的速度实在是太快了。

以往我们跟大模型对话,即便响应再快,界面上往往也要跳动一两秒思考指示器。而在 V4.1 Flash 上,有开发者试探性地敲下一句 " 你好 ",模型给出的思考时间只有 0.3 秒,生成速率瞬间飙到每秒 159.3 个 token,整轮对话端到端耗时仅 0.8 秒。

在另一组重度长文本推理的实测截图中,模型生成速度甚至直接快到了每秒 420 个 token,端到端吞吐达 409.5token/ 秒。

在业内人的调侃里," 这吞吐量直接把别家所谓的极速模式(Highspeed)做成了自己的日常基准 "。

但这绝不仅仅是 " 快 " 那么简单,更是 " 又快又准 "。

博主向阳乔木将一张西装照发给了 DeepSeek V4.1 Flash,模型回答说他穿的是条纹西装。

起初他以为又和 V4 Flash Vision-Exp 一样出现了幻觉,结果打开大图仔细一看,图中的人穿的就是条纹西装。

多位抢测的资深技术博主对 V4.1 Flash 与此前的 V4 Flash Vision-Exp 做了同任务端到端对比评测。

结果显示,在 49k 超长上下文检索场景下,新模型的处理速度快了 5.2 倍;在 SVG 代码生成上,快了 6.0 倍;在经典的 Manacher 回文算法题解答上,快了 4.6 倍;在大型 SQL 查询生成与优化上,快了 5.0 倍;在高难度的 asyncio 异步架构重构任务里,处理速度依然达到了前代的 3.9 倍。

因此,官方称 V4.1 Flash 采用新的结构、原生支持多模态,这话一点不假。

还没完,在实现性能暴涨的同时,它的调用价格却和 V4 Flash 相同。

社区中有很多关于梁文锋的梗,DeepSeek 性能好价格低的时候将他尊称为 " 梁圣 "、" 梁祖 ",涨价的时候又叫他 " 梁子 "、" 小梁 "。

到了 V4.1 Flash 这里,梁文锋又当回了梁圣。

小鲸鱼的成人礼

就在 V4.1 Flash 发布的前一天,DeepSeek 突然宣布释放 150 人的大规模招聘名额,且明确面向 2 至 10 年的资深工程师,同时也兼顾应届生与新锐人才。

这次招聘主攻两个方向。其一是服务端开发工程师,涵盖大模型研究平台、Agent 框架组件、研发效率基建、DeepSeek API、线上服务以及数据工程;其二是 Agent 弹性计算研发工程师,包含平台开发和维护、底层调优与攻坚。

作为 DeepSeek Harness 的负责人,崔添翼在社交平台发文称,这次扩招绝不是为了做常规业务堆人,而是因为 " 量的激增引发了复杂度的指数级爆炸 "。

崔添翼写到:" 计算机领域的任何东西量变大之后,就会产生复杂度上巨大的增加。数据的量、机器 / 容器的量、训练任务的量、评测任务的量、Agent 环境的量、用户的量、请求的量,等等等等,都在急剧增加。这就产生了越来越大的复杂度,会让之前的后端系统逐渐不能完美满足将来的量的需求,所以需要大量扩招人来升级、维护和重写各种后端系统。"

过去的大众认知里,DeepSeek 是几十个天才算法科学家组成的 " 特种部队 ",凭着极致的代码洁癖和作坊式的灵感创新,打出了让硅谷侧目的战绩。然而,从首轮融资到如今的密集动作,DeepSeek 已经演进成一家数百人规模的企业。

在拿到首轮融资之前,DeepSeek 的服务器在海量流量的冲击下动辄宕机,融资到位后,服务端扩容,再也没有出现过长时间宕机。

但这仅仅是解决了浅层的网页和 API 问题,今天的 DeepSeek,它所面对的可不只是服务器压力。

从技术演进的角度来看,大模型正在经历一场从 " 静态预训练 " 走向 " 动态环境交互 " 的深刻质变。

过去训练一个语言模型,工程任务相对单纯,工程师把互联网上清洗好的海量静态文本塞进硬盘,让显卡吞吐数据。

到了现在的强化学习与 Agent 时代,模型为了学会解决真实任务,必须在毫秒级别内与成千上万个动态的 " 沙盒 " 实时交互。

打个比方,教模型下棋,过去是给它看千万盘死棋谱,现在则是让模型同时在十万个动态棋盘前跟自己博弈。

每一个棋盘环境的启动、状态恢复、网络隔离、结果抓取,都必须在毫秒级内完成。

原先 DeepSeek 作坊式的系统自己跑跑还行,扛不起这种级别的工业级动态负荷。

以 V4.1 Flash 这种级别的吞吐和推理速度来看,它需要极强的调度能力,才能满足这些开发者的需求。

比如哪些请求放在同一张 GPU 上批处理?长请求和短请求怎么混排才不会互相拖死?流量突然翻三倍的时候,从哪里秒级调资源过来?凌晨三点流量掉下来的时候,怎么自动缩容省钱?

作为一个实验室,DeepSeek 不需要在乎这些问题,但现在梁文锋手下的是一家企业,这些工程问题反而成了关键。

同样的,新结构意味着 DeepSeek 可能要自己改推理框架、自己写 CUDA 算子、自己做模型压缩和量化,依然是一个极其费时费力的工程问题。

V4.1 的 Agent 能力越强,需要的沙盒环境越多、弹性计算调度越复杂;V4.1 的多模态理解越成熟,数据管道和存储系统的压力就越大。

这 150 名工程师的作用就在于此。

虽说 150 人这个数量,不过是普通大厂一个部门的季度配额,可放在 DeepSeek 身上,这已经是翻倍量级的大动作。

DeepSeek 已经完成从 0 到 1 的过程,现在梁文锋面对的问题,是从 1 如何到 100,于是 DeepSeek 用 150 个 HC 作为回答,V4.1 Flash 就成了 DeepSeek 的成人礼。

天才少年终究要长大,大模型也不能只停留在论文和打榜。真实世界的业务与工程骨架,才是这家公司长久活下去、跑赢下一轮竞争的支柱。

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容