【CNMO 科技消息】DeepSeek 近日发布新一代 AI 模型 V4.1-Flash。按照官方介绍,V4.1-Flash 虽然总参数规模和激活参数均低于 V4-Pro,但在性能、推理速度和成本控制方面表现更突出,尤其在智能体和编程相关任务上,部分基准测试成绩超过 V4-Pro 以及 GPT-5.6 Sol 等部分前沿模型。

CNMO 科技注意到,V4.1-Flash 采用专家混合架构,总参数为 5520 亿,输入阶段激活参数为 80 亿,输出阶段为 160 亿。相比之下,上一代 V4-Flash 总参数为 2840 亿,V4-Pro 总参数则达到 1.6 万亿。该模型的一项重点改进是大幅压缩 KV 缓存,缓存占用降至每个 token 约 890 字节,同时输出速度达到每秒约 214.4 个 token,首个 token 响应时间为 1.13 秒。独立评测机构 AA 给出了 " 速度显著较快 " 的评价。


技术层面,V4.1-Flash 引入名为 CED 的新结构,将 40 层 Transformer 拆分为 20 层因果编码器和 20 层解码器,减少传统交叉注意力带来的重复计算,并结合 CSA2、FP4 量化等方法压缩缓存与内存占用。
整体来看,DeepSeek 此次更新重点放在智能体执行、代码能力和部署成本优化上。