家人们,鲸鱼开眼了!
等了四个月,DeepSeek 的多模态模型:deepseek-v4-flash-vision-exp,终于发布。
我也是第一时间赶到现场,连夜开始实测。

基础识图能力实测下来,和一直在内测的网页版差不多,感觉就是同一个模型。
但在 Agent 任务上,「眼睛」确实可谓是超强的装备了。
先看,纯文本能力(Agent、推理、世界知识等),DeepSeek-V4-Flash-Vision-Exp 与 DeepSeek-V4-Flash 正式版持平。
但值得注意的是,在需要多模态的 Agent Benchmark 上,这个新视觉模型相比 V4-Flash,实现了大幅跃升!
甚至已接近Opus-4.8。

首先是 PPT,也是最需要视觉能力的白领场景了,纯靠 AI 盲画真的很难绷啊。。。



在 API 服务中,图片会转换成 token 后按 token 计费,一张图片最多占384 tokens。
如果按「高峰时期 + 缓存未命中」来计价的话,换算人民币,看一张图大约 0.12 分钱。
也就是说,即便每张都占满 384 tokens,1 分钱理论上能看大约 9 张图。
同样情况下,Image 2 看一张需要 2.06 分,比 DeepSeek 贵将近 20 倍。。。
这还没完。
DeepSeek Harness 也迎来了版本更新,正式原生支持「第一方」多模态模型。
现在,你可以直接在最新版的 DSH 里,选择这个视觉模型。

(bushi)
应该也是计划已久的合体吧,毕竟多模态模型搭配 Harness 食用,可以解锁很多新场景。

所以我也用 DSH 搭配 Vision 模型,测了一下。
满足一大心愿,之前 DSH 刚发的时候我就想做白模和 Codex 比比,奈何大鲸鱼没眼睛,我也不好意思欺负瞎子。
现在,我终于能让他照着图雕「牛来」了。

最后的成果长这样——

然后是前端任务,让他用 Canvas 手绘了个宇宙风格的 demo,点击可生成 UFO,效果还是不错。

找了张三代蜘蛛侠同框的图片丢给他,专门挑了侧脸的,想着可能难度高一点。
结果瞬间就出答案了,可能就两三秒,应该是已经被训练过。

《牛来》剧照,这个视觉模型 Loop 了好几轮,在网上翻了个遍,花了三分多钟才出答案。



不过,现在搭配 Harness 和 Max 推理食用,确实可以赋能不少任务。
等了四个月的眼睛…
其实吧,从今年大 Agent 时代开启以来,大家都在嘟囔 DeepSeek 到底啥时候支持多模态。
可惜,众所周知,DeepSeek 是一心向往 AGI 的,并不打算多模态上花太多心思,因此一拖再拖。。。
但像前端开发这类任务,看不了图真的很影响反馈迭代效率啊!!
图片生成无所谓,至少不能是瞎子吧。
Codex 在这方面就特别方便,还和产品结合起来了,可以直接在图片上批注修改意见。

DeepSeek 开始灰测识图。


整整将近四个月过去,DeepSeek,终于摘下了眼罩。

对了,除了 DS 之外,多模态这块,国产模型圈还有个事儿。
最近 X 上出了个「牛来」模型。。。
是的,就是那个电影院的《牛来》,火爆了,让海外 AI 圈知道了什么是真正的抽象。



DeepSeek 官方博客:https://mp.weixin.qq.com/s/UGMfvPMwBIB4oFYZZejekA
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见