关于ZAKER Skills 合作
格隆汇 3小时前

DeepSeek 宣布大幅降价

就在刚刚,DeepSeek 放出 Flash 系列新的定价通知。

9 月 10 日中午 12 点起:每百万 Token,空闲时段缓存命中输入 0.02 元、未命中输入 1 元、输出 4 元;高峰翻倍,对应 0.04 元、2 元和 8 元。

高峰限定工作日周一到周五的 9-12 点、14-18 点,其余时间全部算空闲。

峰谷计费此前已经存在。

据官方现行价目表,Flash 及 Flash 视觉实验模型的空闲价格分别为 0.05 元、1.5 元和 4.5 元。

新旧对照,三项降幅分别为 60%、33.33% 和 11.11%。

按这一规则计算,一周 168 小时,高峰 35 小时,空闲 133 小时,占约 79.17%。

同样的 Token 组合,从高峰挪到空闲,费用理论上可以减半。

当然,只是理论上。

从商业逻辑看,这是一种需求侧管理。

算力基础设施需要投入,设备也会随时间折旧。

如果任务都挤在白天,平台就要为峰值准备容量,其余时间却可能利用不足。

通过价差把可延迟任务搬走,有助于提高设备利用率,摊薄单位服务成本。

所以,降价不意味着平台少赚。

可以通过时间上的调度,让现有设备干得更满。

关键要看增加了多少调用、填补了多少闲置,以及新增任务带来的边际成本。

更鸡贼的是缓存。

DeepSeek 官方文档说明,上下文缓存默认开启,后续请求完整匹配已经保存的缓存前缀单元时,可以复用对应内容;模型输出仍需重新计算生成。

开发者把固定规则、重复文档和稳定上下文组织好,就可能减少重复处理。

按新价,缓存命中输入只需未命中输入价格的 2%,输出单价则是缓存命中输入的 200 倍。

这种价差会直接影响应用设计。

举个例子:一次任务累计输入 100 万 Token,其中 80% 命中缓存,另外输出 20 万 Token,全部在空闲时段运行。

旧价费用为 0.8 × 0.05+0.2 × 1.5+0.2 × 4.5=1.24 元;新价为 0.8 × 0.02+0.2 × 1+0.2 × 4=1.016 元,下降约 18.1%。

这跟理论值相差甚远。

为什么?

因为输入优惠得再多,输出费用依然是大头。

少说废话,真的能省钱。

这对应用公司的意义,可能比一次促销更长远。

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容