资讯详情

刚刚,deepseek新模型发布,KV Cache 压到上一代 1/8,Agent 成本继续下探

来源:今日头条发表:2026-09-10 16:26:49

9月10日,DeepSeek正式发布并开源 DeepSeek V4.1 Flash 模型。

据介绍,V4.1 Flash 是其新模型结构系列中的小尺寸模型,采用552B 参数 MoE 架构和全新的 Causal Encoder-Decoder 结构,输入和输出激活参数分别为8B 和16B。该模型原生支持多模态视觉理解,可处理图像与文本输入,并以文本形式生成输出。

DeepSeek表示,V4.1 Flash 通过压缩 KV Cache 降低推理与存储成本,相比上一代模型,HBM 需求降至1/4,SSD 需求降至1/8;在 Agent 使用场景中,这一改动主要指向长上下文任务的缓存成本。DeepSeek 称,V4.1 Flash 在性能、费用、速度和总用时等指标上已超过 V4 Pro,并计划在北京时间9月14日12:00后,将 deepseek-v4-pro 请求临时路由至 V4.1 Flash,直至后续 V4.1 Pro 上线。

API 调用方面,开发者可将模型名改为 deepseek-flash 使用新模型;deepseek-v4-flash 与 deepseek-v4-flash-vision-exp 将暂时路由到 V4.1 Flash。新价格自北京时间9月10日12:00生效,继续采用峰谷定价:高峰时段输入缓存命中、缓存未命中和输出价格分别为每百万 tokens 0.04元、2.0元和8.0元;空闲时段分别为0.02元、1.0元和4.0元。(袁宁)

[ 免责声明:本文属于网络转载,其内容和准确性由信息发布的原单位或组织独立承担完全责任,不代表本平台的观点和立场;文中涉及的图片等内容如有侵权,请前往本站右侧栏的“意见反馈”进行举报,一经查实,本站将立刻删除。]
0

5 0


中心