DeepSeek V4.1 Flash 正式发布:552B MoE,新架构大幅压缩 KV Cache

DeepSeek V4.1 Flash 正式发布:552B MoE,新架构大幅压缩 KV Cache

2026 年 9 月 10 日,DeepSeek 正式发布 V4.1 Flash。官方称其为新架构系列中规模最小的模型,原生支持多模态视觉理解,并针对能力上限、推理速度与吞吐效率进行了重新设计。API 已可通过 deepseek-flash 调用。

V4.1 Flash 为 552B 参数的 MoE 模型,采用新的 Causal-Encoder-Decoder 架构。模型在输入与输出阶段采用非对称计算设计,输入侧约激活 8B 参数,输出侧约激活 16B 参数,在保持大模型容量的同时降低实际推理计算量。

V4.1 Flash 同时调整了预训练方式,并接受了更大规模的强化学习后训练。DeepSeek 表示,经内部与外部测试,新模型在性能、费用、速度和任务总用时等指标上均已超过 V4 Pro。官方公布的成绩包括 Terminal-Bench 2.1 90.6、DeepSWE v1.1 74.2、CyberGym 88.1。

新架构的另一项重点是压缩 KV Cache。据披露,与上一代相比,V4.1 Flash 对 HBM 的需求降至约 1/4,对 SSD 缓存容量的需求降至约 1/8。对于需要反复读取长上下文的 Agent 工作负载,这将直接降低缓存存储和持续推理成本。

DeepSeek 同步下调 Flash 系列 API 价格。空闲时段每百万 Token 的缓存命中输入、缓存未命中输入和输出价格分别为 0.02 元、1 元和 4 元,高峰时段为上述价格的两倍。

来源

来源2

huggingface

0 评论

发表评论

您是本站第23841名访客 今日有57篇新文章/评论