DeepSeek 正式发布 V4.1-Flash:552B 参数的混合专家模型,支持最长 100 万 token 上下文,采用新的因果编解码架构,使输入每个 token 只激活 8B、输出每个 token 激活 16B 参数,并压缩 KV 缓存以压低智能体场景中占比最大的缓存命中费用。基础版在 MMLU-Pro 得 74.1、HumanEval 79.4、GSM8K 93.0,全面小幅超过 V4-Pro-Base;最高推理档位在 Terminal-Bench 2.1 拿到 90.6、DeepSWE v1.1 得 74.2,Codeforces 评分 3471,多模态侧 MMMU-Pro 56.5、DocVQA 95.6。API 侧非高峰价格为每百万输入 0.15 美元、输出 0.60 美元,高峰翻倍;从 9 月 14 日起,指向 V4 Pro 的请求会自动路由到 V4.1 Flash 并按 Flash 计费,调用方无需改代码。