DeepSeek V4.1-Flash:当“小弟”全面超越“旗舰”,MoE 的定价逻辑被改写

DeepSeek V4.1-Flash:当“小弟”全面超越“旗舰”,MoE 的定价逻辑被改写

Author: tengdy | Create: 2026-09-11 08:15:19 | Update: 2026-09-11 08:15:23 | 分类:大模型

V4.1-Flash大模型定价编码器-解码器MoEDeepSeek

9 月 10 日,DeepSeek 正式发布 V4.1-Flash。这不是一次常规的 Flash 迭代,而是一次产品位阶的重新定义:从官方公告看,V4.1-Flash 在性能、成本、速度上全面超越自家旗舰 V4-Pro,并计划在北京时间 9 月 14 日 12:00 之后将 V4-Pro 的全部请求自动路由到 V4.1-Flash,按 Flash 价格计费。

一句话:小弟把大哥取代了。

架构变了什么

V4.1-Flash 的几个关键参数:

  • 552B 总参数,MoE 架构;
  • Causal Encoder-Decoder 结构,输入与输出非对称激活:输入仅 8B 活跃参数,输出 16B;
  • 1M token 上下文
  • 原生多模态视觉理解
  • KV Cache 对 HBM 需求降至上一代 1/4,SSD 需求降至 1/8。

非对称 Encoder-Decoder 是最大亮点。传统 decoder-only 模型在 prefill 和 decode 阶段用同一套参数,而 V4.1-Flash 把“理解输入”和“生成输出”拆成两个效率目标:输入侧可以非常轻,输出侧保留足够能力。这种设计直接对应 API 场景的真实成本结构——预填充(prefill)是大批量一次性计算,解码(decode)是逐 token 自回归,二者优化目标本来就不一样。

DeepSeek 称,这种架构让 V4.1-Flash 在保持高性能的同时,成本和延迟都显著低于同尺寸模型

性能:不是接近旗舰,是超过旗舰

官方公布的 19 项测评中,V4.1-Flash 有 14 项超过 V4-Pro。在 Agentic 综合基准中,DeepSWE v1.1(软件工程)、CyberGym(网络安全)、Automation-Bench(通用自动化)三项得分超过 Kimi K3、GLM 5.3、Claude Opus 5 和 GPT-5.6 Sol;仅在 Terminal-Bench 3.0 这类极复杂终端任务上略低于 Opus 5 和 GPT-5.6 Sol。

第三方追踪站点 Traictory 给出的数据也显示,V4.1-Flash 在 HumanEval、GSM8k、GPQA Diamond、Terminal-Bench 2.1 等测试上都处于第一梯队。

这意味着 Flash 不再只是“便宜版”,它正在成为 DeepSeek 的新旗舰基线

定价与产品策略

V4.1-Flash 延续了峰谷定价:

  • 空闲时段:输入 1 元 / 百万 tokens,输出 4 元 / 百万 tokens;
  • 缓存命中输入低至 0.02 元 / 百万 tokens;
  • 对比上一代 V4-Flash:输入 1.5 元 / 百万 tokens,缓存命中 0.05 元。

更重要的是产品替代策略

北京时间 2026 年 9 月 14 日 12:00 之后,至未来 V4.1-Pro 上线之前,用户访问 deepseek-v4-pro 的请求将全部路由到 V4.1-Flash,并按 V4.1-Flash 单价计费。

这不是简单的降价促销,而是产品线重构——当 Flash 足以替代 Pro 时,DeepSeek 选择直接取消 Pro 的独立定位,把资源集中到 V4.1 架构上。未来 V4.1-Pro 可能会推出,但届时它的对手已经不是旧 Pro,而是 V4.1-Flash 自己奠定的基线。

对行业的两个信号

1. “Flash”正在从低端 SKU 变成主航道

过去大模型产品线的典型结构是:Pro/Max 负责能力旗舰,Flash/Lite 负责性价比。但 V4.1-Flash 证明,架构创新可以让性价比 SKU 同时承担旗舰能力。当输入激活只有 8B、输出 16B 就能打败 49B 激活的旧旗舰时,参数效率比绝对参数量更重要。

这对其他厂商的产品规划是压力:如果你的 Flash 只是“砍能力换速度”,而 DeepSeek 的 Flash 是“换架构提效率”,那两者的成本曲线会越拉越大。

2. KV Cache 压缩是 Agent 时代的胜负手

DeepSeek 在公告里反复强调 KV Cache 的压缩:HBM 1/4、SSD 1/8。这看起来是工程优化,实则是商业模式优化——Agent 任务中长上下文、多轮调用、高频缓存命中是常态,缓存成本可能占 Agent 总成本的很大比例。把缓存压下去,等于把 Agent 规模化使用的门槛降下来。

国盛计算机的点评也指出,V4.1-Flash 的性价比有望“加速迈入 Agent 规模化可用区间”。

需要注意的局限

  • 视觉理解能力虽然标称原生多模态,但实际生产效果还需独立评测验证;
  • 非对称架构对部署和推理框架提出了新要求,开源社区适配需要时间;
  • V4-Pro 退役时间明确但 V4.1-Pro 尚未发布,中间窗口期需要关注服务稳定性;
  • 官方数据为自测,第三方独立评测(如 Artificial Analysis、LMArena)的完整结果尚未出炉。

一句话总结

DeepSeek V4.1-Flash 不只是一款更快的模型,它用非对称 Encoder-Decoder 架构证明:效率 SKU 可以反超旗舰 SKU。当 9 月 14 日 V4-Pro 自动降级为 V4.1-Flash 时,国产 MoE 的定价逻辑将被永久改写。

参考来源

  • DeepSeek 官方公告(中文), "DeepSeek V4.1 Flash: 更强、更快、更普惠", 2026-09-10: https://www.deepseek.com/news/deepseek-v4-1-flash/
  • DeepSeek 官方公告(英文), "Introducing DeepSeek-V4.1-Flash", 2026-09-10: https://www.deepseek.com/en/news/deepseek-v4-1-flash/
  • Traictory, "DeepSeek-V4.1-Flash by DeepSeek", 2026-09-11: https://traictory.com/model/deepseek-v4-1-flash
  • 国盛计算机(今日头条), "DeepSeekV4.1Flash发布,揭示降本新解法", 2026-09-11: https://www.toutiao.com/w/1875986337522755/

评论(0)

暂无评论,来抢沙发~


关于本站 · RSS

浙ICP备2025156991号浙公网安备33010802013816号 浙公网安备33010802013816号 © 2026 智能体工场 - [从善如登] All rights reserved.