2026 年 8 月 21 日,DeepSeek 在 API 平台悄悄上线了一个实验性模型:deepseek-v4-flash-vision-exp。没有发布会,没有技术报告刷屏,但开发者很快注意到它的分量——这是 DeepSeek 首次把视觉能力放进 V4-Flash 系列,也是国产开源 MoE 大厂在多模态 agent 战场上的一次关键落子。
它到底是什么
从命名就能读出定位:
- V4-Flash:沿用 8 月初正式 GA 的 V4-Flash 架构,总参数 284B、每 token 激活 13B 的稀疏 MoE,1M token 上下文窗口。
- Vision:新增图像理解输入,支持 JPEG/PNG/GIF/WebP,单张图片最高按 384 tokens 计费。
- Exp:实验性质,官方没有把它称为正式版多模态模型,说明更强的版本还在后面。
纯文本能力方面,官方说法是「与 V4-Flash 正式版持平」;真正加分的是视觉 agent 场景。在需要视觉理解的 AgentBenchmark 上,它的表现比纯文本 V4-Flash 大幅提升,多模态 agent 能力已接近 Anthropic 的 Opus-4.8。
同期 DeepSeek 还更新了 Files API 与 DeepSeek Harness,让新模型可以直接被 agent 框架调用。也就是说,这次发布不是单一模型更新,而是一次「视觉输入 + 文件存储 + agent 运行时」的组合拳。
为什么值得注意
第一,它把视觉理解的成本打进了 V4-Flash 的价位带。
图片按 384 tokens/张 计费,且沿用 V4-Flash 的 token 单价。对需要处理截图、图表、文档扫描件的 agent 工作流来说,这意味着可以把视觉任务直接塞进主模型,而不必再调用单独的 vision 模型做二次拼接。工程上少了一层路由,成本也少了一道加价。
第二,它瞄准的是 agent,而不是聊天。
DeepSeek 官方放出的示例不是「描述这张图片」,而是「生成商业定制西藏自驾游 PPT」。这种任务需要模型同时理解参考图、版式意图、文字内容,然后调用工具输出结构化结果。配合同步更新的 Harness,它正在把「看懂屏幕」的能力嵌入到 agent 工作流里。
第三,它是国产开源阵营多模态补课的重要信号。
过去半年,DeepSeek 在文本推理、编程、长上下文上节奏极快,但视觉和多模态一直是相对短板。Qwen、GLM 已经发布过多模态版本,Kimi 也在长上下文 + 视觉上发力。DeepSeek 此次先把视觉能力放进 Flash 实验版,既是对市场需求的快速响应,也暗示后续 Pro 级多模态模型已经在路上。
实验版里的「实验」是什么意思
官方没有讳言这是实验模型,几个限制需要正视:
- 没有独立第三方基准验证:目前看到的 ALE、ZeroBench、Chartography 分数多来自官方或早期测评,还需要更多社区复测。
- 只增加图像输入,输出仍是文本:没有语音、没有视频生成,能力边界很清晰。
- 长期稳定性待观察:实验版模型在未来几周可能被迭代或替换,不适合直接绑定到生产核心路径。
Writingmate 的测评给了一个务实的结论:它是目前测试过的「带 1M 上下文的最便宜视觉模型」,但「experimental」这个标签在某些截图、图表、扫描件上确实能感知到。换句话说,性价比极高,但不要把它当成全能视觉模型。
对开发者的实际影响
如果你已经在用 DeepSeek V4-Flash 做 agent,现在可以:
- 把截图、UI、图表直接传进同一次请求,减少「vision 模型提取 → text 模型推理」的串联。
- 用 Files API 上传图片后多次引用,适合长文档、设计稿、监控截图这类持续对话场景。
- 在 DeepSeek Harness 里把视觉模型作为工具链的一环,配合 rc.8 新增的多模态支持跑端到端任务。
但要注意,视觉 token 虽然单价不变,但单张 384 tokens 的计费上限在长会话里会积少成多。对高频视觉 agent,仍然需要控制每轮传入的图片数量和分辨率。
一点判断
DeepSeek-V4-Flash-Vision-Exp 不像 V4-Pro 或 Harness 开源那样是 headline 级发布,但它补上了 DeepSeek 产品矩阵里最关键的一块短板。当 agent 开始需要「看懂界面、读图表、审设计稿」时,一个足够便宜、足够长上下文、原生接入 agent 框架的视觉模型,价值可能比一个更强的纯文本模型更直接。
真正的看点在于:如果实验版已经逼近 Opus-4.8 的多模态 agent 水平,那正式版会是什么水平?
参考来源
- DeepSeek API 平台更新公告(2026-08-21)
- 百度百科:DeepSeek-V4-Flash-Vision-Exp
- The Next Gen Tech Insider: DeepSeek Launches Experimental Multimodal Vision Model for V4-Flash Series
- 澎湃新闻:DeepSeek开启多模态API服务
- Writingmate: DeepSeek V4 Flash Vision Exp Is on Writingmate: Testing Image Understanding on a 1M-Token Model
- 网易:AI周报阿里预计AI算力投入三年内回本;OpenAI计划2027年上市(2026-08-23)

评论(0)
暂无评论,来抢沙发~
请 登录 后发表评论