五个方向扫一圈,这一周的关键词是「落地」:模型卷完参数卷眼睛,框架卷完功能卷架构,企业卷完试点卷全员。
一、大模型:DeepSeek 上线视觉理解模型,多模态 Agent 能力逼近 Opus-4.8
8 月 21 日,DeepSeek 在 API 平台上线了实验性视觉理解模型 DeepSeek-V4-Flash-Vision-Exp。
几个值得注意的点:
- 文本能力不掉队:官方口径是纯文本任务(Agent、推理、世界知识)与 V4-Flash 正式版持平,视觉理解类 Agent 基准测试则明显跃升,官方称已接近 Opus-4.8 的水平。
- 计费很克制:图片转 token 计费,单张图片最多占 384 tokens,价格与 V4-Flash 完全一致。对比某些模型一张图动辄上千 token 的计费方式,这个定价对多模态 Agent 场景相当友好。
- 配套的 Files API 同步上线且免费:先上传图片拿 file_id,后续请求直接引用,不用反复传 base64——做 Agent 的工作流会舒服很多。
- 调用格式兼容:Chat Completions、Messages、Responses 三种格式都支持,图片可走 base64、外部 URL 或 Files API。
官方演示的场景也很有针对性:在 Agent 框架里生成商业定制 PPT、对网站做多轮交互式二次创作、写带动态特效的前端 Demo——全是「看图干活」而非「看图说话」。
当然要泼一点冷水:官方自己承认测试中用了 DeepSeek Harness 极简模式、max 档位的特定参数,而且 V4-Flash 在部分基准里会忽略多模态元素,两代模型的视觉对比并非完全同口径。实验版就是实验版,生产环境建议再观察。
二、Harness:DeepSeek Harness 一周三更,0.1.1 版支持多模态
同一个发布周期里,DeepSeek Harness 的迭代速度更值得关注。
自开发者预览版 v0.1.0-rc.6 首发以来,一周内连续完成三次更新:rc.7、rc.8,以及 8 月 21 日发布的 v0.1.1-rc.1。更新主线非常清晰:
- 多模态:模型适配器新增 V4-Flash-Vision-Exp 选项,支持配置原生图片请求;
- 子代理协作:多 Agent 编排能力增强;
- 跨平台兼容与日常体验打磨。
模型和框架同一天双双更新,这个节奏说明 DeepSeek 是把「多模态 Agent」当成一个整体产品在推进,而不是各做各的。本周关于 Harness 的深度拆解我会单独写一篇,这里先按下不表。
三、MCP:无状态规范持续发酵,生态迎来「npm 时刻」
MCP 在 7 月底发布的 2026-07-28 规范(砍掉 initialize 握手、废除 Mcp-Session-Id、协议核心全面无状态化)过去快一个月了,社区讨论热度反而越来越高。
本周值得关注的两个信号:
- 规模:MCP 月下载量已突破 9700 万,各家安全厂商开始推出专门的 MCP 安全工具——一个协议从「开发者便利」变成「需要安全评审的生产基础设施」,这是质的转变。
- 生态分层:围绕 MCP 的开源栈正在固化为三层——网关层(统一鉴权、审计、策略)、注册表层(像装 npm 包一样装 MCP server)、垂直 server 层。另一个有意思的动向是 Cloudflare 推出了面向 AI Agent 而非人类设计的浏览器 Kitesurf——当浏览器开始为 Agent 而生,说明大家真的相信未来有一大块流量是 Agent 发起的。
对我们这种自己写 MCP server 的人来说,无状态化的直接影响是:远程 server 从此可以随便挂负载均衡、随便滚动部署,不用再管会话粘滞。代价是断流不重传、重试和幂等变成你自己的问题。架构上更干净,工程上要多写代码。
四、RAG:亚马逊论文说「关键词搜索就够了」,向量数据库慌不慌?
AAAI 2026 上一篇来自 Amazon Science 的论文标题很挑衅:《Keyword Search Is All You Need》。
结论是:给 LLM Agent 一个普通的关键词搜索工具(没有向量库、没有 ANN 索引),靠 Agent 自己决定搜什么、要不要再搜一次,忠实度得分能达到传统 RAG 管线的 94.5%。
这背后的逻辑其实和 Agent 化的大趋势一致:过去检索质量靠的是「一把定胜负」的向量索引精度,现在模型能多轮迭代、自我修正,粗糙的检索机制可以被推理循环弥补。检索质量的来源正在从「嵌入空间有多好」转移到「搜索策略有多聪明」。
当然向量库没有死刑——查询和文档词汇差异大、跨语言、延迟预算紧的场景,一次 ANN 查询还是比四五轮循环调用快得多。但对正在立项 RAG 系统的团队,这篇文章至少推翻了一个默认假设:向量数据库不再是第一周就必须做的决定。
五、行业应用:Agent 的账,开始有人算得清了
行业侧这周有两个真实得少见的样本:
蒙牛 × WorkBuddy:全员 AI 应用大赛跑出来的数字——小象超市订单处理从 3 小时缩到 15 分钟;电商出图提速 25-35 倍;奶牛疾病诊疗响应从 1.5 天缩到 2 小时;城市经理约 80% 的事务性时间被释放。乳企这种重线下、重供应链的实体企业能跑出这种数字,「办公智能体」才算真正接了地气。
重庆钢铁:一线业务人员(不是 IT 部门)自主开发了 54 个智能体,超额完成年初计划的 46%。公文格式审查从 30 分钟人工降到不到 1 分钟,准确率从 85% 提到 99.8%。最值得注意的是开发者的身份——业务人员白天钻研痛点、晚上打磨提示词,「人人都是智能体开发者」在这家钢厂已经发生了。
这两家加起来传递的信号一致:Agent 落地不必从核心产线开刀,从办公、审核、台账这些「非生产环节」切入,一样能快速见效。
一句话总结
模型在长眼睛,框架在换底座,协议在去状态,RAG 在被重估,企业开始算清账——五个方向拼在一起,就是同一件事:**这一轮 AI 的重心,正在从「能不能」转向「划不划算」。」
(本周深度稿会拆解 DeepSeek Harness 的「一切皆插件」架构,感兴趣的读者可以蹲一下。)

评论(0)
暂无评论,来抢沙发~
请 登录 后发表评论