Google Gemini 3.8 Flash 双版本齐发:从"写代码"转向"长周期自主 Agent"
2026 年 9 月 3 日 · 分类:大模型
事件概述
9 月 2 日,Google 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber 两款新模型。距上一代 3.7 Flash 发布仅三周,这是谷歌六周内第三次发布 Flash 模型,也是不到四个月内第四款 Flash。
官方定义 Gemini 3.8 为"迄今最强的推理和编程模型"。但核心升级不是跑分——是从"单次代码生成"转向"长周期软件工程和自主智能体"。
两个版本,两种定位
Gemini 3.8 Flash:面向长周期编程、智能体工作流和复杂推理。在 DeepSWE v1.1 长周期软件工程测试中,能自主解决端到端复杂工程问题,表现超过多数规模更大的前沿模型。在金融、法律等专业领域的智能体测试(HLE-Verified)中得分 54.9%。
Gemini 3.8 Flash Cyber:面向网络安全场景。Chrome 安全团队发现其生成的正确补丁数量是规模更大商业模型的 2.6 倍。配合 Fairwind 计划,650+ 家政府和关键基础设施机构获得优先访问。
两款模型共享同一基座,仅通过安全防护等级做区隔——和 Anthropic 的 Fable/Mythos 双版本策略如出一辙。
定价策略
3.8 Flash 引导价与 3.7 Flash 持平:每百万输入 token 0.75 美元、每百万输出 token 3.75 美元,优惠持续至年底。
Artificial Analysis 评测显示,3.8 Flash 高推理档在综合智能指数中获得 59 分,较 3.7 Flash 提高 3 分,以每项任务约 0.58 美元的成本进入"智能程度—任务成本"性价比前沿。
核心变化:Agent 循环
谷歌强调,3.8 Flash 通过长时间运行的智能体循环,不断评估和优化任务执行结果。这不是"给你一段代码"的能力提升,而是"自己拆解任务、执行、验证、修正、再执行"的完整闭环能力。
这与 Anthropic Fable 5.1 的 38 小时无人值守叙事呼应——头部厂商的产品叙事正在从"问答能力"集体转向"任务完成能力"。
值得关注的原因
-
Agent 工作流范式转移:从"模型生成代码 → 人类验证"到"模型自主完成端到端工程任务",这改变了开发者和企业使用 AI 的方式。DeepSWE 测试本身就是为此设计的。
-
网安专用模型的新品类:Flash Cyber 证明安全场景已足够重要到需要独立 SKU。对 AI 安全 agent 和自动化漏洞修复领域,这是一个新的基础设施层。
-
同基座分层商业化:Google 和 Anthropic 不约而同选择"同一基座 + 不同安全等级"的双版本策略,说明大模型分层商业化已成行业共识。
-
迭代速度加快:六周三发、四个月四款——Google 的模型迭代节奏已经进入"流水线"模式。对开发者来说,版本锁定策略比以往任何时候都重要。
本文为每日 AI 动态跟踪,关注 AI work 方向的重要事件与趋势。

评论(0)
暂无评论,来抢沙发~
请 登录 后发表评论