一个涨价一个上全模态:9 月 18 日国产模型双发,效率战争打出第二幕

一个涨价一个上全模态:9 月 18 日国产模型双发,效率战争打出第二幕

Author: tengdy | Create: 2026-09-19 17:04:17 | Update: 2026-09-19 17:04:25 | 分类:大模型

GLM-5.3-FlashXQwen3.8-Omni智谱通义千问推理效率模型定价全模态

9 月 18 日,国产大模型赛道在同一天放了两颗信号弹:智谱发布 GLM-5.3-FlashX,推理速度最高 200 tokens/s、较现有 GLM-5.3-Flash 提升 5 倍——同时把定价上调到原版本的 2.5 倍;阿里千问则上线新一代原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频、视频输入,具备 1M 长上下文。

一个月前,这两个名字还在同一张价格战牌桌上互相压价。现在,一个开始涨价,一个开始补全模态。这比降价本身更值得琢磨。

FlashX:一笔反常的账

先看 FlashX 这笔账的反常之处。过去一年国产模型发布会的关键词几乎都是「降价」:8 月 26 日,Qwen3.8-Flash 把训练成本较前代压降近 90%,推理定价低到每百万 tokens 输入 0.8 元、输出 2.7 元;同一天智谱的 GLM-5.3-Flash 以匿名模型身份在 OpenRouter 测试,靠 62T 的调用量登顶双平台历史纪录。当时的逻辑很朴素:低价换规模,规模摊薄成本。

FlashX 的操作恰好相反:不降价,反而把价格提到原版 2.5 倍,交换条件是 5 倍的推理速度。这不是促销,是在向市场测试「速度溢价」——同样的智能水平,愿意为响应速度付多少钱。

智谱给出的底气数据是:由 10 万张国产芯片组成的推理集群「上线即被用户用满」。这句话的信息量比涨价本身更大——它说明需求结构变了。对话式问答的调用量撑不满十万卡,能持续吃满推理集群的是 Agent 式的长任务调用:多轮、密集、对延迟敏感。当买家从「偶尔问一句的人」变成「不停干活的 Agent」,tokens/s 就从体验参数变成了计费单位,速度贵一点,总账反而更划算(任务更早完成,等待时间更短)。

资本市场也在为这个逻辑投票:FlashX 发布当天,港股「大模型第一股」智谱股价一度涨超 5%。

Omni-Flash:把「全能」打成 Flash 的标配

阿里同日上线的 Qwen3.8-Omni-Flash 是另一条战线的推进。它的核心配置——四模态输入加 1M 上下文——放在一年前是旗舰模型的专属卖点,现在被压进了 Flash(轻量快速)系列。

更值得注意的是官方对它的定位描述:推动全模态模型「从理解内容走向规划任务、调用工具并完成创作」。这句话翻译过来就是:全模态不再只是个「看得懂视频」的展示型能力,而是要当 Agent 的大脑用——接收多模态输入、理解任务、拆解并调用工具执行。

结合 DeepSeek V4.1-Flash、GLM-5.3-Flash 的节奏看,国产模型的型号矩阵已经完整复刻了国际生态的打法:旗舰拼智能上限,Flash 拼效率和价格,Omni 补全模态位。用户按场景选型号,而不是按「谁最强」选唯一答案。

第二幕的三个信号

把 8 月底的第一幕和 9 月 18 日的第二幕连起来看,有三个信号值得记下:

一、tokens/s 成了新的定价锚。 第一幕拼的是「每百万 tokens 多少钱」,第二幕开始拼「每秒吐多少 tokens」。当智能水平趋同,推理速度、响应体验和单位成本取代参数规模,成为模型商业竞争力的核心标尺。

二、需求侧从对话转向任务。 十万卡集群上线即满,指向的是 Agent 长任务的持续调用。推理基础设施的扩容逻辑正在从「为峰值对话准备」转向「为常驻 Agent 供给」——这也解释了为什么「算力扩容」和「提价」同时发生:不是产能过剩的促销,是产能吃满后的分层。

三、全模态与工具调用成为 Flash 系列标配。 当轻量模型也带 1M 上下文、四模态输入和工具调用能力,端侧和成本敏感场景的 Agent 门槛被进一步拉低。下游的智能体应用开发者是直接受益方。

结语

需要保留一分清醒的是:速度溢价能否持续,取决于 FlashX 的速度优势能保持多久——竞品复刻 200 tokens/s 大概率只是时间问题,届时溢价窗口就会收窄。但方向本身已经清晰:国产模型的竞争从「把价格打下来」进入「把效率卖上去」的第二阶段。第一幕比的是谁便宜,第二幕比的是谁在同样的智能水平下,把每个 tokens 的交付速度和成本做到极致。

这一幕才刚开始,但它比价格战好看多了。

参考来源

  • 证券时报(今日头条转载):《"大模型第一股",股价大涨!宣布新版本涨价》(2026-09-18,GLM-5.3-FlashX 发布、10 万张国产芯片集群、8/26 双发背景)— https://www.toutiao.com/article/7686770269519675956
  • 腾讯新闻:《智谱、阿里同日发布 AI 新模型》(2026-09-18,Qwen3.8-Omni-Flash 定位与配置)— https://news.qq.com/rain/a/20260918A06TRV00
  • 稀土掘金:《2026 年 9 月 18 日 AI 重要新闻》(Qwen 3.8 Omni 发布观察)— https://juejin.cn/post/7686529021816340520
  • 新浪财经:国元证券《人工智能行业半月报》(2026-09-18,OpenRouter 周调用量与国产模型智能水平数据)— https://stock.finance.sina.com.cn/stock/go.php/vReport_Show/kind/lastest/rptid/843102444993/index.phtml

评论(0)

暂无评论,来抢沙发~


关于本站 · RSS

浙ICP备2025156991号浙公网安备33010802013816号 浙公网安备33010802013816号 © 2026 智能体工场 - [从善如登] All rights reserved.