总览
2026年9月18日,国内大模型行业迎来多项重磅发布。智谱今日正式上线GLM-5.3-FlashX模型,输出速度提升至200 tokens/s;阿里云百炼平台全面开放,一站式接入智谱、MiniMax、月之暗面等多家厂商模型;据第一财经报道,中国大模型调用量已连续20周超越美国;此外,MiniMax M3以永久五折策略主打性价比,Kimi K3和通义千问Qwen3.8-Max的旗舰参数与定价对比也值得关注。以下是本期最重要的五条动态。
一、智谱GLM-5.3-FlashX正式上线,200 tokens/s速度再升级
发布方: 智谱AI
时间: 2026年9月18日
核心亮点
9月18日午间,智谱在官方微信正式宣布上线GLM-5.3-FlashX,API同步全面开放。该模型在延续GLM-5.3-Flash智能水平的基础上,将输出速度提升至200 tokens/s,进一步改善使用体验。
关键信息:
- Model Key:GLM-5.3-FlashX
- 上下文窗口:1M tokens
- 输入模态:图片、视频、文件、文本(原生多模态)
- 算力基础:在10万张国产芯片提供的推理算力基础上,进一步加大Infra侧投入与推理优化
- 全球排名:GLM-5.3以45分在AA Index排名第7,是目前排名最高的国产模型
定价对比
| 模型名称 | 上下文 | 输入单价(元/百万Tokens) | 输出单价(元/百万Tokens) | 缓存存储(元/百万Tokens/小时) | 缓存命中(元/百万Tokens) |
|---|---|---|---|---|---|
| GLM-5.3 | 1M | 8 | 28 | 限时免费 | 2 |
| GLM-5.3-Flash | 1M | 0.8 | 2.8 | 限时免费 | 0.23 |
| GLM-5.3-FlashX | 1M | 2 | 7 | 限时免费 | 0.57 |
影响与意义
GLM-5.3-FlashX定位为Flash系列的"高速版",在智能水平不变的前提下以更高价格换取2.5倍以上的输出速度(对比Flash的约80 tokens/s)。这体现了智谱在"智能、价格、速度"三角竞争中的策略选择——通过分层定价满足不同场景需求。同时,10万张国产芯片的算力基础和持续Infra优化也展示了智谱在国产化算力方面的长期投入。
二、阿里云百炼平台全面开放,多模型一站式接入
发布方: 阿里云
时间: 2026年9月
核心亮点
在2026阿里云峰会上,阿里云宣布百炼平台全面开放,已与月之暗面、MiniMax、智谱、阶跃星辰、零一万物、生数科技等达成合作,支持一站式接入多家厂商的大模型。
百炼平台当前支持的核心模型包括:
- 通义千问系列:Qwen3.8-Max(旗舰)、Qwen3.8-Flash、Qwen3.8-2.4T-A95B(开源版)
- 第三方模型:Kimi K2.5/K3、GLM-5.2/5.3、MiniMax-M3、DeepSeek-V4-Pro-0813等
- 多模态模型:Pixverse-v6-it2v、Kling-v3-omni-video-generation、Vidu Q3等
此外,百炼平台于9月16日更新了Anthropic兼容API,开发者只需修改配置即可将原有Anthropic应用迁移至百炼平台,支持华北2(北京)、新加坡、中国香港地域的专属域名。
优惠活动
- Qwen3.8-Flash免费:在Qoder桌面端,10月前Qwen3.8-Flash计费系数由0.1×降至0.0×,每次调用不扣Credits
- 个人版Token Plan:Lite 39元/月、Standard 139元/月、Pro 499元/月
- 新用户福利:开通即送千万Tokens
影响与意义
百炼平台的全面开放标志着阿里云从"自研模型平台"向"多模型聚合平台"转型。开发者可以在一个平台内调用通义千问、Kimi、GLM、MiniMax等多家模型,降低了多模型集成成本。Anthropic兼容API的推出也降低了国际应用迁移门槛,有望吸引更多海外开发者使用国产模型。
三、中国大模型调用量连续20周超越美国
发布方: 第一财经报道
时间: 2026年9月
核心亮点
据第一财经报道,中国大模型调用量已连续20周超越美国,在全球能力榜单中多家国产模型跻身前列。
全球大模型能力排名(AA Index):
| 排名 | 模型 | 厂商 | AA Index得分 | 参数规模 |
|---|---|---|---|---|
| #7 | GLM-5.3 | 智谱AI | 45 | 千亿级 |
| #9 | Kimi K3 | 月之暗面 | 43.8 | 2800B |
| #13 | Qwen3.8 | 阿里通义 | - | 2400B |
| #14 | DeepSeek V4.1 Flash | DeepSeek | - | - |
| #19 | MiniMax M3 | MiniMax | - | 428B |
参数规模对比:
| 模型 | 总参数 | 激活参数 | 架构 |
|---|---|---|---|
| Z.ai K3 | 2800B | - | KDA + Attention Residuals |
| Qwen3.8-Max | 2400B | 95B | 稀疏MoE |
| MiniMax M3 | 428B | - | - |
影响与意义
调用量连续20周超越美国表明中国大模型在实际应用落地方面已取得显著进展。摩根士丹利分析指出,中国大模型的真正优势不在参数规模,而在应用生态和调用成本。GLM-5.3排名第7、与第一名相差8分,说明国产模型在核心能力上正快速缩小与国际前沿的差距。
四、MiniMax M3定价策略:永久五折主打性价比
发布方: MiniMax
时间: 2026年9月
核心亮点
MiniMax M3以"永久五折"策略成为国内最具性价比的旗舰模型之一。
MiniMax M3定价详情:
| 计费项 | 原价 | 折后价(永久五折) | 单位 |
|---|---|---|---|
| 输入 | $1.80 | $0.90 | 每百万Tokens |
| 输出 | $7.20 | $3.60 | 每百万Tokens |
| 缓存读取 | $0.36 | $0.18 | 每百万Tokens |
| 上下文窗口 | - | 512K | tokens |
国内定价(人民币):
| 计费项 | 原价 | 折后价 | 单位 |
|---|---|---|---|
| 输入 | ¥8.40 | ¥4.20 | 每百万Tokens |
| 输出 | ¥33.60 | ¥16.80 | 每百万Tokens |
| 缓存读取 | ¥1.68 | ¥0.84 | 每百万Tokens |
MiniMax还推出了Token Plan订阅套餐:Plus $22/月、Max $55/月、Ultra $132/月,分别支持3-4个、4-5个、6-7个智能体并发使用。
影响与意义
MiniMax M3以428B的参数规模和"永久五折"的定价策略,在性价比维度形成了差异化竞争力。相比Kimi K3的$3/M输入和$15/M输出,MiniMax M3折后价格仅为$0.90/M输入和$3.60/M输出,价格约为Kimi K3的三分之一。这一策略有望吸引对成本敏感的企业客户和开发者群体。
五、Kimi K3与Qwen3.8-Max:旗舰模型的价格与参数对比
发布方: 月之暗面 / 阿里通义
时间: 2026年7-8月
核心亮点
Kimi K3(7月发布): - 参数规模:2800B(全球参数最大) - 上下文窗口:1,048,576 tokens(1M) - 架构:KDA + Attention Residuals,计算效率优化 - 特性:始终开启思考模式,支持长程编程和端到端知识工作 - 定价:
| 计费项 | 价格(人民币) | 价格(美元) | 单位 |
|---|---|---|---|
| 输入(缓存未命中) | ¥20.00 | $3.00 | 每百万Tokens |
| 输入(缓存命中) | ¥2.00 | $0.30 | 每百万Tokens |
| 输出 | ¥100.00 | $15.00 | 每百万Tokens |
Qwen3.8-Max(8月发布): - 参数规模:2400B总参数,95B激活参数(稀疏MoE) - 定价:$2/M输入,$6/M输出 - 开源版本:Qwen3.8-2.4T-A95B,采用稀疏MoE架构 - 特性:在编程和专业协作方面实现综合飞跃
旗舰模型价格横向对比
| 模型 | 输入价格(元/百万Tokens) | 输出价格(元/百万Tokens) | 上下文 | 参数规模 |
|---|---|---|---|---|
| Kimi K3 | 20 | 100 | 1M | 2800B |
| Qwen3.8-Max | ~14 | ~42 | - | 2400B(95B激活) |
| GLM-5.3 | 8 | 28 | 1M | 千亿级 |
| MiniMax M3(折后) | 4.20 | 16.80 | 512K | 428B |
| GLM-5.3-FlashX | 2 | 7 | 1M | - |
| GLM-5.3-Flash | 0.8 | 2.8 | 1M | - |
影响与意义
从价格对比可以看出,国内大模型市场已形成明显的分层格局:Kimi K3和Qwen3.8-Max定位旗舰高端市场,以最大参数和最强能力竞争;GLM-5.3以中等定价覆盖企业主力场景;MiniMax M3和GLM-5.3-Flash/FlashX则主打性价比和速度优势。开发者可根据场景需求在"最强能力"和"最优性价比"之间灵活选择。
趋势总结与展望
从9月18日的国内大模型动态中可以提炼出以下趋势:
- 速度竞争白热化:智谱GLM-5.3-FlashX将输出速度提升至200 tokens/s,表明在智能水平趋同的情况下,推理速度正成为新的核心竞争维度
- 平台聚合加速:阿里云百炼平台全面开放接入多厂商模型,标志着国内大模型分发正从"单模型直连"向"平台化聚合"演进
- 调用量超越美国:中国大模型调用量连续20周超越美国,说明在应用落地和实际使用方面,中国已建立显著优势
- 分层定价成熟:从GLM-5.3-Flash的¥0.8/M到Kimi K3的¥20/M,国内大模型定价已形成覆盖不同需求的分层体系
- 国产算力规模化:智谱10万张国产芯片的推理算力基础,表明国产算力替代正在从概念走向规模化落地
展望未来,随着GLM-5.3-FlashX、Kimi K3和Qwen3.8-Max等模型的持续迭代,以及百炼等聚合平台的推广,国内大模型市场有望在应用规模、模型能力和性价比三个维度继续快速提升。摩根士丹利所指的"中国真正优势不在参数"的判断,正在被调用量数据和价格竞争所验证。
数据来源
- IT之家(m.toutiao.com)智谱GLM-5.3-FlashX报道
- 上海证券报"全球大模型第一股"上新报道
- 阿里云百炼平台官方文档(help.aliyun.com)
- 第一财经"AI调用量连续20周超美国"报道
- 东方财富网中美AI竞速赛报道
- MiniMax开放平台文档(platform.minimax.io)
- Kimi K3官方定价页(kimi.com/resources/kimi-k3-pricing)
- 阿里云Model Studio(modelstudio.alibabacloud.com)
- GMT EIGHT Alibaba Cloud Summit报道
本文由AI辅助撰写,数据截至2026年9月18日,如有遗漏或误差敬请指正。

评论(0)
暂无评论,来抢沙发~
请 登录 后发表评论