国内大模型动态周报:三天三家旗舰齐发,Flash路线重塑价格底线
2026年8月29日 | 国内大模型行业动态日报
本周国内大模型赛道迎来年内最密集迭代窗口:智谱GLM-5.3-Flash、阿里Qwen3.8-Flash、腾讯混元Hy4 preview在三天内密集发布并开源,全部采用MoE稀疏架构主打"高性价比"。国产算力首次大规模承接前沿模型推理,OpenAI被迫跟进降价,中国开源模型下载量首超美国。
一、智谱GLM-5.3-Flash:1/40价格的"牛来"正式现身
8月26日,智谱AI正式上线并开源GLM-5.3-Flash(320B-A18B),并确认其正是此前在海外平台匿名登顶的神秘模型"Ox-Alpha"——中文社区称之"牛来"。
技术规格: - 总参数320B,单Token激活仅18B - 采用稀疏注意力+线性注意力混合架构 - GLM-5系列首个原生多模态基座 - 上下文窗口1M Token
定价策略:
| 项目 | 价格对比 | 说明 |
|---|---|---|
| GLM-5.3-Flash标准定价 | GLM-5.3的1/10 | 常规价格 |
| 限时折扣价 | GLM-5.3的1/20 | 限时优惠 |
| 对标国际 | Claude Opus 4.8的1/40 | 极致性价比 |
社区表现: 正式发布前以匿名身份在OpenRouter和OpenCode两大海外平台测试,迅速登顶并刷新双平台历史纪录,Token调用量高达62T。8月27日港股收盘,智谱全日收涨12.62%,报1160港元/股。
国产算力突破: GLM-5.3-Flash是国内前沿大模型首次大规模线上流量完全跑在国产算力之上。智谱称通过推理系统改造,硬件效率和单Token成本已达到与主流Nvidia GPU相当水平。
影响与意义: 智谱通过MoE-Flash路线实现了"旗舰能力下探+推理成本数量级下降",同时验证了国产算力承接千亿级MoE模型的可行性,对国内算力自主化具有标志性意义。
二、阿里Qwen3.8-Flash:训练成本骤降90%,发布次日再砍价
8月26日,阿里通义千问正式发布Qwen3.8-Flash并开源权重,作为下一代Qwen4架构的先导预览版。
技术规格: - MoE总参数125B,叠加51B N-gram Embedding记忆库 - 每Token仅激活6B参数参与计算 - 引入GDN与QSA混合注意力机制 - 在高缓存命中的百万Token长上下文场景中可提速8倍以上 - 训练成本较前代Qwen3.7-Plus骤降近90%
定价调整:
| 时间 | 输入价格(元/百万Tokens) | 输出价格(元/百万Tokens) |
|---|---|---|
| 8月26日首发 | 1.0 | 3.0 |
| 8月27日降价后 | 0.8 | 2.7 |
降价后价格最低仅为DeepSeek-V4-Flash的三分之一。百炼平台已于8月27日12时起正式执行新价格。
可用渠道: 千问办公首发上线,开发者可通过百炼平台获取API服务。
影响与意义: Qwen3.8-Flash代表了阿里"以架构创新换成本下降"的技术路线。发布次日即降价,体现了Flash模型基于架构而非补贴的可持续降价逻辑——"过去降价是赔本换流量,现在架构带来成本下降"。
三、腾讯混元Hy4 preview:770B参数开源,递归自我优化
8月28日,腾讯混元发布并开源新一代大语言模型Hy4 preview,距7月6日上代Hy3发布不到两个月。
技术规格: - 总参数770B,激活参数49B - 上下文长度突破1M - 在模型尺寸、上下文长度、数据规模上均较Hy3全面扩展 - 具备递归自我优化能力 - 预训练和后训练共同进步
开源与可用渠道: - Apache 2.0协议开源,HuggingFace、GitHub、ModelScope、GitCode同步放出权重与代码 - 腾讯云TokenHub和OpenRouter上线 - WorkBuddy、CodeBuddy、元宝、ima等产品可体验 - 限免2周至9月10日
影响与意义: 三天之内,智谱、阿里、腾讯三家头部厂商轮番出牌,家家开源、家家喊着性价比,标志着国产大模型进入"闪电战"迭代模式。腾讯的"模型+场景+工程"差异化策略,通过Hy4 preview在开源生态中的快速反馈获得改进信号。
四、国内大模型价格全景:Flash路线重塑竞争逻辑
本周国内三大模型发布后,国内主流模型定价对比如下:
| 模型 | 厂商 | Intelligence Index (AA 8/27) | 上下文 | 参考价 $/1M | 性价比定位 |
|---|---|---|---|---|---|
| Kimi K3 | 月之暗面 | 60 | 1M | $0.84 | 国产并列第一,开源权重#1 |
| GLM-5.3 | 智谱AI | 60 | 1M | $0.68 | 8/14发布,8/19 API上线 |
| GLM-5.3-Flash | 智谱AI | — | 1M | ~$0.034 | GLM-5.3的1/20折扣价 |
| Qwen3.8-Flash | 阿里 | — | — | ~$0.11 | 最低至DeepSeek-V4-Flash的1/3 |
Flash为何成为新方向:
- 稠密模型推理成本天花板难破:千亿稠密模型高并发场景下算力开销吞噬企业AI预算
- 长上下文+多模态+Agent成刚需:单纯小稠密模型难胜任复杂任务,做大稠密模型又陷入算力不可承受的死循环
- MoE-Flash提供折中解法:接近旗舰综合能力,推理成本下降一个数量级,让大规模商用从经济上变得可行
MiniMax CEO闫俊杰在财报会议上表示:"降价和提升毛利率并非矛盾。只要单位Token毛利率仍保持正向并持续改善,规模扩大就会带来更高的绝对毛利。"
五、中国开源模型全球影响力:下载量首超美国,倒逼OpenAI降价
据Hugging Face《2026年春季全球开源AI生态报告》,中国开源模型下载占比已达41%,首次超过美国,累计下载量突破100亿次。
对全球价格体系的影响: - 8月,OpenAI宣布对GPT-5.6 Sol"限时促销",价格下调超20%(输入降20%,输出降33.3%) - 这是OpenAI近一个月内第三轮降价:7月底GPT-5.6 Luna价格已下调80% - 中国AI企业通过开源权重策略快速提升价格竞争力,由此引发的市场价格战正迫使美国企业跟进
国产算力的角色转变: - 智谱GLM-5.3-Flash首次大规模线上流量完全跑在国产算力上 - MoE-Flash通过稀疏激活降低单Token计算压力,让国产芯片有机会承接前沿模型 - 国产算力成熟反过来进一步压低Flash推理成本,形成正向循环
趋势总结与展望
本周国内大模型动态呈现四大趋势:
-
Flash路线全面主流化:智谱、阿里、腾讯三天内集中发布MoE-Flash模型,稀疏激活从"备选方案"变成"主流选择",用更少计算资源做更多事成为行业共识。
-
价格内卷源于技术而非补贴:本轮降价潮的核心驱动力是架构创新(稀疏激活、注意力优化、缓存压缩)带来的可持续成本下降,而非赔本换流量,厂商可在合理毛利区间持续压低报价。
-
国产算力实现前沿模型承载:智谱GLM-5.3-Flash全量跑在国产算力上是标志性事件,打破了国产芯片难以承载千亿级MoE大模型的固有认知。
-
开源策略重塑全球竞争格局:中国开源模型下载量首超美国,41%的全球占比正在倒逼闭源商业API持续降价。中小企业不再完全依赖大厂闭源API,拥有更多选型空间。
下周值得关注:腾讯混元Hy4 preview的真实社区反馈及正式版推进节奏;Qwen3.8-Flash和GLM-5.3-Flash在企业级场景的实际落地表现;国产算力能否持续承接更多前沿MoE模型推理。
数据来源
- 智谱GLM-5.3-Flash:新浪财经(21世纪经济报道)、智谱官方公告
- 阿里Qwen3.8-Flash:36氪、每日经济新闻、新浪财经
- 腾讯混元Hy4 preview:科技日报、IT之家、人民网、华城网
- 价格对比数据:清霜之晨博客国内大模型Benchmarks与定价调研报告、Artificial Analysis
- 开源生态报告:Hugging Face 2026年春季全球开源AI生态报告
- MiniMax CEO发言:闫俊杰财报会议发言

评论(0)
暂无评论,来抢沙发~
请 登录 后发表评论