770B 开源 + 1M 上下文:腾讯混元 Hy4 preview 把「国产旗舰」的天花板抬到了下一档

770B 开源 + 1M 上下文:腾讯混元 Hy4 preview 把「国产旗舰」的天花板抬到了下一档

Author: tengdy | Create: 2026-08-30 08:12:18 | Update: 2026-08-30 08:12:23 | 分类:大模型

MoE开源大模型

2026 年 8 月 29 日,腾讯混元发布新一代旗舰模型 Hy4 preview——总参数 770B、激活 49B、上下文长度 1M,MIT 协议开源,腾讯云 TokenHub 与 OpenRouter 同步上线。这是国产大模型阵营第一次出现"参数规模、上下文长度、可商用开源"三项同时顶配的旗舰。

它和一周前我们写过的 Qwen3.8-Flash、GLM-5.3-Flash 不在一个量级上。Flash 是效率线,Hy4 preview 是旗舰线。这篇文章想拆开看三件事:Hy4 preview 究竟发布了什么为什么是现在这个时间点对开发者和国产模型竞争格局意味着什么

一、Hy4 preview 是什么:770B / 49B / 1M 三项同时顶配

腾讯混元这次给得很直接:

  • 总参 770B、激活 49B:典型的 MoE 架构,激活比例约 6.4%。这个激活量已经接近一份"中小尺寸稠密旗舰"的全部参数量,但放在 770B 总容量下意味着每个 token 真正吃到的容量被压得很稀薄——典型的高稀疏 MoE 路线。
  • 上下文长度 1M:原生 1M,不是 YaRN 后期拉伸。这一点和 Qwen3.8-Flash-Next 的"原生 262K,YaRN 可扩到 1M"不同——Hy4 preview 直接给到原生 1M。
  • MIT 协议:开源,商用。这意味着它和 GLM-5.3-Flash、Qwen3.8-Flash-Next 一起,加入了"国产旗舰开源可商用"的第一梯队。

发布渠道上,腾讯云 TokenHub 和 OpenRouter 同步上线。OpenRouter 上线意味着海外开发者第一天就能调用,而不需要等国内镜像——这一点在过去 GLM、Qwen 的旗舰发布里很少见。

二、和 #112 的对话:Qwen3.8-Flash / GLM-5.3-Flash 是效率线,Hy4 preview 是旗舰线

一周前我们写过《同晚双发:Qwen3.8-Flash 与 GLM-5.3-Flash,国产开源模型的「效率战争」》。当时两个 Flash 模型的体量是:

  • Qwen3.8-Flash-Next:125B / 激活 6B,原生 262K 上下文
  • GLM-5.3-Flash:320B / 激活 18B,1M 上下文

Hy4 preview 在三个维度都把它们拉开了:总参是 GLM-5.3-Flash 的 2.4 倍、是 Qwen3.8-Flash 的 6.2 倍;激活参数是 GLM-5.3-Flash 的 2.7 倍、是 Qwen3.8-Flash 的 8.2 倍;上下文同样都是 1M,但 Hy4 preview 是原生,GLM-5.3-Flash 标注的也是原生 1M

所以这三款放在一起看,定位不是竞争,而是分层:Flash 系列用极低激活成本提供高密度上下文能力,Hy4 preview 用旗舰容量提供最大保留能力。一个走"小模型+长上下文"的性价比路线,一个走"大模型+长上下文"的能力天花板路线。

国产开源旗舰的天花板,在过去两周被连抬了三次:8/27 Qwen3.8-Flash-Next、8/27 GLM-5.3-Flash、8/28 GLM-5.3 旗舰权重、8/29 Hy4 preview。这不是某一家在冲刺,是整个国产开源阵营在用"参数+上下文+开源协议"三件套同时卷起来。

三、长上下文 1M 真正改变的是什么场景

1M 上下文这件事,过去一年被宣传得太久,真正落地时最容易被问的是:到底哪些场景吃到了红利?

把场景打开,真正能把 1M 上下文当默认值用的其实只有三类:

  1. 跨长文档/全代码库推理。一个 50 万行的中等代码库,假设平均每行 30 token,大致在 1500 万 token 量级,即便只做摘要输入也吃不下。但单仓 PR review、模块级重构、长链路问题定位这种工作,1M 已经够把整个上下文堆栈一次性塞给模型。
  2. 多轮 Agent 长链路任务。Agent 工作流一旦跑过几十步,历史 token 累计会很快突破 200K。1M 上下文让"不主动摘要压缩"成为可能,直接换来了更长的稳定执行链路。
  3. 企业级 RAG / 全量知识库问答。当企业把内部 Wiki、历史工单、产品手册一次性塞进去做"对话式检索",1M 上下文的边际收益最明显——不需要再做 chunking 和滑动窗口,可以做整段级别的语义检索。

Hy4 preview 把 1M 作为"默认假设"直接开源,对这三类场景的开发者来说,等于把"要不要做摘要、要不要做 chunk 拼接"的工程成本直接省了。

四、国产旗舰开源竞争的三个观察

把 8/27–8/29 这一波国产旗舰开源放到一起看,有三个观察值得记下来:

第一,开源协议正在"卷回 MIT"。Qwen3.8-Flash-Next 是 Apache、GLM-5.3-Flash 是 MIT、Hy4 preview 是 MIT。海外厂商里 Anthropic Sonnet 5 即将在 8/31 提价、OpenAI 的 GPT-5.4 mini 即将从 Codex 下架、deepseek-chat 10/24 弃用。在"前沿权重"和"可下载"成为两件事的当下,国产开源阵营反而把"MIT + 商用 + 高质量"做成了标准动作,这是过去 12 个月里最大的方向变化。

第二,激活参数比正在被压到 5–8% 的区间。Qwen3.8-Flash-Next 是 4.8%、GLM-5.3-Flash 是 5.6%、Hy4 preview 是 6.4%。三家都收敛在"激活比 5–6%"附近,意味着这套 MoE 工程范式已经被国产团队吃透,下一个变量不再是"能不能压到更低",而是"低激活下的能力保持率"。

第三,OpenRouter 同步上线正在变成"出海第一站"。GLM-5.3-Flash 在 OpenRouter 上以 Ox Alpha 代号跑了相当长时间才被认领,Hy4 preview 第一天就同步上线。这意味着国产旗舰开源的策略,从"先做国内再说",转成了"OpenRouter 第一天就要被全球开发者用上"。

五、对开发者的实际意义

如果你今天在做 Agent / RAG / 长文档类应用,Hy4 preview 给了三个具体选项:

  • 在意成本:Qwen3.8-Flash-Next 每百万 token 输入 ¥1 / 输出 ¥3,激活 6B,适合 90% 的常规任务。
  • 在意多模态 + 中等体量:GLM-5.3-Flash 320B / 18B,AA 综合智能指数 57 与 Claude Opus 4.8 持平,适合需要原生多模态的工作流。
  • 在意 1M 上下文 + 旗舰容量:Hy4 preview 770B / 49B,适合长链路 Agent、全代码库 PR、长历史 RAG 这类需要"不主动压缩"的应用。

Hy4 preview 的真实表现还要等社区跑分,但它至少把"国产开源旗舰的天花板"这件事的物理参数,从 320B 抬到了 770B,从原生 262K 抬到了原生 1M。三周前我们还在说"国产开源模型进入效率战争",这一周已经变成"国产旗舰的开源竞赛"。

参考来源

  • AI HOT 8/29 资讯速递:https://aihot.virxact.com
  • 智东西:Qwen3.8-Flash-Next 开源:https://www.zhidx.com
  • 阿里通义千问 Qwen3.8-Flash-Next 开源公告
  • 智谱 Z.ai GLM-5.3-Flash 开源公告
  • 腾讯混元 Hy4 preview 开源公告(微信公众号:腾讯混元)
  • Big-AGI Changelog(2026-08-30):https://big-agi.com/changes

评论(0)

暂无评论,来抢沙发~


关于本站 · RSS

浙ICP备2025156991号浙公网安备33010802013816号 浙公网安备33010802013816号 © 2026 智能体工场 - [从善如登] All rights reserved.