阶跃星辰 Step 5 Preview:600B 稀疏 MoE,把旗舰智能成本打到 Opus 5 的八分之一

阶跃星辰 Step 5 Preview:600B 稀疏 MoE,把旗舰智能成本打到 Opus 5 的八分之一

Author: tengdy | Create: 2026-09-21 09:23:56 | Update: 2026-09-21 09:23:56 | 分类:大模型

Claude Opus 5阶跃星辰Step 5帕累托前沿MoE开源

title: "阶跃星辰 Step 5 Preview:600B 稀疏 MoE,把旗舰智能成本打到 Opus 5 的八分之一" slug: stepfun-step5-preview-600b-moe-1-8-opus5-cost date: 2026-09-21 category: 大模型 tags: 阶跃星辰,Step 5,MoE,Claude Opus 5,帕累托前沿,开源 summary: 9 月 20 日上海阶跃星辰发布 Step 5 Preview:6000 亿总参数、每次激活 270 亿、100 万 token 上下文,原生支持文本与视觉。Artificial Analysis 智能指数 44 分,单任务成本约 0.71 美元,仅为 Claude Opus 5 的 1/8。10 月 15 日全面开源。


阶跃星辰 Step 5 Preview:600B 稀疏 MoE,把旗舰智能成本打到 Opus 5 的八分之一

9 月 20 日,上海阶跃星辰正式发布新一代旗舰基座模型 Step 5 Preview——这家从 Step 1 一路推到 Step 5 都没有缺席的国产玩家,这次直接把旗舰智能的「帕累托边界」往外推了一格:综合智能指数 44 分(全球开源前三),单任务成本约 0.71 美元,官方测算 仅为 Claude Opus 5 的八分之一。即日起 API 与 Studio 全面开放,10 月 15 日 完整权重开源。

一、参数与定价:把「主力档」的位置抢下来

Step 5 Preview 采用稀疏 MoE(Mixture-of-Experts)架构:

  • 总参数量 6000 亿
  • 每个 token 实际激活 约 270 亿(约总参数的 4.5%)
  • 上下文窗口 100 万 token
  • 原生支持 文本 + 视觉输入
  • 重点场景——AI 编程、金融、专业知识工作、超长任务链

API 价格(国内市场口径):输入 7 元 / 百万 token,输出 20 元 / 百万 token;海外口径 1 美元 / 2.7 美元 每百万 token,输出速度约每秒 100 个 token。

把价格和能力画到同一张图上时,「帕累托前沿」就清晰可见——越往左上角靠,说明越「便宜又能干」。Claude Opus 5 的最高推理档位综合智能指数 51 分、单任务成本约 5.86 美元;Step 5 Preview 是 44 分 / 0.71 美元。两款模型相差 7 分,成本却差了 8 倍以上。

「主力工作模型」这个定位,是阶跃想抢占的关键位置。旗舰模型真正的胜负已经不在「榜单能不能拿最高分」,而在「企业能不能高频调用得起」。少数高难度任务继续交给闭源旗舰,大量日常编码、文档处理、数据分析任务,则需要一款能力足够、成本可控、能 7×24 跑下去的主力模型。Step 5 Preview 瞄准的正是后者。

二、榜单:用「主力档」标准看 Step 5 Preview 的真实表现

在几项关键评测里,Step 5 Preview 跑出了「开源模型第一梯队 + 闭源旗舰二档」的均衡表现:

  • AA综合智能指数(Artificial Analysis Intelligence Index):44 分,全球开源前三,与 Kimi K3 Max 持平。
  • DeepSWE v1.1(软件工程评测):67.7 分,仅次于 GPT-6 Astra 与 Claude Opus 5,领先 Kimi K3、GLM-5.3 等开源模型。
  • StepCodeBench(自研,覆盖 553 个真实代码仓库、33 种编程语言):49.0% avg@4,中低难度真实工程任务上接近 Claude Opus 5。
  • FrontierFinance(覆盖 6 类投资场景、220 道专家题):66.4 分,领先 GPT-6 Astra 与同档 Kimi K3 Max、DeepSeek V4.1 Flash。
  • DRACO(跨领域深度研究)、ALE-CLI(智能体命令行):均仅次于两大闭源旗舰,领先其他参评开源模型。

更值得工程团队注意的是它在「持续根据反馈改作业」上的真实表现:

  • 给它 24 小时持续优化一个 GPU Kernel,约 22 小时后跑到 508 TFLOPS,是该对比里的最高结果。
  • 另一项后训练实验,把 Qwen3-30B-A3B 在 AIME24 上的准确率从 53.3% 提到 60%——这种「能把别家的模型继续往上推一档」的能力,正是企业把旗舰档作为基础研究底座时最在意的特性。

三、金融场景:超长任务链的「试金石」

阶跃在训练 Step 5 Preview 时,把金融列为重点验证场景。这背后是金融场景对旗舰模型最严苛的三项要求:

  • 超长上下文:财报、研报、监管文件、交易记录常常跨越数十万 token。
  • 超长任务链:从检索实时金融信息 → 转化为可复现的估值 → 产出完整研究报告,是典型的多步 Agent 工作流。
  • 工具调用与可验证性:每一步都要有可追溯的数据来源,否则不能上投研一线。

FrontierFinance 测评结果显示,阶跃 Step 5 Preview 得分 66.4,领先 GPT-6 Astra 及其他参评开源模型,位列全球第二。围绕「公司研究」这一高难度金融工作流,阶跃自建了三项内部评测,分别考察模型「检索核验实时金融信息、把数据和假设转化为可复现的估值、产出完整研究报告的能力」——在三项金融基准上均取得开源模型中的领先成绩。

这意味着旗舰基座模型的能力,已经从「能不能答得漂亮」演进到「能不能连续跑完一个真实金融研究流」。Step 5 Preview 的出现,让旗舰智能第一次以主力档的价位进入企业可以日常调用的区间。

四、为什么这不只是一家国产厂商的事

Step 5 Preview 的发布时点,正赶上「基模决战周」:

  • 海外:Anthropic 拟 IPO 前推新模型反击 GPT-6 Astra;Opus 5.2 / Fable 5.2 灰测信号不断;Gemini 4 Pro 疑似披马甲摸底;Grok 也有新动作。
  • 国内:Kimi 拿着 K3.1 反复打哑谜;DeepSeek 下一张 Pro 牌已写进官方文档;Qwen4 亮出新架构;GLM-5.3、MiniMax M2.5 持续在 OpenRouter 上刷榜。

这场决战的评判标准已经变了——不再是「榜单能不能拿最高分」,而是「同样成本下谁更聪明、同样智能下谁更便宜」。阶跃 Step 5 Preview 用「6000 亿参数 / 激活 270 亿 / 单任务成本 1/8 Opus 5」给出了第一份答案。

10 月 15 日开源之后,企业可以在自有算力上完整复现这份性价比,把它真正接进生产 Agent 链路——届时旗舰智能的「主力档」位置才算彻底坐稳。

结语

旗舰模型的「主力档」位置第一次有了清晰的国产坐标。Step 5 Preview 让我们看到一个新的工作流范式正在成型:闭源旗舰负责最难 5% 的高难度任务,开源主力档负责剩下 95% 的日常 Agent 工作流。这不只是阶跃的故事,是整个旗舰基座市场重新定价的开始。

评论(0)

暂无评论,来抢沙发~


关于本站 · RSS

浙ICP备2025156991号浙公网安备33010802013816号 浙公网安备33010802013816号 © 2026 智能体工场 - [从善如登] All rights reserved.