阶跃星辰 600B MoE 旗舰 Step 5 Preview 上线 22 小时 GPU Kernel 优化到 508 TFLOPS

阶跃星辰 9 月 21 日推出新一代旗舰模型 Step 5 Preview,600B 总参数的稀疏 MoE 架构,每 Token 激活约 27B,上下文窗口最高 100 万 Token,原生支持文本与视觉输入。这次定位的关键不在单轮问答,而在长周期 Agent 任务,能持续理解上下文、调用工具、读取执行反馈、在复杂任务链里推进。第三方 Artificial Analysis Intelligence Index 上拿到 44 分。

架构与上下文

Step 5 Preview 走的是 600B 总参数稀疏 MoE 路线,每 Token 激活约 27B,激活率约 4.5%。上下文窗口最高支持 100 万 Token,原生支持文本与视觉输入。重点场景覆盖 AI 编程、软件工程、专业知识工作、金融四类,对应大型代码仓库分析、复杂研究、多轮工具调用的 Agent 工作流。

参数 Step 5 Preview
总参数 600B(稀疏 MoE)
每 Token 激活参数 约 27B
上下文窗口 最高 100 万 Token
原生输入模态 文本 + 视觉
Artificial Analysis Intelligence Index 44 分
权重开放时间 计划 2026 年 10 月 15 日

评测与自评数据

第三方榜单 AAII 上 Step 5 Preview 拿到 44 分。官方自评覆盖三类长周期任务。StepCodeBench 测了 553 个代码仓库、33 种编程语言,重点考察真实仓库级的代码能力。GPU Kernel 优化实验中,模型持续执行约 22 小时,自主修改、运行、性能测试,把指定任务峰值性能优化到 508 TFLOPS。后训练实验中,模型自主调整训练数据流程,让 Qwen3-30B-A3B 在 AIME24 上的准确率从 53.3% 提升至 60%。这三类任务考察的都是持续执行、工具调用、反馈循环这一类长链路能力,与单轮推理场景差别较大。

与问答型大模型的差别

Step 5 Preview 想做的是能跑 22 小时自主优化的那种,而不是一次性回答。这种能力与 DeepSWE v1.1、AAII 这种榜单的关系是间接的。22 小时 GPU Kernel 优化、AIME24 准确率从 53.3% 提到 60%,这些数字的成立前提是模型能稳定地读工具输出、写下一轮修改、自我评估进度。本质上是 Agent 范式而不是问答范式。

调用方式与权重开放

目前开发者通过阶跃星辰开放平台调用 Step 5 Preview API,普通用户在阶跃星辰 Studio 在线体验。完整模型权重目前未释放,官方计划 2026 年 10 月 15 日开放。权重开放前只能走 API 与 Studio 通道,没法本地部署。这一安排与多数国产旗舰一致,先服务商业接入再开放研究。

常见问题

Step 5 Preview 和上一代差别在哪

重点从单轮推理转向长周期 Agent 任务,能持续调用工具、读反馈、在任务链里推进。架构上保持 600B 总参数稀疏 MoE,每 Token 激活约 27B。AAII 拿到 44 分属于基线参考,真正差异要看实际 Agent 任务跑得稳不稳。

22 小时自主优化是怎么做到的

按官方说法,模型在 GPU Kernel 优化实验里持续执行 22 小时,自主完成修改、运行、性能测试三轮循环。需要工具环境、自动化测试流水线、自反馈循环三者齐备。换句话说模型并不孤立工作,而是嵌入在能持续给它反馈的工具链里。

权重什么时候开放

计划 2026 年 10 月 15 日。开放前只能用 API 和 Studio。10 月 15 日之后是否同步上线 Hugging Face、阶跃星辰 GitHub 等渠道,目前官方未给出明确说明。

小结

Step 5 Preview 这次的核心信号是把长周期 Agent 当作主战场。600B 稀疏 MoE 加 100 万 Token 上下文是底层硬件,22 小时自主优化到 508 TFLOPS、Qwen3-30B-A3B AIME24 提升 6.7 分是上层表现。对想拿国产旗舰做长链路任务的团队来说,10 月 15 日权重开放之前先用 API 跑一轮实际工作流,比看 AAII 单个分数更能判断适配性。


消息来源:阶跃星辰 600B MoE 旗舰 Step 5 Preview 上线 22 小时 GPU Kernel 优化到 508 TFLOPS(aihub.cn)