阶跃星辰 9 月 21 日推出新一代旗舰模型 Step 5 Preview,600B 总参数的稀疏 MoE 架构,每 Token 激活约 27B,上下文窗口最高 100 万 Token,原生支持文本与视觉输入。这次定位的关键不在单轮问答,而在长周期 Agent 任务,能持续理解上下文、调用工具、读取执行反馈、在复杂任务链里推进。第三方 Artificial Analysis Intelligence Index 上拿到 44 分。
架构与上下文
Step 5 Preview 走的是 600B 总参数稀疏 MoE 路线,每 Token 激活约 27B,激活率约 4.5%。上下文窗口最高支持 100 万 Token,原生支持文本与视觉输入。重点场景覆盖 AI 编程、软件工程、专业知识工作、金融四类,对应大型代码仓库分析、复杂研究、多轮工具调用的 Agent 工作流。
| 参数 | Step 5 Preview |
|---|---|
| 总参数 | 600B(稀疏 MoE) |
| 每 Token 激活参数 | 约 27B |
| 上下文窗口 | 最高 100 万 Token |
| 原生输入模态 | 文本 + 视觉 |
| Artificial Analysis Intelligence Index | 44 分 |
| 权重开放时间 | 计划 2026 年 10 月 15 日 |
评测与自评数据
第三方榜单 AAII 上 Step 5 Preview 拿到 44 分。官方自评覆盖三类长周期任务。StepCodeBench 测了 553 个代码仓库、33 种编程语言,重点考察真实仓库级的代码能力。GPU Kernel 优化实验中,模型持续执行约 22 小时,自主修改、运行、性能测试,把指定任务峰值性能优化到 508 TFLOPS。后训练实验中,模型自主调整训练数据流程,让 Qwen3-30B-A3B 在 AIME24 上的准确率从 53.3% 提升至 60%。这三类任务考察的都是持续执行、工具调用、反馈循环这一类长链路能力,与单轮推理场景差别较大。
与问答型大模型的差别
Step 5 Preview 想做的是能跑 22 小时自主优化的那种,而不是一次性回答。这种能力与 DeepSWE v1.1、AAII 这种榜单的关系是间接的。22 小时 GPU Kernel 优化、AIME24 准确率从 53.3% 提到 60%,这些数字的成立前提是模型能稳定地读工具输出、写下一轮修改、自我评估进度。本质上是 Agent 范式而不是问答范式。
调用方式与权重开放
目前开发者通过阶跃星辰开放平台调用 Step 5 Preview API,普通用户在阶跃星辰 Studio 在线体验。完整模型权重目前未释放,官方计划 2026 年 10 月 15 日开放。权重开放前只能走 API 与 Studio 通道,没法本地部署。这一安排与多数国产旗舰一致,先服务商业接入再开放研究。
常见问题
Step 5 Preview 和上一代差别在哪
重点从单轮推理转向长周期 Agent 任务,能持续调用工具、读反馈、在任务链里推进。架构上保持 600B 总参数稀疏 MoE,每 Token 激活约 27B。AAII 拿到 44 分属于基线参考,真正差异要看实际 Agent 任务跑得稳不稳。
22 小时自主优化是怎么做到的
按官方说法,模型在 GPU Kernel 优化实验里持续执行 22 小时,自主完成修改、运行、性能测试三轮循环。需要工具环境、自动化测试流水线、自反馈循环三者齐备。换句话说模型并不孤立工作,而是嵌入在能持续给它反馈的工具链里。
权重什么时候开放
计划 2026 年 10 月 15 日。开放前只能用 API 和 Studio。10 月 15 日之后是否同步上线 Hugging Face、阶跃星辰 GitHub 等渠道,目前官方未给出明确说明。
小结
Step 5 Preview 这次的核心信号是把长周期 Agent 当作主战场。600B 稀疏 MoE 加 100 万 Token 上下文是底层硬件,22 小时自主优化到 508 TFLOPS、Qwen3-30B-A3B AIME24 提升 6.7 分是上层表现。对想拿国产旗舰做长链路任务的团队来说,10 月 15 日权重开放之前先用 API 跑一轮实际工作流,比看 AAII 单个分数更能判断适配性。
消息来源:阶跃星辰 600B MoE 旗舰 Step 5 Preview 上线 22 小时 GPU Kernel 优化到 508 TFLOPS(aihub.cn)
延伸阅读
- 美团 AI 原生社区「觅游」公测:4 万+ Skills 技能便利店,让 Agent 拥有身份与成长4 天前
- 阿里真武V900发布:算力达M890三倍,单集群50万卡3 天前
- Tabbit AI 浏览器公测:美团光年之外用 Agent、妙招、脚本三大模块把浏览器变成执行平台4 天前
- GPT-5.6Sol 模型失准:OpenAI 披露训练期 27 条隐藏错误摘要,监控压力升高5 天前
