结论先行:2026 年 5 月 29 日,阶跃星辰正式发布 Step 3.7 Flash,一款面向真实世界 Agent 场景的高效率模型。它采用稀疏 MoE 视觉语言模型架构,围绕多模态感知、网页与视觉搜索、工具调用、代码执行和 Agent 工作流做了系统增强。官方数据显示,相比 Step 3.5 Flash,它在 SWE-Bench Pro 和 Terminal-Bench 2.1 等编码相关测试中取得提升。
它和“偏问答”的模型有什么不同
Step 3.7 Flash 的核心表述是“理解之后执行”。传统模型的目标函数是把问题回答好,而面向 Agent 的模型需要在浏览器、终端、办公工具、搜索工具等环境里持续执行、观察结果并迭代下一步动作。这个差别决定了评测方式、训练数据和能力组合都完全不同。
架构与多模态能力
稀疏 MoE 视觉语言模型
该模型采用稀疏 MoE 视觉语言模型架构,具备文本、图像、代码、搜索和工具调用等能力。稀疏激活的好处是可以在保持较高总参数规模的同时控制单次推理的计算量,这对需要长时间连续调用的 Agent 任务尤其重要——成本与延迟会直接决定任务能不能跑完。
看得懂界面、文档和图表
官方介绍显示,Step 3.7 Flash 支持理解产品界面、文档、图表、自然场景等视觉输入,并可以基于看到的内容生成代码或调用工具完成任务。对 Agent 而言,“看得见”意味着它能像人一样从屏幕上获取信息,而不必依赖结构化接口——这是大量现实任务绕不开的一步。
三项重点增强
Agentic Coding
在智能编程方面,模型针对 Agentic Coding 场景做了重点优化,可用于代码生成、缺陷修复、多文件项目理解、终端操作和自动化开发任务。据官方数据,相比 Step 3.5 Flash,它在 SWE-Bench Pro 和 Terminal-Bench 2.1 等编码相关测试中取得提升,并在多个 Agent 框架下表现更加均衡。“均衡”这一点比单项跑分更值钱,因为真实工程任务不会只考一种能力。
搜索与信息综合
搜索能力也是此次升级的重点方向。模型强化了搜索规划、证据筛选和信息综合能力,可以处理更复杂的网页搜索、视觉搜索和跨来源信息整合任务。对需要实时信息、长尾实体识别、资料核验和深度研究的场景,它更接近一个能主动检索并整理信息的 Agent 模型,而不是一个等着被投喂上下文的生成器。
企业专业任务
面向文档、表格、截图、业务资料和专业知识工作,模型也做了优化。它可以处理混合输入,结合搜索、工具调用和视觉理解完成更长链路的任务,适合企业报告分析、数据整理、财务会计辅助、制造工程任务、办公自动化和多工具协作等场景。
能力矩阵与适用场景
| 能力维度 | 具体表现 | 典型场景 |
|---|---|---|
| 视觉理解 | 界面、文档、图表、自然场景 | 界面自动化、图表解读 |
| 智能编程 | 生成、修 Bug、多文件理解、终端操作 | Agentic Coding、自动化开发 |
| 搜索增强 | 搜索规划、证据筛选、信息综合 | 深度研究、资料核验 |
| 工具调用 | 在多种环境中执行并迭代 | 多工具协作工作流 |
| 企业任务 | 文档、表格、截图混合输入 | 报告分析、数据整理 |
| 部署形态 | 云端、数据中心、本地高内存设备 | 不同规模团队与私有化需求 |
生态兼容与部署方式
Step 3.7 Flash 强调 Agent 生态兼容性,支持主流 Agent 框架与 Skills 生态,便于开发者将其接入现有工作流。部署方面,模型支持通过阶跃星辰开放平台调用,也可在 Web 端和 App 中体验,并支持 OpenRouter、NVIDIA NIM 等合作平台接入;同时可部署在云端、数据中心和本地高内存设备上,覆盖从个人开发者到企业私有化的不同需求。
常见问题(FAQ)
Q:Step 3.7 Flash 相比上一代提升了多少?
据官方数据,相比 Step 3.5 Flash,Step 3.7 Flash 在 SWE-Bench Pro 和 Terminal-Bench 2.1 等编码相关测试中取得提升,并在多个 Agent 框架下表现更加均衡。官方未公布统一幅度的单一数字,建议按具体基准分别看待。
Q:它支持哪些部署方式?
可通过阶跃星辰开放平台调用,也可在 Web 端和 App 中体验,并支持 OpenRouter、NVIDIA NIM 等合作平台接入;同时支持云端、数据中心以及本地高内存设备部署。
Q:适合用来做什么?
适合构建 AI Agent、企业自动化工具与多模态应用,尤其是需要界面理解、网页与视觉搜索、代码执行和长链路工具协作的任务。
小结
Step 3.7 Flash 的意义不止是一次版本号升级,而是阶跃星辰把 Flash 系列进一步推向真实 Agent 应用的一次尝试。它在多模态理解、搜索增强、工具调用、智能编程和本地部署上形成了较完整的能力组合。对正在搭建 Agent 的开发者来说,真正需要评估的不是跑分榜单,而是三件事:模型在你的框架里是否稳定、长链路任务的成本是否可控、以及出错后能否被观测和回滚。
