SkyClaw-v1.0 发布:1M 上下文 Agent 模型,输入 0.5 元/百万 tokens,兼容 OpenAI API

结论先行:Skywork AI 推出的 SkyClaw-v1.0 不是一款用来聊天的模型,而是一款明确为 Agent 工作流设计的长上下文模型。官方页面信息显示,该模型于 2026 年 5 月 19 日发布,支持 1M token 上下文,提供 OpenAI 兼容 API,可直接接入主流 Agent 框架使用。定价上,主模型输入 0.5 元/百万 tokens、输出 4 元/百万 tokens,另有一款更轻量的 lite 版本,输入 0.3 元、输出 2 元。目前已开放免费试用,官方称后续将逐步开源各模型版本。

一、它和普通聊天模型的区别在哪

表面上看,SkyClaw-v1.0 与任何一款大模型一样接收文本、输出文本。但设计目标完全不同。普通聊天模型优化的是”单轮回答的质量”——你问一句,它答一句,答得准、答得好就行。Agent 模型要优化的是”多轮任务能不能走完”——给出目标后,它需要自己规划步骤、调用工具、读取结果、发现错误、调整方案,直到交付。

这个差别带来一系列不同的能力要求。聊天模型怕的是答错;Agent 模型怕的是中途断链——十步流程走到第七步忘了第二步的约定,或者工具返回异常后不知道该怎么处理。前者是准确性问题,后者是一致性与恢复能力问题,两者需要的训练手段并不相同。

二、训练方式:合成轨迹筛选 + 端到端 Agentic RL

官方介绍,SkyClaw-v1.0 面向复杂工具环境、多步骤用户需求进行训练,结合了高质量合成任务轨迹筛选端到端 Agentic RL(智能体强化学习),目标是提升模型在多步执行、工具调用和任务稳定性上的表现。

这两种手段解决的是两个不同层面的问题。

合成任务轨迹筛选:解决”数据从哪来”

真实的多步工具调用数据稀缺且昂贵——你很难大规模采集到人类完整操作一套复杂工具链的轨迹。合成数据是一条可行路径:先批量生成大量任务与操作步骤,再用筛选机制把真正走通、质量高的轨迹保留下来。这里的关键不在”生成”而在”筛选”,低质量轨迹会直接把模型带偏,因此筛选标准决定了数据上限。

端到端 Agentic RL:解决”断了怎么办”

模仿学习能让模型学会”照着做”,但一旦遇到训练分布之外的情况,模型往往不知道如何恢复。强化学习补的是这一环:让模型在完整任务上试错,以最终是否完成任务作为奖励信号,从而学会在中间步骤出错时自行修正。所谓”端到端”,强调的是优化目标直接对齐最终任务成败,而不是每一步的局部正确性。

三、规格与定价

项目 SkyClaw-v1.0 SkyClaw-v1.0-lite
上下文长度 1M tokens 1M tokens(lite 版本同属该系列)
输入价格 0.5 元 / 百万 tokens 0.3 元 / 百万 tokens
输出价格 4 元 / 百万 tokens 2 元 / 百万 tokens
接口形态 OpenAI 兼容 API OpenAI 兼容 API
发布时间 2026 年 5 月 19 日 同期提供
当前状态 已开放免费试用 已开放免费试用
开源计划 官方称后续逐步开源 官方称后续逐步开源

输出价格是输入的 8 倍,这个比例在长上下文 Agent 场景里值得留意。Agent 任务的特点是输入会不断累积——每一轮工具调用的结果都要重新进入上下文,而输出相对简短。因此实际账单往往由输入侧主导,而输入单价只有 0.5 元/百万 tokens,这对长流程任务是友好的定价结构。

四、适合用在哪,不适合用在哪

官方给出的适用场景包括:应用生成、交互式网页与游戏开发、Deep Research、数据可视化、市场报告和多步骤代码任务。这几类场景的共同点是步骤多、需要反复迭代、并且每一步都要基于上一步的结果推进。

官方同时给出了一个明确的使用建议:把 SkyClaw-v1.0 放在 Agent 框架内部使用,而不是仅作为独立聊天模型调用,让它完成规划、文件编辑、测试、迭代和结果交付等完整流程。这个建议很实在——模型的训练目标是任务闭环,如果只用来单轮问答,等于花了 Agent 模型的钱却只用到了聊天模型的能力,性价比并不划算。

反过来说,如果你的需求只是日常问答、文案润色、简单改写,那么通用聊天模型会更合适,也更便宜。选型时先看任务是不是”多步 + 要调用工具”,再决定要不要上 Agent 专用模型。

五、常见问题(FAQ)

Q1:OpenAI 兼容 API 意味着什么?接入成本高吗?

OpenAI 兼容 API 指的是接口格式与调用方式与 OpenAI 的 API 保持一致。对开发者的直接好处是迁移成本极低:现有基于 OpenAI SDK 编写的代码、以及大量已经适配该格式的 Agent 框架,通常只需替换接口地址与密钥即可切换。这意味着可以在不重构工程的前提下做一次能力对比测试,用真实任务跑一遍再决定是否切换。

Q2:1M 上下文在 Agent 任务里为什么重要?

Agent 任务的上下文消耗速度远超聊天。每一轮工具调用的返回结果、每一次文件读取的内容、每一版修改后的代码,都会累积进上下文。一个跑几十步的任务很容易吃掉数十万 tokens。1M 的容量让模型可以在较长流程中保留完整历史,减少因上下文截断导致的”忘记前面约定”问题。不过容量大不等于用得好,长上下文中的信息检索能力同样关键,建议用真实长任务实测,而不是只看标称长度。

Q3:lite 版本和主版本该怎么选?

两者价格相差约 40%(输入 0.3 元对 0.5 元,输出 2 元对 4 元)。比较合理的做法是先用 lite 版本跑通流程:Agent 任务的调试成本主要在流程设计而非模型能力,用便宜的版本把工具链、提示词与错误处理打磨好,再换主版本处理复杂任务。对于步骤较少、容错空间大的任务,lite 版本可能已经是成本最优解。

小结

SkyClaw-v1.0 反映了一个正在成型的趋势:Agent 模型正在从”能聊天、能写代码”,进一步走向”能调用工具、能处理长流程任务、能在复杂工作流中持续执行”。它不再把自己包装成通用助手,而是明确标注了使用场景、接口形态与定价结构,甚至直白地建议用户把它放进 Agent 框架而不是当聊天模型用。这种产品定位的清晰化,对开发者是好事——选型时不必再靠猜。

对正在构建 AI 编程工具、自动化工作流或研究型 Agent 的团队,这款模型值得放进对比清单:1M 上下文、OpenAI 兼容接口、0.5 元/百万 tokens 的输入价格,加上免费试用,试错门槛很低。真正需要验证的仍是老问题——在你自己的任务上,它能不能把十步流程完整走完,而不是走五步就散了。