一句话结论:基元律动联合无问芯穹,以及清华、北大、港中文、阿里等单位,推出自研的 Agent-Native 模型 NeoHorse-1,提供 4B 与 9B 两个版本;其训练数据来自 Harness 结构化执行轨迹,官方内部评测称在多项 Agent 子任务上达到同规模 SOTA。这个发布值得关注的地方,是它把”为 Agent 而生”写进了模型的设计目标。
Agent-Native 是什么意思
大多数大模型最初是为”对话”训练的:输入一句话,输出一段回答。后来大家把它们接上工具、接上代码执行环境,于是有了 Agent。但底座模型本身并不理解”执行”这件事——它只是在模仿对话里看起来像执行的文本。
Agent-Native 换了个顺序:从训练阶段就以”完成任务”为目标,让模型学会规划步骤、调用工具、看结果、再修正,而不是先学会说话再被改造。
为什么这个区别会体现在效果上
对话模型做 Agent 时,最常见的失败不是”答错”,而是”不会收尾”:工具调用格式不对、参数漏字段、遇到报错就原地打转、忘记自己上一步做了什么。这些都是执行能力问题,不是知识问题,靠堆参数很难根治。
训练数据的关键:Harness 结构化执行轨迹
NeoHorse-1 的训练数据来自 Harness 结构化执行轨迹。所谓 Harness,指的是包裹在模型外面那层执行框架——负责工具注册、上下文管理、错误捕获与重试的执行环境。它在真实运行过程中产生的轨迹,天然记录了”哪一步做了什么、得到了什么反馈、下一步怎么调整”。
用这类轨迹训练,等于让模型直接学习执行过程本身,而不是学习别人描述执行过程的文字。
| 训练数据来源 | 模型学到的东西 | 典型短板 |
|---|---|---|
| 通用文本语料 | 语言与知识 | 不会调用工具、不会纠错 |
| 人工编写的调用示例 | 调用格式 | 覆盖面窄,遇新工具失效 |
| Harness 结构化执行轨迹 | 规划—执行—反馈—修正的完整链路 | 对 Harness 设计质量依赖较高 |
4B 与 9B 两个版本怎么选
NeoHorse-1 同时提供 4B 与 9B 两个版本,这是一个很务实的配置:小模型跑得便宜、可在端侧或单卡部署;大模型能力更强、适合复杂任务编排。
| 规格 | 适合的部署位置 | 适合的任务 |
|---|---|---|
| 4B | 消费级显卡、边缘设备、成本敏感场景 | 单步工具调用、格式规整、短链路自动化 |
| 9B | 服务器单卡或多卡、企业内部服务 | 多步规划、长链路任务、需要纠错的场景 |
选型时容易被忽略的一点
Agent 任务的实际成本,主要取决于重试次数而不是单次推理价格。一个便宜但总要重试三次的模型,算下来未必比贵一点但一次做对的模型划算。所以评估这类模型时,更应该看”任务完成率 × 平均步数”,而不是单纯看 token 单价。
参与方说明了什么
这次发布由基元律动与无问芯穹主导,并有清华、北大、港中文与阿里等单位参与。这个组合本身有信息量:无问芯穹提供的是算力与推理基础设施能力,高校提供的是方法论与评测,产业方提供的是真实场景。Agent-Native 模型的训练高度依赖真实执行环境,单靠一家很难同时凑齐算力、数据和场景。
关于”同规模 SOTA”该怎么理解
官方的表述是”多项 Agent 子任务达同规模 SOTA”,且来源是内部评测。读这个结论时建议把握三点:其一,限定词是”同规模”,即在 4B/9B 这一档里比较,不与更大的旗舰模型比;其二,限定范围是”多项子任务”,不是全项;其三,内部评测与第三方独立复现之间通常存在差距,建议等待公开基准或自行在业务数据上验证。
FAQ:三个高频问题
Q1:NeoHorse-1 是开源模型吗?
目前公开信息中未提及开源计划与权重开放安排,官方公布的内容集中在模型规格、训练数据来源与评测结论上,具体获取方式需以基元律动后续公告为准。
Q2:Agent-Native 模型和普通模型接个工具链,差别有多大?
差别主要体现在失败模式上。普通模型接工具链,常见问题是格式错、参数漏、遇错不修正;Agent-Native 模型在训练阶段就见过执行轨迹,对这类问题的鲁棒性通常更好。但实际差距取决于任务复杂度,简单任务上可能不明显。
Q3:4B 版本够用吗?
如果任务是短链路、工具数量固定、输出格式严格,4B 往往已经够用,且部署成本低得多。如果涉及多步规划和频繁纠错,建议直接上 9B,用更少的重试换更低的总体成本。
小结
NeoHorse-1 的看点不在参数大小,而在训练范式:用 Harness 结构化执行轨迹训练,目标直指 Agent 的执行能力;4B 与 9B 双版本则把部署成本的选择权交给了使用者。官方内部评测称多项 Agent 子任务达同规模 SOTA——这个结论有明确的限定条件,值得期待但也值得自己验一遍。Agent 模型这条赛道,正在从”能不能跑”走向”跑几步能成”。
相关阅读
这条线上还有几篇站内文章可以接着看:
延伸阅读
- 阿里千问首次开源 Max 级旗舰:Qwen3.8-2.4T-A95B 权重开放,2.4 万亿参数对标 Fable 51 月前
- CogView4 开源文生图模型解析:首个支持汉字生成,DPG-Bench 综合评分开源第一1 天前
- 李飞飞 World Labs 发布 Atlas:全球首个多模态世界模型,可控生成与 3D 重建双超 SOTA3 天前
- 文心大模型 4.5 原生多模态解析:API 输入 0.004 元/千 tokens,幻觉显著降低1 天前
