NeoHorse-1 发布:基元律动联合无问芯穹推出 Agent-Native 模型,4B/9B 双版本

一句话结论:基元律动联合无问芯穹,以及清华、北大、港中文、阿里等单位,推出自研的 Agent-Native 模型 NeoHorse-1,提供 4B 与 9B 两个版本;其训练数据来自 Harness 结构化执行轨迹,官方内部评测称在多项 Agent 子任务上达到同规模 SOTA。这个发布值得关注的地方,是它把”为 Agent 而生”写进了模型的设计目标。

Agent-Native 是什么意思

大多数大模型最初是为”对话”训练的:输入一句话,输出一段回答。后来大家把它们接上工具、接上代码执行环境,于是有了 Agent。但底座模型本身并不理解”执行”这件事——它只是在模仿对话里看起来像执行的文本。

Agent-Native 换了个顺序:从训练阶段就以”完成任务”为目标,让模型学会规划步骤、调用工具、看结果、再修正,而不是先学会说话再被改造。

为什么这个区别会体现在效果上

对话模型做 Agent 时,最常见的失败不是”答错”,而是”不会收尾”:工具调用格式不对、参数漏字段、遇到报错就原地打转、忘记自己上一步做了什么。这些都是执行能力问题,不是知识问题,靠堆参数很难根治。

训练数据的关键:Harness 结构化执行轨迹

NeoHorse-1 的训练数据来自 Harness 结构化执行轨迹。所谓 Harness,指的是包裹在模型外面那层执行框架——负责工具注册、上下文管理、错误捕获与重试的执行环境。它在真实运行过程中产生的轨迹,天然记录了”哪一步做了什么、得到了什么反馈、下一步怎么调整”。

用这类轨迹训练,等于让模型直接学习执行过程本身,而不是学习别人描述执行过程的文字。

训练数据来源 模型学到的东西 典型短板
通用文本语料 语言与知识 不会调用工具、不会纠错
人工编写的调用示例 调用格式 覆盖面窄,遇新工具失效
Harness 结构化执行轨迹 规划—执行—反馈—修正的完整链路 对 Harness 设计质量依赖较高

4B 与 9B 两个版本怎么选

NeoHorse-1 同时提供 4B 与 9B 两个版本,这是一个很务实的配置:小模型跑得便宜、可在端侧或单卡部署;大模型能力更强、适合复杂任务编排。

规格 适合的部署位置 适合的任务
4B 消费级显卡、边缘设备、成本敏感场景 单步工具调用、格式规整、短链路自动化
9B 服务器单卡或多卡、企业内部服务 多步规划、长链路任务、需要纠错的场景

选型时容易被忽略的一点

Agent 任务的实际成本,主要取决于重试次数而不是单次推理价格。一个便宜但总要重试三次的模型,算下来未必比贵一点但一次做对的模型划算。所以评估这类模型时,更应该看”任务完成率 × 平均步数”,而不是单纯看 token 单价。

参与方说明了什么

这次发布由基元律动与无问芯穹主导,并有清华、北大、港中文与阿里等单位参与。这个组合本身有信息量:无问芯穹提供的是算力与推理基础设施能力,高校提供的是方法论与评测,产业方提供的是真实场景。Agent-Native 模型的训练高度依赖真实执行环境,单靠一家很难同时凑齐算力、数据和场景。

关于”同规模 SOTA”该怎么理解

官方的表述是”多项 Agent 子任务达同规模 SOTA”,且来源是内部评测。读这个结论时建议把握三点:其一,限定词是”同规模”,即在 4B/9B 这一档里比较,不与更大的旗舰模型比;其二,限定范围是”多项子任务”,不是全项;其三,内部评测与第三方独立复现之间通常存在差距,建议等待公开基准或自行在业务数据上验证。

FAQ:三个高频问题

Q1:NeoHorse-1 是开源模型吗?

目前公开信息中未提及开源计划与权重开放安排,官方公布的内容集中在模型规格、训练数据来源与评测结论上,具体获取方式需以基元律动后续公告为准。

Q2:Agent-Native 模型和普通模型接个工具链,差别有多大?

差别主要体现在失败模式上。普通模型接工具链,常见问题是格式错、参数漏、遇错不修正;Agent-Native 模型在训练阶段就见过执行轨迹,对这类问题的鲁棒性通常更好。但实际差距取决于任务复杂度,简单任务上可能不明显。

Q3:4B 版本够用吗?

如果任务是短链路、工具数量固定、输出格式严格,4B 往往已经够用,且部署成本低得多。如果涉及多步规划和频繁纠错,建议直接上 9B,用更少的重试换更低的总体成本。

小结

NeoHorse-1 的看点不在参数大小,而在训练范式:用 Harness 结构化执行轨迹训练,目标直指 Agent 的执行能力;4B 与 9B 双版本则把部署成本的选择权交给了使用者。官方内部评测称多项 Agent 子任务达同规模 SOTA——这个结论有明确的限定条件,值得期待但也值得自己验一遍。Agent 模型这条赛道,正在从”能不能跑”走向”跑几步能成”。

相关阅读

这条线上还有几篇站内文章可以接着看: