NeoHorse:把「会用工具的经验」炼进模型权重,国产 RSI 的单轮工程验证
基元律动联合无问芯穹、清华、北大、阿里巴巴发布首个 Agent-Native 模型 NeoHorse(4B/9B),用 Routing Harness 的真实执行轨迹训练模型,11 项基准评测中 4B 级领先。

综述
在一次项目排期测试中,一个 4B 基础模型找到了工作目录里的文件,却漏读了一封包含最新依赖约束的邮件——它按过时信息生成了计划,把文件写到了错误位置。
这个案例来自基元律动(TokenRhythm)发布的技术报告。公司联合无问芯穹、清华大学、北京大学、阿里巴巴等机构,推出首个 Agent-Native 模型 NeoHorse-1,包含 4B 和 9B 两个版本。思路很直接:把 Agent 使用工具、接收反馈、修正错误的经验,转化为模型自身的能力,而不是永远靠外部的 Harness 补。
基元律动由前华为诺亚方舟实验室主任、盘古大模型负责人王云鹤创办,此前已开源 Routing Harness 系统 OpenSquilla——用于在 Agent 执行任务时选择和组织不同模型。NeoHorse 把这条技术路线从「执行期」延伸到了「训练期」。

专业分析
语料:执行轨迹,而不是网页文本
NeoHorse 训练语料的核心,是 OpenSquilla 等 Routing Harness 在执行任务时留下的轨迹——每条轨迹完整保留能力需求预测、路由选择、模型响应、工具调用和环境反馈五个环节。这些轨迹先过完整性检查,再按目标完成度、证据一致性、错误恢复等维度做质量评估,才进入后训练。与「网上抄一堆代码问答」不同,这类语料自带因果结构:什么决策导致了什么结果、失败后如何恢复。
训练:路由信号排课程,在策略蒸馏收尾
团队用路由信号估计任务所需能力、安排训练顺序(相当于给模型排「先学什么、再学什么」的课程),再结合 Agent 执行监督与在策略蒸馏(On-Policy Distillation)更新模型——后者由教师模型针对学生实际生成的内容给指导,而不是对着理想答案讲空话。
评测:4B 级领跑,且改进集中在「可验证的活」
报告在 11 项覆盖 Agent 执行、工具交互、代码与指令遵循的基准上评测:NeoHorse 4B 在所列 4B 级模型里未加权平均分最高,并在五项基准上超过 Qwen3.5-9B 底座。更有信息量的结论是改进的分布——提升主要集中在流程清晰、反馈可观察、结果可验证的任务上;在复杂状态维护、长程调试与失败恢复这类任务上,更大模型仍有优势。换句话说,经验炼进权重解决的是「看得到对错」的活,留给大模型的是「没有现成对错」的活。

关联信息与影响
报告自己把这件事定义为「递归自我改进(RSI)的单轮工程验证」:Agent 执行轨迹 → 评测暴露能力短板 → 训练选择随之调整 → 模型更新 → 重新返回 Harness。把它和今天 MetaRSI-v1 的元递归框架并排看很有意思:MetaRSI 想让「改进的机制」也能被改进(对 RSI 做 RSI),NeoHorse 则是把 RSI 的单轮流程在真实国产开源模型上完整跑了一遍——一个搭脚手架,一个先砌一段墙。
基元律动此前开源 OpenSquilla(Routing Harness),NeoHorse 相当于给这个 Harness 配了「模型侧的证据」:模型学习执行中的经验后,Harness 与模型的协同改进有了可验证的起点。基于 Qwen3.5 开源底座做后训练,也让这条路径能搭在开源生态上持续迭代。
未来展望
NeoHorse 现阶段的意义更多是证明「轨迹→权重」这条路走得通,而不是终点。接下来值得看三点:一是多轮闭环——单轮注入之后,新轨迹继续回流会不会滚出更陡的曲线;二是 Harness 减负——当「会用工具」长进模型,原本塞在 Harness 里的启发式能否退场;三是更大基座的 Agent-Native 化——报告已指出更大模型在长程任务上的优势,9B 之后的路会更长。
信号强度
- Harness/工具链开发者:执行轨迹正变成一种稀缺语料,谁积累得多,谁就在模型训练端有话语权。
- 小模型用户:4B/9B 端侧部署 + Agent 经验注入,是「手机/桌面上真正会干活的 Agent」的一步推进。
- 开源社区:基于 Qwen3.5 底座 + 轨迹语料 + 后训练的全套做法公开,可复现性值得跟进验证。
- 产学研合作方:无问芯穹的算力底座、清华北大算法创新与阿里开源生态形成了一条国产协作链路。
- 普通用户:短期无感,中期这类「端侧会干活的小模型」会先出现在本地自动化场景里。
信息局限说明:本文依据基元律动技术报告与雷峰网报道整理;评测基准、轨迹质量评估细节以报告原文为准,实验结论尚未经第三方独立复现。创始团队背景来自公开报道。
首个 Agent-Native 模型 NeoHorse-1(4B/9B):以 OpenSquilla Routing Harness 的执行轨迹为核心语料做后训练,把「预测能力需求→路由→工具调用→环境反馈」的经验注入权重,被报告定位为 RSI 的单轮工程验证。
本文基于 AI 情报库收录的条目展开深析;事实性信息以原始报道为准,分析与展望为编辑观点。
原始报道:https://www.leiphone.com/category/industrynews/E7j0Qq5zBynzWv64.html(雷峰网)


