NeoHorse-1 基元律动联合无问芯穹等开源的 Agent 模型
NeoHorse-1是什么
NeoHorse-1 是基元律动联合无问芯穹、清华、北大、港中文、阿里巴巴等推出的开源 Agent 模型,含 4B 与 9B 两版。模型采用 Agent-Native 后训练,用 Routing Harness 的真实执行轨迹为训练数据,将路由信号复用为训练课程排序依据,实现评测反馈→数据配比→模型更新闭环。模型覆盖工具调用、任务规划、深度搜索与代码生成,9B 版均分 69.04、超底座 3.44 分,原生支持 26 万 token 上下文,可本地部署。

NeoHorse-1的主要功能
- 工具调用 :根据任务需求自动选择并调用外部工具,完成多步骤操作。
- 任务规划 :将复杂任务拆解为可执行的子步骤,并进行长程规划与调度。
- 深度搜索 :在多轮交互中主动检索、整合信息,支撑结论的证据链。
- 代码生成 :生成可用代码并基于环境反馈调试修复,直至任务完成。
NeoHorse-1的技术原理
- Harness 轨迹驱动的 Agent-Native 训练 :训练语料用 Routing Harness 真实执行产生的结构化轨迹为核心,涵盖请求、路由、工具调用、环境反馈与错误恢复,较传统问答语料多出能力需求、执行决策、环境结果三个维度。成功与失败轨迹均被保留,经结构检查与六维质量评估后入选,使训练目标直接指向任务完成。
- 能力引导的数据配比 :路由器将任务按能力需求分为 C0–C3 四档,信号离线复用为训练依据:将路由记录拆为预测—行动—结果三段,用预测段排课程、用结果段定位能力短板,据此调整下一轮数据配比,形成评测反馈→数据配比→模型更新闭环。
- 递归自我改进(RSI)的单轮验证 :分 Data-RSI 与 Model-RSI 两部分:前者指模型持续执行产生新轨迹、筛选后作为后续训练材料自然积累;后者指按评测短板更新模型并放回 Harness 模型池。当前仅验证单次闭环,信号与奖励设计仍由人类设定。

如何使用NeoHorse-1
安装下载工具 :执行 pip install -U modelscope 安装 ModelScope 命令行工具。
下载模型 :运行 modelscope download --model TokenRhythm/NeoHorse-1-9B --local_dir ./NeoHorse-1-9B 拉取权重(4B 版本同理,按需选择)。 部署服务 :使用 SGLang( pip install "sglang==0.5.17" )或 vLLM 启动推理服务,配置 --context-length 262144 、 --reasoning-parser qwen3 和 --tool-call-parser qwen3_coder 。 API 调用 :通过 OpenAI SDK 将 base_url 指向本地服务地址(如 http://localhost:8000/v1 ),即可像调用 OpenAI 接口一样发送请求。 注意资源 :实际可用上下文取决于 GPU 显存,显存不足时可先降低上下文长度再部署。
NeoHorse-1的核心优势
- Agent-Native 训练 :训练数据直接来自真实执行轨迹而非传统问答语料,目标直指任务完成,而非通用模型的事后适配。
- 失败轨迹利用 :训练集同时保留成功与被替换的失败记录,让模型学会哪里易错、出错后如何恢复。
- 路由信号复用 :将在线路由的 C0–C3 能力分档信号离线转化为训练依据,实现评测反馈→数据配比→模型更新闭环。
- 小尺寸高性能 :4B 版 Agent 表现已超越多个参数量更大的通用模型,9B 版均分 69.04、超底座 3.44 分,部署成本更低。
- 超长上下文 :原生支持 262,144 tokens,可扩展至约 101 万 tokens,适配长程 Agent 任务。
NeoHorse-1的项目地址
- GitHub仓库 :https://github.com/TokenRhythm/NeoHorse
- HuggingFace模型库 :https://huggingface.co/collections/TokenRhythm/neohorse-1
- arXiv技术论文 :https://arxiv.org/pdf/2609.08183
NeoHorse-1的同类竞品对比
对比维度 | NeoHorse-1-9B | Qwen3.5-9B
| 对比维度 | NeoHorse-1-9B | Qwen3.5-9B |
|---|---|---|
| 十项基准均分 | 69.04 | 65.60(+3.44 分) |
| QwenClawBench(Harness Agent 任务) | 48.73 | 44.04 |
| PinchBench(标准化工作流) | 82.25 | 74.55(+7.70) |
| BFCL v4(函数调用/工具使用) | 67.43 | 64.88 |
| tau²-Bench(多轮人机工具交互) | 90.82 | 88.04 |
| HumanEval(代码正确性) | 98.17 | 92.68 |
| 训练方式 | Agent-Native 后训练:Harness 轨迹 + 路由信号课程 + 在策略蒸馏 | 通用四阶段后训练,无 Agent 执行轨迹 |
| 训练数据 | 真实执行轨迹(含失败与恢复记录),六维质量评估筛选 | 通用语料 + 合成数据 |
| 上下文长度 | 262,144 tokens(可扩展至约 101 万) | 长上下文(相对较短) |
| 协议/生态 | Apache-2.0,SGLang/vLLM/Ollama 等全框架支持 | Apache-2.0,通用模型 |
| 定位 | 专精 Agent 场景(工具调用、规划、深搜、代码) | 通用推理与对话 |
NeoHorse-1的应用场景
相关工具
与本文相关的 AI 工具