首页/ 资讯/ NeoHorse-1 基元律动联合无问芯穹等开源的 Agent 模型

NeoHorse-1 基元律动联合无问芯穹等开源的 Agent 模型

灵犀编辑部 2026-09-11 1 阅读

NeoHorse-1是什么

NeoHorse-1 是基元律动联合无问芯穹、清华、北大、港中文、阿里巴巴等推出的开源 Agent 模型,含 4B 与 9B 两版。模型采用 Agent-Native 后训练,用 Routing Harness 的真实执行轨迹为训练数据,将路由信号复用为训练课程排序依据,实现评测反馈→数据配比→模型更新闭环。模型覆盖工具调用、任务规划、深度搜索与代码生成,9B 版均分 69.04、超底座 3.44 分,原生支持 26 万 token 上下文,可本地部署。

NeoHorse-1

NeoHorse-1的主要功能

  • 工具调用 :根据任务需求自动选择并调用外部工具,完成多步骤操作。
  • 任务规划 :将复杂任务拆解为可执行的子步骤,并进行长程规划与调度。
  • 深度搜索 :在多轮交互中主动检索、整合信息,支撑结论的证据链。
  • 代码生成 :生成可用代码并基于环境反馈调试修复,直至任务完成。

NeoHorse-1的技术原理

  • Harness 轨迹驱动的 Agent-Native 训练 :训练语料用 Routing Harness 真实执行产生的结构化轨迹为核心,涵盖请求、路由、工具调用、环境反馈与错误恢复,较传统问答语料多出能力需求、执行决策、环境结果三个维度。成功与失败轨迹均被保留,经结构检查与六维质量评估后入选,使训练目标直接指向任务完成。
  • 能力引导的数据配比 :路由器将任务按能力需求分为 C0–C3 四档,信号离线复用为训练依据:将路由记录拆为预测—行动—结果三段,用预测段排课程、用结果段定位能力短板,据此调整下一轮数据配比,形成评测反馈→数据配比→模型更新闭环。
  • 递归自我改进(RSI)的单轮验证 :分 Data-RSI 与 Model-RSI 两部分:前者指模型持续执行产生新轨迹、筛选后作为后续训练材料自然积累;后者指按评测短板更新模型并放回 Harness 模型池。当前仅验证单次闭环,信号与奖励设计仍由人类设定。
挖挖GitHub

如何使用NeoHorse-1

安装下载工具 :执行 pip install -U modelscope 安装 ModelScope 命令行工具。

下载模型 :运行 modelscope download --model TokenRhythm/NeoHorse-1-9B --local_dir ./NeoHorse-1-9B 拉取权重(4B 版本同理,按需选择)。 部署服务 :使用 SGLang( pip install "sglang==0.5.17" )或 vLLM 启动推理服务,配置 --context-length 262144 、 --reasoning-parser qwen3 和 --tool-call-parser qwen3_coder 。 API 调用 :通过 OpenAI SDK 将 base_url 指向本地服务地址(如 http://localhost:8000/v1 ),即可像调用 OpenAI 接口一样发送请求。 注意资源 :实际可用上下文取决于 GPU 显存,显存不足时可先降低上下文长度再部署。

NeoHorse-1的核心优势

  • Agent-Native 训练 :训练数据直接来自真实执行轨迹而非传统问答语料,目标直指任务完成,而非通用模型的事后适配。
  • 失败轨迹利用 :训练集同时保留成功与被替换的失败记录,让模型学会哪里易错、出错后如何恢复。
  • 路由信号复用 :将在线路由的 C0–C3 能力分档信号离线转化为训练依据,实现评测反馈→数据配比→模型更新闭环。
  • 小尺寸高性能 :4B 版 Agent 表现已超越多个参数量更大的通用模型,9B 版均分 69.04、超底座 3.44 分,部署成本更低。
  • 超长上下文 :原生支持 262,144 tokens,可扩展至约 101 万 tokens,适配长程 Agent 任务。

NeoHorse-1的项目地址

  • GitHub仓库 :https://github.com/TokenRhythm/NeoHorse
  • HuggingFace模型库 :https://huggingface.co/collections/TokenRhythm/neohorse-1
  • arXiv技术论文 :https://arxiv.org/pdf/2609.08183

NeoHorse-1的同类竞品对比

对比维度 | NeoHorse-1-9B | Qwen3.5-9B

>
对比维度 NeoHorse-1-9B Qwen3.5-9B
十项基准均分 69.04 65.60(+3.44 分)
QwenClawBench(Harness Agent 任务) 48.73 44.04
PinchBench(标准化工作流) 82.25 74.55(+7.70)
BFCL v4(函数调用/工具使用) 67.43 64.88
tau²-Bench(多轮人机工具交互) 90.82 88.04
HumanEval(代码正确性) 98.17 92.68
训练方式 Agent-Native 后训练:Harness 轨迹 + 路由信号课程 + 在策略蒸馏 通用四阶段后训练,无 Agent 执行轨迹
训练数据 真实执行轨迹(含失败与恢复记录),六维质量评估筛选 通用语料 + 合成数据
上下文长度 262,144 tokens(可扩展至约 101 万) 长上下文(相对较短)
协议/生态 Apache-2.0,SGLang/vLLM/Ollama 等全框架支持 Apache-2.0,通用模型
定位 专精 Agent 场景(工具调用、规划、深搜、代码) 通用推理与对话

NeoHorse-1的应用场景

  • 智能体任务执行 :作为 OpenClaw 等 Harness 中的执行模型,自动完成文件操作、软件使用等真实电脑任务,并在失败后自主恢复。
  • 工具调用与 API 编排 :在多工具环境中自动选择、组合并调用外部 API,适合构建自动化工作流助手。
  • 深度搜索与研究助理 :多轮主动检索、交叉验证信息并附证据链,支撑带引用的调研报告生成。
  • 企业办公自动化 :在 WorkBuddy Bench 类多领域职场场景中处理日程调整、数据整理、报表生成等长程多步骤任务。
相关工具
与本文相关的 AI 工具
AI 智能推荐 ×
输入关键词,AI 从 1000+ 工具中精准匹配推荐