首页/ 资讯/ APUS-OpenJev-v1 APUS AI Lab 开源的端侧决策大模型

APUS-OpenJev-v1 APUS AI Lab 开源的端侧决策大模型

拆宝 2026-10-08 1 阅读

APUS-OpenJev-v1是什么

APUS-OpenJev-v1 是 APUS AI Lab 开源的端侧System 1决策大模型系列,与 TypeSafe AI 的闭源 Jev 同类,提供 4B、9B 和 35B-A3B 权重 ,可在浏览器自动化、表单填写、流程路由等任务中快速选择下一步操作。模型首创 effort="low/high" 动态计算深度:low 仅运行 16 层并结合候选感知投影,速度快、成本低;high 使用完整深度,准确率更高。

APUS-OpenJev-v1

APUS-OpenJev-v1的主要功能

  • 候选动作决策 :根据任务、页面上下文和候选操作描述,输出下一步业务动作。

  • 浏览器自动化 :识别按钮、输入框、导航元素等 DOM 信息,辅助 Agent 完成网页操作。

  • 业务规则路由 :适用于客服工单分流、流程审批、表单提交等业务决策场景。

  • 动态计算控制 :通过 effort="low/high" 在高吞吐和高质量之间切换。

  • 表单文本生成 :除选择题式决策外,还能生成搜索关键词、输入文本等开放式内容。

  • 本地毫秒级部署 :支持单卡 GPU 和 vLLM 服务化部署,降低云端 API 延迟与调用成本。

  • 多模型规格选择 :提供 4B、9B 和 35B-A3B 等版本,分别面向轻量端侧、生产通用和高性能需求。

APUS-OpenJev-v1的技术原理

  • 语言原生决策接口 :模型把任务目标、上下文和候选操作描述都作为自然语言输入,为候选动作绑定 A、B、C 等紧凑 Token。推理时,模型只需计算这些合法候选 Token 的概率,再由宿主程序映射回具体业务动作。

  • effort="low/high" 动态计算深度 :同一套模型权重内置两个决策出口: effort="low" 只运行前 16 层 Transformer,并配合候选感知输出投影,用更低算力完成高频常规动作; effort="high" 执行完整 32 层推理,适合支付、权限确认等高风险操作。让 Agent 系统根据动作重要性和把握程度动态分配计算资源。

  • 跨深度联合后训练与自蒸馏 :为让浅层出口在减少一半计算量后仍具备可靠判断力,模型对浅层和深层路径同时进行真实标签监督,同时使用深层输出的概率分布作为“软标签”,通过 KL 散度蒸馏给浅层路径。为避免浅层容量不足拖累深层模型,训练还对深层输出施加梯度阻断,使其既能自我优化,能作为浅层路径的教师。

  • 候选感知输出投影 :传统大模型每生成一个 Token 都要遍历约 24.8 万词表,结构化决策通常只有几个候选动作。直接抽取候选 Token 对应的输出权重行,将矩阵计算从全词表缩小到 K 个候选。在保持候选概率逻辑等价的同时,显著降低输出头的计算量和显存访问开销。

如何使用APUS-OpenJev-v1

  • 准备环境 :安装支持 CUDA 的 PyTorch、Transformers 和 huggingface_hub ,并确保本地或服务器拥有足够的 GPU 显存。

  • 下载模型 :执行 hf download apus-ailab/APUS-OpenJev-v1 --include "9B-3000/*" --local-dir ./APUS-OpenJev-v1 下载所需模型目录。

  • 进入模型目录 :切换到下载好的模型子目录,即可直接使用其中自带的 openjet_runtime 推理组件。

  • 加载模型 :使用 OpenJet.from_pretrained(".", device="cuda:0") 将模型加载到指定显卡上。

  • 构造决策请求 :按照 instructions 、 state 和 candidates 三个字段输入任务目标、当前上下文及候选操作。

  • 执行快速决策 :调用 model.decide(request_data, effort="low") ,以较低计算成本获得高频常规动作。

  • 执行深度决策 :调用 model.decide(request_data, effort="high") ,获得适合支付、提交等关键动作的完整推理结果。

  • 生成工作流文本 :对需要填写搜索词或表单内容的场景,调用 model.generate_text() 生成具体文本。

  • 部署生产服务 :运行 python deployment/serve_vllm.py --port 8000 ,通过 vLLM 启动 OpenAI 兼容接口。

APUS-OpenJev-v1的核心优势

  • 决策准确率高 :在官方 80 题冻结基准中,9B 版本达到 85%,高于 Jev 商业 API 的 82.5%。

  • 响应速度极快 :在指定本地 vLLM 部署路径下,9B 的 P50 延迟低至 25.58ms,4B 仅为 18ms。

  • 计算资源可动态调节 :首创 effort="low/high" 模式,可根据动作风险在速度和准确率之间自由切换。

  • 高频操作成本更低 : effort="low" 只运行 16 层,并采用候选感知输出投影,适合滚动、点击下一步等高频决策。

  • 关键动作更可靠 : effort="high" 执行完整网络深度,适合支付确认、权限审批等高风险场景。

  • 避免输出格式错误 :采用语言原生决策接口,将输出约束在预定义候选集合内,消除 JSON 格式幻觉。

  • 业务迁移能力强 :同一模型可通过自然语言描述适配浏览器操作、客服分流、规则审核等不同任务。

APUS-OpenJev-v1的项目地址

  • HuggingFace模型库 :https://huggingface.co/apus-ailab/APUS-OpenJev-v1

APUS-OpenJev-v1的同类竞品对比

对比维度 | APUS-OpenJev-v1 | Jev

对比维度

APUS-OpenJev-v1

Jev

产品性质

APUS AI Lab 开源的“System 1”决策大模型

TypeSafe AI 推出的商业闭源决策 API

开放程度

模型权重、运行时、部署脚本及技术报告开放

仅以云端 API 提供服务,核心模型不开源

模型规格

提供 4B、9B 及 35B-A3B 等版本

官方未公开完整模型规模和版本细节

决策准确率

9B 在官方 80 题冻结基准中达到 85.00%

官方 API 同基准结果为 82.50%

响应延迟

指定本地部署路径下,9B P50 为 25.58ms

公网 API 实测 P50 为 280.80ms

计算模式

原生支持 effort="low/high" 动态计算深度

未公开类似的可调节计算深度机制

部署方式

支持本地、私有算力及 vLLM 服务化部署

主要依赖云端 API 调用

输出方式

可输出候选动作,也能生成表单和搜索文本

主要面向结构化动作决策,公开信息未明确文本生成能力

隐私与数据控制

数据可完全留在本地或企业私有环境

请求需发送至云端,数据控制依赖服务商方案

成本模式

自部署后主要承担硬件和推理成本

按商业 API 调用计费,并产生持续订阅或流量成本

APUS-OpenJev-v1的应用场景

  • 浏览器自动化 :根据网页 DOM、按钮和输入框信息,快速决定点击、滚动或跳转等下一步操作。

  • 企业流程路由 :在审批、工单处理或表单流转中,根据业务规则自动选择提交、退回、转交等处理路径。

  • 客服工单分配 :结合用户问题、历史信息和候选处理部门,实时判断最合适的客服团队或处理动作。

  • 金融与合规审核 :对高风险操作使用 effort="high" 深度判断,识别异常交易、权限风险或违规数据流向。

  • 端侧智能助手 :将轻量模型部署在本地设备或私有服务器上,为高频 Agent 任务提供低延迟、保护隐私的决策能力。

相关工具
与本文相关的 AI 工具
AI 智能推荐 ×
输入关键词,AI 从 1000+ 工具中精准匹配推荐