APUS-OpenJev-v1 APUS AI Lab 开源的端侧决策大模型
APUS-OpenJev-v1是什么
APUS-OpenJev-v1 是 APUS AI Lab 开源的端侧System 1决策大模型系列,与 TypeSafe AI 的闭源 Jev 同类,提供 4B、9B 和 35B-A3B 权重 ,可在浏览器自动化、表单填写、流程路由等任务中快速选择下一步操作。模型首创 effort="low/high" 动态计算深度:low 仅运行 16 层并结合候选感知投影,速度快、成本低;high 使用完整深度,准确率更高。

APUS-OpenJev-v1的主要功能
候选动作决策 :根据任务、页面上下文和候选操作描述,输出下一步业务动作。
浏览器自动化 :识别按钮、输入框、导航元素等 DOM 信息,辅助 Agent 完成网页操作。
业务规则路由 :适用于客服工单分流、流程审批、表单提交等业务决策场景。
动态计算控制 :通过 effort="low/high" 在高吞吐和高质量之间切换。
表单文本生成 :除选择题式决策外,还能生成搜索关键词、输入文本等开放式内容。
本地毫秒级部署 :支持单卡 GPU 和 vLLM 服务化部署,降低云端 API 延迟与调用成本。
多模型规格选择 :提供 4B、9B 和 35B-A3B 等版本,分别面向轻量端侧、生产通用和高性能需求。
APUS-OpenJev-v1的技术原理
语言原生决策接口 :模型把任务目标、上下文和候选操作描述都作为自然语言输入,为候选动作绑定 A、B、C 等紧凑 Token。推理时,模型只需计算这些合法候选 Token 的概率,再由宿主程序映射回具体业务动作。
effort="low/high" 动态计算深度 :同一套模型权重内置两个决策出口: effort="low" 只运行前 16 层 Transformer,并配合候选感知输出投影,用更低算力完成高频常规动作; effort="high" 执行完整 32 层推理,适合支付、权限确认等高风险操作。让 Agent 系统根据动作重要性和把握程度动态分配计算资源。
跨深度联合后训练与自蒸馏 :为让浅层出口在减少一半计算量后仍具备可靠判断力,模型对浅层和深层路径同时进行真实标签监督,同时使用深层输出的概率分布作为“软标签”,通过 KL 散度蒸馏给浅层路径。为避免浅层容量不足拖累深层模型,训练还对深层输出施加梯度阻断,使其既能自我优化,能作为浅层路径的教师。
候选感知输出投影 :传统大模型每生成一个 Token 都要遍历约 24.8 万词表,结构化决策通常只有几个候选动作。直接抽取候选 Token 对应的输出权重行,将矩阵计算从全词表缩小到 K 个候选。在保持候选概率逻辑等价的同时,显著降低输出头的计算量和显存访问开销。
如何使用APUS-OpenJev-v1
准备环境 :安装支持 CUDA 的 PyTorch、Transformers 和 huggingface_hub ,并确保本地或服务器拥有足够的 GPU 显存。
下载模型 :执行 hf download apus-ailab/APUS-OpenJev-v1 --include "9B-3000/*" --local-dir ./APUS-OpenJev-v1 下载所需模型目录。
进入模型目录 :切换到下载好的模型子目录,即可直接使用其中自带的 openjet_runtime 推理组件。
加载模型 :使用 OpenJet.from_pretrained(".", device="cuda:0") 将模型加载到指定显卡上。
构造决策请求 :按照 instructions 、 state 和 candidates 三个字段输入任务目标、当前上下文及候选操作。
执行快速决策 :调用 model.decide(request_data, effort="low") ,以较低计算成本获得高频常规动作。
执行深度决策 :调用 model.decide(request_data, effort="high") ,获得适合支付、提交等关键动作的完整推理结果。
生成工作流文本 :对需要填写搜索词或表单内容的场景,调用 model.generate_text() 生成具体文本。
部署生产服务 :运行 python deployment/serve_vllm.py --port 8000 ,通过 vLLM 启动 OpenAI 兼容接口。
APUS-OpenJev-v1的核心优势
决策准确率高 :在官方 80 题冻结基准中,9B 版本达到 85%,高于 Jev 商业 API 的 82.5%。
响应速度极快 :在指定本地 vLLM 部署路径下,9B 的 P50 延迟低至 25.58ms,4B 仅为 18ms。
计算资源可动态调节 :首创 effort="low/high" 模式,可根据动作风险在速度和准确率之间自由切换。
高频操作成本更低 : effort="low" 只运行 16 层,并采用候选感知输出投影,适合滚动、点击下一步等高频决策。
关键动作更可靠 : effort="high" 执行完整网络深度,适合支付确认、权限审批等高风险场景。
避免输出格式错误 :采用语言原生决策接口,将输出约束在预定义候选集合内,消除 JSON 格式幻觉。
业务迁移能力强 :同一模型可通过自然语言描述适配浏览器操作、客服分流、规则审核等不同任务。
APUS-OpenJev-v1的项目地址
HuggingFace模型库 :https://huggingface.co/apus-ailab/APUS-OpenJev-v1
APUS-OpenJev-v1的同类竞品对比
对比维度 | APUS-OpenJev-v1 | Jev
对比维度 | APUS-OpenJev-v1 | Jev |
|---|---|---|
产品性质 | APUS AI Lab 开源的“System 1”决策大模型 | TypeSafe AI 推出的商业闭源决策 API |
开放程度 | 模型权重、运行时、部署脚本及技术报告开放 | 仅以云端 API 提供服务,核心模型不开源 |
模型规格 | 提供 4B、9B 及 35B-A3B 等版本 | 官方未公开完整模型规模和版本细节 |
决策准确率 | 9B 在官方 80 题冻结基准中达到 85.00% | 官方 API 同基准结果为 82.50% |
响应延迟 | 指定本地部署路径下,9B P50 为 25.58ms | 公网 API 实测 P50 为 280.80ms |
计算模式 | 原生支持 | 未公开类似的可调节计算深度机制 |
部署方式 | 支持本地、私有算力及 vLLM 服务化部署 | 主要依赖云端 API 调用 |
输出方式 | 可输出候选动作,也能生成表单和搜索文本 | 主要面向结构化动作决策,公开信息未明确文本生成能力 |
隐私与数据控制 | 数据可完全留在本地或企业私有环境 | 请求需发送至云端,数据控制依赖服务商方案 |
成本模式 | 自部署后主要承担硬件和推理成本 | 按商业 API 调用计费,并产生持续订阅或流量成本 |
APUS-OpenJev-v1的应用场景
浏览器自动化 :根据网页 DOM、按钮和输入框信息,快速决定点击、滚动或跳转等下一步操作。
企业流程路由 :在审批、工单处理或表单流转中,根据业务规则自动选择提交、退回、转交等处理路径。
客服工单分配 :结合用户问题、历史信息和候选处理部门,实时判断最合适的客服团队或处理动作。
金融与合规审核 :对高风险操作使用 effort="high" 深度判断,识别异常交易、权限风险或违规数据流向。
端侧智能助手 :将轻量模型部署在本地设备或私有服务器上,为高频 Agent 任务提供低延迟、保护隐私的决策能力。