首页/ 资讯/ Startlux-Decision StartLux Labs 开源的决策模型家族

Startlux-Decision StartLux Labs 开源的决策模型家族

拆宝 2026-10-08 2 阅读

Startlux-Decision是什么

StartLux-Decision 是 StartLux Labs 推出的决策模型家族,包含 0.8B 至 27B 五个稠密模型和 35B-A3B 混合专家模型。StartLux-Decision 接收文本、JSON 或图片形式的状态,针对选择、是非、评分等类型问题,单次前向推理即返回每个选项的概率,可作为置信度使用。模型原生支持 256K token 长上下文,毫秒级延迟,兼容 Jev 的 TypeSafe 客户端格式。

StartLux-Decision

Startlux-Decision的主要功能

  • 类型化决策 :支持选择题、是非题、评分题三种问题类型,每个问题返回各选项的概率分布。

  • 多模态输入 :状态可以是文本、JSON 或图片(2026-10-03 更新),证据与图片可作为请求一部分。

  • 超长上下文 :所有尺寸模型原生支持 262,144 token(256K)提示长度,长状态分块读取一次。

  • 置信度输出 :概率直接用作置信度,适合需要风险量化的自动化流程。

  • 高吞吐低延迟 :短问题单次前向仅几毫秒,支持批量推理(batched path)和 CUDA Graphs 加速。

  • 全平台部署 :提供 GGUF 量化(BF16/Q8_0/Q4_K_M)用于 llama.cpp,Apple Silicon 上可用 MLX 后端。

  • 游戏与智能体应用 :已验证于网页购物、国际象棋、超级马里奥、星际争霸 II、Doom 等实时决策场景。

  • Jev 生态兼容 :请求响应采用 TypeSafe /v1/systemone 格式,为 Jev 编写的客户端可无缝接入。

Startlux-Decision的技术原理

  • 单次前向读答案 :模型将选项渲染为字母标记,答案从 forward pass 后的选项字母位置直接读出概率,一个请求的所有问题在单次前向中并行完成。

  • 线性注意力架构 :采用 flash-linear-attention 与 causal-conv1d 快速内核,短请求延迟极低,且服务器在无这些内核的 GPU 上拒绝启动保证性能。

  • MoE 分组矩阵乘 :35B-A3B 混合专家模型每个 token 仅激活约 3B 参数,专家用 grouped matmul 运行并被 CUDA Graphs 覆盖,延迟约为 27B 稠密模型的一半。

  • 长输入分块与分支 :256K 长状态按块读取一次,请求中每个问题从其表示分支计算,避免重复编码。

  • 概率保真量化 :GGUF 的 BF16 与 Q8_0 在 99–100% 的 JevBench 项目上给出与原权重完全相同的决策,说明决策能力对量化高度鲁棒。

如何使用Startlux-Decision

  • 下载权重 :通过 hf download startlux-models/StartLux-Decision-4B --local-dir StartLux-Decision-4B 从 Hugging Face 下载。

  • 安装依赖 :进入模型目录执行 pip install -r requirements.txt 。

  • 验证内核 :运行 python -m startlux_decision.check StartLux-Decision-4B ,必须输出 fast kernels: active。

  • 启动服务 :执行 python -m startlux_decision.server --model StartLux-Decision-4B --port 8090 启动本地推理服务。

  • 发送请求 :向 localhost:8090/v1/systemone 发送 JSON,包含 state 和 questions (choice / noul / score 类型)。

  • 获取结果 :响应返回每个问题各选项的概率分布,可直接作为决策置信度使用。

  • GGUF 方式(可选) :下载对应 GGUF 仓库后,先启动 llama-server ,再运行 python -m startlux_decision.gguf_server 在 llama.cpp 前提供决策服务。

Startlux-Decision的核心优势

  • 概率化决策 :每个问题直接返回各选项概率,置信度天然可用,无需额外校准。

  • 极快延迟 :单次前向即出答案,4B 模型仅 26ms、35B-A3B 仅 52.5ms。

  • 全面领先基准 :Decision Index 0.2.1 达 63.88,超越 Jev 1.13等所有公开对手。

  • 超长上下文 :全系列原生支持 256K token 输入,长文档只读一次。

  • 多模态证据 :所有尺寸均可读取图片作为决策依据。

  • 同级全面胜出 :从 0.8B 到 35B 每个档位都优于相近规模的竞品模型。

  • Jev 生态兼容 :采用 TypeSafe /v1/systemone 格式,为 Jev 编写的客户端零改动接入。

Startlux-Decision的项目地址

  • GitHub仓库 :https://github.com/StartLuxLabs/Startlux-Decision

  • HuggingFace模型库 :https://huggingface.co/collections/startlux-models/startlux-decision-6abba92b301b573fa154d493

Startlux-Decision的同类竞品对比

对比维度 | StartLux-Decision | Jev

对比维度

StartLux-Decision

Jev

产品定位

类型化决策模型(0.8B–35B 家族)

通用决策系统

Decision Index 0.2.1

63.88

57.91

JevBench public(231 题)

208 题

199 题

延迟(3 问题单次请求)

102.3 ms(H200,本机)

64.0 ms(API 网关);端到端 109.7 ms

上下文长度

262,144 token(256K)

未公开/较短

图像输入

支持(全尺寸)

未提及

38 项基准对比

31 项胜出

7 项胜出

输出形式

每选项概率分布(置信度)

选项答案

对战胜率

256 局国际象棋 58.4%(+59 Elo)

41.6%

权重开放

HF + ModelScope,CC BY-NC 4.0

封闭 API

部署方式

自托管 + GGUF + MLX

仅云端 API

Startlux-Decision的应用场景

  • 智能客服分单 :输入工单文本或图片,单次请求判断处理团队、加急与否及严重程度,选项概率即置信度。

  • 电脑操作自动化 :驱动真实浏览器逐步选择控件并判断任务是否完成,已演示自动完成网页下单购物。

  • 游戏 AI 决策 :单次前向输出走子、建造、射击等动作概率,已验证于国际象棋、星际争霸 II、Doom 等游戏。

  • 金融风控与合规 :覆盖合同条款核查、金融实体识别与钓鱼邮件甄别,置信度可直接用于风控流程。

  • 企业检索与分类 :毫秒级延迟完成意图识别、查询分类和 RAG 事实核查,适合高并发业务场景。

相关工具
与本文相关的 AI 工具
AI 智能推荐 ×
输入关键词,AI 从 1000+ 工具中精准匹配推荐