Startlux-Decision StartLux Labs 开源的决策模型家族
Startlux-Decision是什么
StartLux-Decision 是 StartLux Labs 推出的决策模型家族,包含 0.8B 至 27B 五个稠密模型和 35B-A3B 混合专家模型。StartLux-Decision 接收文本、JSON 或图片形式的状态,针对选择、是非、评分等类型问题,单次前向推理即返回每个选项的概率,可作为置信度使用。模型原生支持 256K token 长上下文,毫秒级延迟,兼容 Jev 的 TypeSafe 客户端格式。

Startlux-Decision的主要功能
类型化决策 :支持选择题、是非题、评分题三种问题类型,每个问题返回各选项的概率分布。
多模态输入 :状态可以是文本、JSON 或图片(2026-10-03 更新),证据与图片可作为请求一部分。
超长上下文 :所有尺寸模型原生支持 262,144 token(256K)提示长度,长状态分块读取一次。
置信度输出 :概率直接用作置信度,适合需要风险量化的自动化流程。
高吞吐低延迟 :短问题单次前向仅几毫秒,支持批量推理(batched path)和 CUDA Graphs 加速。
全平台部署 :提供 GGUF 量化(BF16/Q8_0/Q4_K_M)用于 llama.cpp,Apple Silicon 上可用 MLX 后端。
游戏与智能体应用 :已验证于网页购物、国际象棋、超级马里奥、星际争霸 II、Doom 等实时决策场景。
Jev 生态兼容 :请求响应采用 TypeSafe /v1/systemone 格式,为 Jev 编写的客户端可无缝接入。
Startlux-Decision的技术原理
单次前向读答案 :模型将选项渲染为字母标记,答案从 forward pass 后的选项字母位置直接读出概率,一个请求的所有问题在单次前向中并行完成。
线性注意力架构 :采用 flash-linear-attention 与 causal-conv1d 快速内核,短请求延迟极低,且服务器在无这些内核的 GPU 上拒绝启动保证性能。
MoE 分组矩阵乘 :35B-A3B 混合专家模型每个 token 仅激活约 3B 参数,专家用 grouped matmul 运行并被 CUDA Graphs 覆盖,延迟约为 27B 稠密模型的一半。
长输入分块与分支 :256K 长状态按块读取一次,请求中每个问题从其表示分支计算,避免重复编码。
概率保真量化 :GGUF 的 BF16 与 Q8_0 在 99–100% 的 JevBench 项目上给出与原权重完全相同的决策,说明决策能力对量化高度鲁棒。
如何使用Startlux-Decision
下载权重 :通过 hf download startlux-models/StartLux-Decision-4B --local-dir StartLux-Decision-4B 从 Hugging Face 下载。
安装依赖 :进入模型目录执行 pip install -r requirements.txt 。
验证内核 :运行 python -m startlux_decision.check StartLux-Decision-4B ,必须输出 fast kernels: active。
启动服务 :执行 python -m startlux_decision.server --model StartLux-Decision-4B --port 8090 启动本地推理服务。
发送请求 :向 localhost:8090/v1/systemone 发送 JSON,包含 state 和 questions (choice / noul / score 类型)。
获取结果 :响应返回每个问题各选项的概率分布,可直接作为决策置信度使用。
GGUF 方式(可选) :下载对应 GGUF 仓库后,先启动 llama-server ,再运行 python -m startlux_decision.gguf_server 在 llama.cpp 前提供决策服务。
Startlux-Decision的核心优势
概率化决策 :每个问题直接返回各选项概率,置信度天然可用,无需额外校准。
极快延迟 :单次前向即出答案,4B 模型仅 26ms、35B-A3B 仅 52.5ms。
全面领先基准 :Decision Index 0.2.1 达 63.88,超越 Jev 1.13等所有公开对手。
超长上下文 :全系列原生支持 256K token 输入,长文档只读一次。
多模态证据 :所有尺寸均可读取图片作为决策依据。
同级全面胜出 :从 0.8B 到 35B 每个档位都优于相近规模的竞品模型。
Jev 生态兼容 :采用 TypeSafe /v1/systemone 格式,为 Jev 编写的客户端零改动接入。
Startlux-Decision的项目地址
GitHub仓库 :https://github.com/StartLuxLabs/Startlux-Decision
HuggingFace模型库 :https://huggingface.co/collections/startlux-models/startlux-decision-6abba92b301b573fa154d493
Startlux-Decision的同类竞品对比
对比维度 | StartLux-Decision | Jev
对比维度 | StartLux-Decision | Jev |
|---|---|---|
产品定位 | 类型化决策模型(0.8B–35B 家族) | 通用决策系统 |
Decision Index 0.2.1 | 63.88 | 57.91 |
JevBench public(231 题) | 208 题 | 199 题 |
延迟(3 问题单次请求) | 102.3 ms(H200,本机) | 64.0 ms(API 网关);端到端 109.7 ms |
上下文长度 | 262,144 token(256K) | 未公开/较短 |
图像输入 | 支持(全尺寸) | 未提及 |
38 项基准对比 | 31 项胜出 | 7 项胜出 |
输出形式 | 每选项概率分布(置信度) | 选项答案 |
对战胜率 | 256 局国际象棋 58.4%(+59 Elo) | 41.6% |
权重开放 | HF + ModelScope,CC BY-NC 4.0 | 封闭 API |
部署方式 | 自托管 + GGUF + MLX | 仅云端 API |
Startlux-Decision的应用场景
智能客服分单 :输入工单文本或图片,单次请求判断处理团队、加急与否及严重程度,选项概率即置信度。
电脑操作自动化 :驱动真实浏览器逐步选择控件并判断任务是否完成,已演示自动完成网页下单购物。
游戏 AI 决策 :单次前向输出走子、建造、射击等动作概率,已验证于国际象棋、星际争霸 II、Doom 等游戏。
金融风控与合规 :覆盖合同条款核查、金融实体识别与钓鱼邮件甄别,置信度可直接用于风控流程。
企业检索与分类 :毫秒级延迟完成意图识别、查询分类和 RAG 事实核查,适合高并发业务场景。