Clef Cloudflare 开源的决策模型家族
Clef是什么
Clef 是 Cloudflare 开源的决策模型家族,为上下文定调,再决定后续动作。与生成开放文本的聊天模型不同,Clef 是在请求里临时定义问题、为每个选项打出概率,让代码据此完成路由或拦截,无需为新增类别反复重训。Clef 家族中,27B 的 Clef 主打精度,9B 的 Clef-flash 快至 38.8 毫秒中位延迟,适合嵌进 Agent 的热路径。

Clef的主要功能
- 概率化决策 :输入 state 与类型化问题,输出每个选项的概率,代码可直接据此路由、拦截或升级人工。
- 三种问题类型 :支持 noul、choice、score,单次请求最多 64 问。
- 视觉分类 :内置 vision encoder,可嵌入最多 4 张图与文本一起打分。
- 64K 上下文 :可容纳长日志、工单、JSON 状态等更完整的输入。
- Jev API 兼容 :请求 schema 与 Jev 对齐,迁移时基本只改端点和模型名。
- 非自回归推理 :prefill 一次后对合法选项并行打分,不逐 token 生成文本,延迟远低于通用 LLM。
- 边缘托管低延迟 :依托 Workers AI 全球 GPU 网络,Clef 中位 209ms、Clef-flash 仅 38.8ms,可进热路径。
Clef的技术原理
- 非自回归决策架构 :Clef 先对输入做一次 prefill-only 前向计算,再对请求中定义的合法 schema 选项并行打分,直接从内部表示推导结构化结果。
- 两阶段注意力路由 :每个合法选项先从 prompt 中提取与自身相关的上下文,再让各字段参数互相 cross-attend、回连原始 payload 联合建模,配合 lexical prior 保持跨选项的语义一致性,最终把证据汇总为 schema 约束下的分数。
- 冻结底座 + 轻量适配 :底座为 Qwen3.8-27B和 Qwen3.5-9B,冻结主干,仅联合优化 routing head 与 rank-256 LoRA 适配器,用很小的可训练参数量获得决策能力,降低了训练和部署成本。
- 校准导向的训练目标 :post-training 采用 label-smoothed cross-entropy 保证输出落在合法 schema 内,叠加 Brier loss 专门校准概率,使输出的概率值本身可信。
- RLCD 强化学习 :自研 Reinforcement Learning for Calibrated Decisions 作为二级优化目标,对相邻序数选项给部分分、对精确命中给全分、加 reference penalty 防止分布漂移,提升准确率与泛化。
- 数据策略 :训练数据为内部合成数据集,通过置换字段顺序、prompt 与 schema 结构来增强泛化,使模型对问题写法不敏感、能适应请求时临时定义的新类别。

如何使用Clef
- 确认账号与权限 :注册 Cloudflare 账号,拿到 Account ID 和 API Token,开通 Workers AI。
- 选定模型 :按需求选 @cf/cloudflare/clef 或 @cf/cloudflare/clef-flash 。
- 构造请求体 :写好 model 、 state (文本/JSON 状态)和 questions (1–64 个 noul/choice/score 类型问题,criteria 边界写清)。
- 发起调用 :用 REST POST 到 /accounts/{id}/ai/run/@cf/cloudflare/clef ,或在 Worker 里通过 env.AI.run() 绑定调用。
- 解析概率结果 :从 response.answers 读取各问题的选项概率/加权分,用最高选项 + 概率阈值做路由或拦截。
- 接入图片(可选) :需要视觉判定时,将 PNG/JPEG/WebP 字节嵌入请求,不要传远程 URL。
- 上线前压测 :用自己的 state 长度和问题数实测延迟与准确率,再决定全量切换或按风险分流 flash/clef。
- 进阶微调(可选) :领域标签特殊时,经 AI Gateway 沉淀数据,走 FDE 团队的 RL 微调服务定制模型。
Clef的核心优势
- 速度快 :非自回归并行打分 + 边缘 GPU 托管,Clef 中位延迟 209ms、Clef-flash 仅 38.8ms,比 Jev 快 2.5×–13×,能进热路径。
- 精度高 :在 Jev Decision Index 上排名第一,官方 10 项决策基准中 7 项最高分,Typesafe 工作流评测 4 项赢 3 项。
- 免重训加类别 :类别在请求里临时定义,新增标签不用像传统分类器那样重训模型。
- 概率可校准 :Brier loss + RLCD 训练让输出概率本身可信,可直接设阈值做自动化决策。
- 原生多模态 :内置 vision encoder 可分类图像,而 Jev 目前只做文本。
- 上下文翻倍 :64K 上下文(Jev 为 32K),能塞进更长日志和状态。
- 迁移零成本 :Jev API 全兼容,换端点和模型名即可平滑替换。
Clef的项目地址
- 项目官网 :https://blog.cloudflare.com/clef-decision-models/
- HuggingFace模型库 : https://huggingface.co/Cloudflare/clef
- https://huggingface.co/Cloudflare/clef-flash
Clef的同类竞品对比
维度 | Clef / Clef-flash(Cloudflare) | Jev (Typesafe AI)
| 维度 | Clef / Clef-flash(Cloudflare) | Jev (Typesafe AI) |
|---|---|---|
| 品类定位 | 决策模型(概率化分类、Jev API 兼容) | 决策模型(品类开创者) |
| 上下文 | 64K | 32K |
| 视觉输入 | ✅ 内置 vision encoder(最多 4 张嵌入图) | ❌ 目前仅文本 |
| 中位延迟 | 209.3 ms / 38.8 ms | 524.1 ms |
| p95 延迟 | 238.6 ms / 122.4 ms | 536.0 ms |
| Jev Decision Index | 第一 | 参照基线 |
| 质量基准 | 10 项中 7 项最高分 | 多数项落后 |
| Typesafe 工作流评测 | 4 项赢 3 项(发票/客服/安全事件) | Agent 可观测性 1 项略高 |
| 问题定义方式 | 请求内临时定义,免重训加类别 | 同类机制(API 兼容) |
Clef的应用场景
- 客服工单分诊 :输入工单内容与截图,一次请求同时判定是否紧急、该路由到哪个团队、严重度评分,低置信度自动升级人工。
- 威胁情报与反钓鱼 :配合 Browser Run 抓取渲染网页,对域名/页面做多标签分类,官方实测全流程仅 2.2 秒。
- Bot 流量判定 :在网关热路径用 Clef-flash 快速判断爬虫是善意还是恶意,毫秒级拦截或放行。
- Agent 工具调用前置审查 :Agent 执行高风险操作前先问 Clef该不该做、用哪个工具,按概率阈值决定是否执行或请求确认。
相关工具
与本文相关的 AI 工具