首页/ 资讯/ Qwen3.8-27B-DFlash2 Inco AI 开源的投机解码草稿模型

Qwen3.8-27B-DFlash2 Inco AI 开源的投机解码草稿模型

灵犀编辑部 2026-08-25 11 阅读

Qwen3.8-27B-DFlash2是什么

Qwen3.8-27B-DFlash2 是 Inco AI 开源的投机解码草稿模型,专为 Qwen3.8-27B 设计。模型仅 1.92B 参数,通过块级并行预测、轻量路径选择器和双抽头动态卷积,在单次前向传播中并行生成整块 token 草稿。模型在 H200 单卡、SGLang 单并发下,吞吐达到自回归解码的 2.7–3.4 倍,平均接受长度 4.80,优于原生 MTP 与社区 DSpark,且解码结果无损。

图灵鉴 X

Qwen3.8-27B-DFlash2的主要功能

· 并行草稿生成 :作为 Qwen3.8-27B 的投机解码草稿模型,单次前向传播即可并行预测整块 token,取代传统逐 token 自回归草稿生成。

· 智能路径选择 :通过轻量路径选择器在每个位置的 top-16 候选中追踪出一条连贯路径,解决并行预测带来的 token 衔接不自然问题。

· 局部依赖建模 :用双抽头动态卷积专门建模块内相邻位置的局部依赖,显著缓解块尾位置的后缀衰减现象。

· 无损推理加速 :在 SGLang、vLLM、llama.cpp 等主流引擎上实现单并发 2.7–3.4 倍于自回归解码的吞吐,且严格保证解码输出无损。

Qwen3.8-27B-DFlash2的技术原理

· 块级并行草稿生成 :传统投机解码的草稿模型仍需自回归逐 token 生成,DFlash 将草稿过程也改为非自回归,通过一次前向传播并行预测整块内所有位置的 token。

· 轻量路径选择器 :由于各位置独立预测的 top-1 候选未必彼此连贯,选择器保留每位置的 top-16 候选,对所有相邻候选对并行打分(基于低秩双线性注意力与上下文门控),通过贪心或采样从最后一个已验证 token 出发追踪最佳后继路径,仅增加 2M 参数即可将接受长度提升约 0.4 个 token。

· 双抽头动态卷积 :观察到深层注意力对块内依赖的投入持续衰减,团队在 Attention 与 MLP 子层前后插入内容自适应的双抽头动态深度卷积,每个位置混合自身表示与前驱表示,用极低成本(+3% 参数、+0.7% 延迟)承担块内局部建模,使注意力回归上下文读取,效果接近增加十层 Transformer。

如何使用Qwen3.8-27B-DFlash2

· 模型准备 :通过 ModelScope 分别下载 Qwen3.8-27B 目标模型与 Qwen3.8-27B-DFlash2 草稿模型到本地。

· SGLang 部署 :安装 sglang 后执行 sglang.launch_server ,指定 --speculative-algorithm DFLASH 及草稿模型路径即可启动加速服务。

· vLLM 部署 :安装对应版本 vLLM 后使用 vllm serve ,在 --speculative-config 中将 method 设为 dflash 并填入草稿模型名。

· llama.cpp 部署 :拉取并编译支持 DFlash 的 PR 分支,分别加载目标模型与草稿模型的 GGUF 文件,以 --spec-type draft-dflash 启动服务端。

· Apple Silicon :使用 oMLX 预编译包,在 Model Manager 中为目标模型开启 DFlash、指定草稿模型并将 Verify mode 设为 dflash。

· 命令行工具 :安装 dflash 包后,可直接通过 dflash generate 命令搭配 transformers、MLX 或 OpenAI 兼容后端运行推理与评测。

Qwen3.8-27B-DFlash2的核心优势

· 极小体积 :仅 1.92B 参数(约 3.85GB)的草稿模型,即可为 27B 目标模型提供显著加速,部署成本极低。

· 并行草稿 :突破传统自回归草稿限制,单次前向传播并行生成整块 token,大幅降低草稿阶段延迟。

· 无损加速 :在单卡 H200 上实现单并发 2.7–3.4 倍于自回归解码的吞吐,且通过严格验证保证输出结果完全无损。

· 精准选择 :轻量路径选择器以仅 2M 参数、0.6% 延迟开销,从 top-16 候选中追踪连贯路径,显著提升草稿接受率。

· 局部建模 :双抽头动态卷积以 3% 参数量专门建模块内依赖,有效缓解深层位置的后缀衰减,效果媲美增加十层 Transformer。

· 生态兼容 :已原生集成 SGLang、vLLM、llama.cpp、oMLX 等主流推理引擎,支持 NVIDIA 与 Apple Silicon 多平台部署。

Qwen3.8-27B-DFlash2的项目地址

· 项目官网 :https://inco.ai/blog/dflash2/

· GitHub仓库 :https://github.com/z-lab/dflash

Qwen3.8-27B-DFlash2的同类竞品对比

对比维度 | Qwen3.8-27B-DFlash2 | DSpark (社区草稿模型)

平均接受长度 | 4.80 | 3.62

GSM8K | 5.46 | 4.36

MATH-500 | 5.28 | 3.92

HumanEval | 4.39 | 3.30

MBPP | 4.79 | 3.51

MT-Bench | 4.10 | 3.01

草稿生成方式 | 一次前向、整块并行预测 | 自回归、逐 token 生成

连贯性修正机制 | 轻量路径选择器(top-16 候选选路) | 串行 head 重写全词表分布

额外参数开销 | +2.0M(选择器)/ +16.5M(卷积) | +77.8M

周期延迟开销 | +1.3% | +9.6%

单并发吞吐 | 自回归解码的 2.7–3.4× | 低于 DFlash 2(接受长度差距显著)

输出一致性 | 严格无损 | 严格无损

Qwen3.8-27B-DFlash2的应用场景

· AI Agent 服务 :大幅降低 Agent 长时运行中的逐 token 解码成本,支撑工具调用、任务规划等高吞吐执行流程。

· 实时对话系统 :单并发 2.7–3.4 倍加速显著降低响应延迟,提升聊天机器人与客服助手的交互体验。

· 代码生成助手 :在 HumanEval、MBPP 基准上接受长度领先,适合 IDE 插件与编程 Copilot 等需要快速补全的场景。

· 长文本创作 :高接受长度使每次验证产出更多 token,加速文章、报告、营销文案等长文档生成。

· 端侧本地部署 :1.92B 小体积配合 oMLX 与 llama.cpp 支持,可在 Apple Silicon 笔记本等设备上实现高效本地推理。

相关工具
与本文相关的 AI 工具
AI 智能推荐 ×
🎯 输入关键词,AI 从 1000+ 工具中精准匹配推荐