Qwen3.8-Flash 阿里通义推出的多模态 MoE 模型
Qwen3.8-Flash是什么
Qwen3.8-Flash 是阿里云通义千问推出的多模态 MoE 模型,总参数量 125B,每 token 仅激活 6B,原生支持 262K 上下文。模型采用 GDN+QSA 混合注意力、门控残差、N-gram 嵌入及 Muon 优化器四大架构创新,训练成本仅为 Qwen3.7-Plus 的 1/9,在编码和办公任务上能力更强。

Qwen3.8-Flash的主要功能
- 超长上下文处理 :原生支持 262K tokens,可扩展至 1M,胜任长文档与代码库分析。
- 代码智能体 :支持端到端软件工程任务,包括代码生成、调试与多语言开发。
- 办公自动化 :执行长程办公流程与专业工作任务,集成工具调用能力。
- 多模态理解 :理解长视频、科学图表、视觉数学问题及现实世界场景。
- 设备与界面操控 :通过视觉感知操控网页、Android 设备及桌面操作系统。
- 推理与问答 :覆盖科学推理、竞技编程、指令遵循与多学科综合推理。
Qwen3.8-Flash的技术原理
- GDN + QSA Hybrid Attention :模型在每四层中安排三层 Gated DeltaNet 和一层 Qwen Sparse Attention,实现高效记忆 + 精准查找的混合注意力机制,在 1M 上下文下 Prefill 吞吐达到前代的 8.6 倍。
- Gated Residual(GR) :将传统单一残差流扩展为四条并行分支,通过动态门控控制各层信息的读写比例,保留长距离信息通道,抑制激活异常值,同时支持 FP8 存储大幅降低访存开销。
- N-gram Embedding :在常规词嵌入之外,引入 51B 参数的 N-gram 嵌入层,结合局部上下文查表捕捉短语搭配模式;该层可卸载至 Host Memory 并通过异步预取与计算重叠,几乎不增加 token 级计算量。
- Muon Optimizer :针对主要线性映射权重采用 Muon 正交化优化,对 Embedding 和 Router 等保留 AdamW;重新拟合 Scaling Law 后支持更大学习率与批次,取消无效的 Batch Size Warmup 策略。
GitHub" loading="lazy" />如何使用Qwen3.8-Flash
开源权重部署 :从 Hugging Face 下载 Qwen3.8-Flash-Next 权重,在本地或云端进行推理部署。
API 服务调用 :通过千问AI平台调用官方 API,输入 1 元/百万 tokens、输出 3 元/百万 tokens。 千问办公使用 :在千问办公中直接体验,用于长文档处理、代码生成与办公自动化任务。 查阅技术报告 :访问 GitHub 仓库中的技术报告,了解架构细节与训练方法以进行深度定制。
Qwen3.8-Flash的核心优势
- 极致成本效率 :训练开销仅为 Qwen3.7-Plus 的 1/9,API 定价输入 1 元/百万 tokens,用极低算力成本实现旗舰级性能。
- 超长上下文领先 :原生 262K 可扩展至 1M tokens,1M 上下文下 Prefill 吞吐达到前代的 8.6 倍,长序列处理速度与精度兼具。
- Agent 与编码能力突出 :在代码智能体、软件工程、长程办公任务等多项基准上显著超越同级模型,胜任复杂生产级开发工作。
- 下一代架构创新 :采用 GDN+QSA 混合注意力、门控残差与 N-gram 嵌入等全新设计,是 Qwen4 系列架构的提前验证版。
- 多模态操控能力 :支持长视频理解、视觉网页开发、Android 及桌面设备操控,实现真正的多模态智能体交互。
- 开源与工程友好 :Flash-Next 权重已开源,GR 支持 FP8、N-gram 嵌入可卸载至 Host Memory,降低部署门槛与显存占用。
Qwen3.8-Flash的项目地址
- 项目官网 :https://qwen.ai/blog?id=qwen3.8-flash-next
- HuggingFace模型库 :https://huggingface.co/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921FsyOPefile=Qwen3.8-Flash-Next
- 技术论文 :https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf
Qwen3.8-Flash的同类竞品对比
| 对比维度 | Qwen3.8-Flash-Next | DeepSeek-V4-Flash | Claude-Opus-4.6 |
|---|---|---|---|
| 总参数量 | 125B + 51B N-gram | 284B | — |
| 激活参数 | 6B | 13B | — |
| Agentic Coding (DeepSWE 1.1) | 58.7 | 54.4 | — |
| SWE-bench Pro | 62.5 | 56.0 | 53.4 |
| 多语言软件工程 | 81.0 | — | 77.5 |
| 长程办公 (CoWorkBench) | 73.9 | 45.1 | 68.2 |
| 专业工作 (JobBench) | 55.7 | 41.3 | 36.6 |
| 科学推理 (GPQA Diamond) | 91.7 | 90.8 | 91.3 |
| 竞技编程 (LiveCodeBench) | 91.9 | 90.6 | 88.8 |
| 指令遵循 (IFBench) | 81.3 | 79.2 | 62.5 |
| 多模态工具 (ClawEval-MM) | 64.4 / 60.4 | — | 52.5 / 54.7 |
| 移动操控 (AndroidWorld) | 84.5 | — | 62.0 |
| 计算机使用 (OSWorld 2.0) | 19.4 / 52.3 | — | — |
| 视觉网页开发 (Vision2Web) | 64.0 | — | — |
| 具身智能 (ERQA) | 72.3 | — | 40.8 |
| 长视频理解 (LVBench) | 76.6 | — | 63.0 |
| 视觉数学 (MathVision w/ CI) | 95.7 | — | 65.5 |
| 科学图表分析 (CharXiv w/ CI) | 90.6 | — | 66.0 |
Qwen3.8-Flash的应用场
超长文档与知识库智能分析 :用 1M tokens 超长上下文,对整本技术手册、法律合同或大型代码库进行一次性深度理解与问答,无需分段处理。
相关工具
与本文相关的 AI 工具