首页/ 资讯/ Qwen3.8-Flash 阿里通义推出的多模态 MoE 模型

Qwen3.8-Flash 阿里通义推出的多模态 MoE 模型

灵犀编辑部 2026-08-27 0 阅读

Qwen3.8-Flash是什么

Qwen3.8-Flash 是阿里云通义千问推出的多模态 MoE 模型,总参数量 125B,每 token 仅激活 6B,原生支持 262K 上下文。模型采用 GDN+QSA 混合注意力、门控残差、N-gram 嵌入及 Muon 优化器四大架构创新,训练成本仅为 Qwen3.7-Plus 的 1/9,在编码和办公任务上能力更强。

Qwen3.8-Flash

Qwen3.8-Flash的主要功能

  • 超长上下文处理 :原生支持 262K tokens,可扩展至 1M,胜任长文档与代码库分析。
  • 代码智能体 :支持端到端软件工程任务,包括代码生成、调试与多语言开发。
  • 办公自动化 :执行长程办公流程与专业工作任务,集成工具调用能力。
  • 多模态理解 :理解长视频、科学图表、视觉数学问题及现实世界场景。
  • 设备与界面操控 :通过视觉感知操控网页、Android 设备及桌面操作系统。
  • 推理与问答 :覆盖科学推理、竞技编程、指令遵循与多学科综合推理。

Qwen3.8-Flash的技术原理

  • GDN + QSA Hybrid Attention :模型在每四层中安排三层 Gated DeltaNet 和一层 Qwen Sparse Attention,实现高效记忆 + 精准查找的混合注意力机制,在 1M 上下文下 Prefill 吞吐达到前代的 8.6 倍。
  • Gated Residual(GR) :将传统单一残差流扩展为四条并行分支,通过动态门控控制各层信息的读写比例,保留长距离信息通道,抑制激活异常值,同时支持 FP8 存储大幅降低访存开销。
  • N-gram Embedding :在常规词嵌入之外,引入 51B 参数的 N-gram 嵌入层,结合局部上下文查表捕捉短语搭配模式;该层可卸载至 Host Memory 并通过异步预取与计算重叠,几乎不增加 token 级计算量。
  • Muon Optimizer :针对主要线性映射权重采用 Muon 正交化优化,对 Embedding 和 Router 等保留 AdamW;重新拟合 Scaling Law 后支持更大学习率与批次,取消无效的 Batch Size Warmup 策略。
挖挖<a class=GitHub" loading="lazy" />

如何使用Qwen3.8-Flash

开源权重部署 :从 Hugging Face 下载 Qwen3.8-Flash-Next 权重,在本地或云端进行推理部署。

API 服务调用 :通过千问AI平台调用官方 API,输入 1 元/百万 tokens、输出 3 元/百万 tokens。 千问办公使用 :在千问办公中直接体验,用于长文档处理、代码生成与办公自动化任务。 查阅技术报告 :访问 GitHub 仓库中的技术报告,了解架构细节与训练方法以进行深度定制。

Qwen3.8-Flash的核心优势

  • 极致成本效率 :训练开销仅为 Qwen3.7-Plus 的 1/9,API 定价输入 1 元/百万 tokens,用极低算力成本实现旗舰级性能。
  • 超长上下文领先 :原生 262K 可扩展至 1M tokens,1M 上下文下 Prefill 吞吐达到前代的 8.6 倍,长序列处理速度与精度兼具。
  • Agent 与编码能力突出 :在代码智能体、软件工程、长程办公任务等多项基准上显著超越同级模型,胜任复杂生产级开发工作。
  • 下一代架构创新 :采用 GDN+QSA 混合注意力、门控残差与 N-gram 嵌入等全新设计,是 Qwen4 系列架构的提前验证版。
  • 多模态操控能力 :支持长视频理解、视觉网页开发、Android 及桌面设备操控,实现真正的多模态智能体交互。
  • 开源与工程友好 :Flash-Next 权重已开源,GR 支持 FP8、N-gram 嵌入可卸载至 Host Memory,降低部署门槛与显存占用。

Qwen3.8-Flash的项目地址

  • 项目官网 :https://qwen.ai/blog?id=qwen3.8-flash-next
  • HuggingFace模型库 :https://huggingface.co/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921FsyOPefile=Qwen3.8-Flash-Next
  • 技术论文 :https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf

Qwen3.8-Flash的同类竞品对比

>
对比维度 Qwen3.8-Flash-Next DeepSeek-V4-Flash Claude-Opus-4.6
总参数量 125B + 51B N-gram 284B
激活参数 6B 13B
Agentic Coding (DeepSWE 1.1) 58.7 54.4
SWE-bench Pro 62.5 56.0 53.4
多语言软件工程 81.0 77.5
长程办公 (CoWorkBench) 73.9 45.1 68.2
专业工作 (JobBench) 55.7 41.3 36.6
科学推理 (GPQA Diamond) 91.7 90.8 91.3
竞技编程 (LiveCodeBench) 91.9 90.6 88.8
指令遵循 (IFBench) 81.3 79.2 62.5
多模态工具 (ClawEval-MM) 64.4 / 60.4 52.5 / 54.7
移动操控 (AndroidWorld) 84.5 62.0
计算机使用 (OSWorld 2.0) 19.4 / 52.3
视觉网页开发 (Vision2Web) 64.0
具身智能 (ERQA) 72.3 40.8
长视频理解 (LVBench) 76.6 63.0
视觉数学 (MathVision w/ CI) 95.7 65.5
科学图表分析 (CharXiv w/ CI) 90.6 66.0

Qwen3.8-Flash的应用场

超长文档与知识库智能分析 :用 1M tokens 超长上下文,对整本技术手册、法律合同或大型代码库进行一次性深度理解与问答,无需分段处理。

相关工具
与本文相关的 AI 工具
AI 智能推荐 ×
输入关键词,AI 从 1000+ 工具中精准匹配推荐