首页/ 资讯/ Qwen3.8-Flash 阿里通义推出的多模态 MoE 模型

Qwen3.8-Flash 阿里通义推出的多模态 MoE 模型

拆宝 2026-08-27 60 阅读

Qwen3.8-Flash是什么

Qwen3.8-Flash 是阿里云通义千问推出的多模态 MoE 模型,总参数量 125B,每 token 仅激活 6B,原生支持 262K 上下文。模型采用 GDN+QSA 混合注意力、门控残差、N-gram 嵌入及 Muon 优化器四大架构创新,训练成本仅为 Qwen3.7-Plus 的 1/9,在编码和办公任务上能力更强。

Qwen3.8-Flash

Qwen3.8-Flash的主要功能

  • 超长上下文处理 :原生支持 262K tokens,可扩展至 1M,胜任长文档与代码库分析。

  • 代码智能体 :支持端到端软件工程任务,包括代码生成、调试与多语言开发。

  • 办公自动化 :执行长程办公流程与专业工作任务,集成工具调用能力。

  • 多模态理解 :理解长视频、科学图表、视觉数学问题及现实世界场景。

  • 设备与界面操控 :通过视觉感知操控网页、Android 设备及桌面操作系统。

  • 推理与问答 :覆盖科学推理、竞技编程、指令遵循与多学科综合推理。

Qwen3.8-Flash的技术原理

  • GDN + QSA Hybrid Attention :模型在每四层中安排三层 Gated DeltaNet 和一层 Qwen Sparse Attention,实现高效记忆 + 精准查找的混合注意力机制,在 1M 上下文下 Prefill 吞吐达到前代的 8.6 倍。

  • Gated Residual(GR) :将传统单一残差流扩展为四条并行分支,通过动态门控控制各层信息的读写比例,保留长距离信息通道,抑制激活异常值,同时支持 FP8 存储大幅降低访存开销。

  • N-gram Embedding :在常规词嵌入之外,引入 51B 参数的 N-gram 嵌入层,结合局部上下文查表捕捉短语搭配模式;该层可卸载至 Host Memory 并通过异步预取与计算重叠,几乎不增加 token 级计算量。

  • Muon Optimizer :针对主要线性映射权重采用 Muon 正交化优化,对 Embedding 和 Router 等保留 AdamW;重新拟合 Scaling Law 后支持更大学习率与批次,取消无效的 Batch Size Warmup 策略。

如何使用Qwen3.8-Flash

开源权重部署 :从 Hugging Face 下载 Qwen3.8-Flash-Next 权重,在本地或云端进行推理部署。

API 服务调用 :通过千问AI平台调用官方 API,输入 1 元/百万 tokens、输出 3 元/百万 tokens。 千问办公使用 :在千问办公中直接体验,用于长文档处理、代码生成与办公自动化任务。 查阅技术报告 :访问 GitHub 仓库中的技术报告,了解架构细节与训练方法以进行深度定制。

Qwen3.8-Flash的核心优势

  • 极致成本效率 :训练开销仅为 Qwen3.7-Plus 的 1/9,API 定价输入 1 元/百万 tokens,用极低算力成本实现旗舰级性能。

  • 超长上下文领先 :原生 262K 可扩展至 1M tokens,1M 上下文下 Prefill 吞吐达到前代的 8.6 倍,长序列处理速度与精度兼具。

  • Agent 与编码能力突出 :在代码智能体、软件工程、长程办公任务等多项基准上显著超越同级模型,胜任复杂生产级开发工作。

  • 下一代架构创新 :采用 GDN+QSA 混合注意力、门控残差与 N-gram 嵌入等全新设计,是 Qwen4 系列架构的提前验证版。

  • 多模态操控能力 :支持长视频理解、视觉网页开发、Android 及桌面设备操控,实现真正的多模态智能体交互。

  • 开源与工程友好 :Flash-Next 权重已开源,GR 支持 FP8、N-gram 嵌入可卸载至 Host Memory,降低部署门槛与显存占用。

Qwen3.8-Flash的项目地址

  • 项目官网 :https://qwen.ai/blog?id=qwen3.8-flash-next

  • HuggingFace模型库 :https://huggingface.co/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921FsyOPefile=Qwen3.8-Flash-Next

  • 技术论文 :https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf

Qwen3.8-Flash的同类竞品对比


对比维度

Qwen3.8-Flash-Next

DeepSeek-V4-Flash

Claude-Opus-4.6

总参数量

125B + 51B N-gram

284B

—

激活参数

6B

13B

—

Agentic Coding (DeepSWE 1.1)

58.7

54.4

—

SWE-bench Pro

62.5

56.0

53.4

多语言软件工程

81.0

—

77.5

长程办公 (CoWorkBench)

73.9

45.1

68.2

专业工作 (JobBench)

55.7

41.3

36.6

科学推理 (GPQA Diamond)

91.7

90.8

91.3

竞技编程 (LiveCodeBench)

91.9

90.6

88.8

指令遵循 (IFBench)

81.3

79.2

62.5

多模态工具 (ClawEval-MM)

64.4 / 60.4

—

52.5 / 54.7

移动操控 (AndroidWorld)

84.5

—

62.0

计算机使用 (OSWorld 2.0)

19.4 / 52.3

—

—

视觉网页开发 (Vision2Web)

64.0

—

—

具身智能 (ERQA)

72.3

—

40.8

长视频理解 (LVBench)

76.6

—

63.0

视觉数学 (MathVision w/ CI)

95.7

—

65.5

科学图表分析 (CharXiv w/ CI)

90.6

—

66.0

Qwen3.8-Flash的应用场

超长文档与知识库智能分析 :用 1M tokens 超长上下文,对整本技术手册、法律合同或大型代码库进行一次性深度理解与问答,无需分段处理。

相关工具
与本文相关的 AI 工具
AI 智能推荐 ×
输入关键词,AI 从 1000+ 工具中精准匹配推荐