首页/ 资讯/ Naive-N0.5-Flash NaiveAI 开源的首个 MoE 大模型

Naive-N0.5-Flash NaiveAI 开源的首个 MoE 大模型

拆宝 2026-10-09 0 阅读

Naive-N0.5-Flash是什么

Naive-N0.5-Flash 是 NaiveAI 开源的首个 MoE 大模型,定位编程与 AI 研发场景。Naive-N0.5-Flash 基于小米 MiMo-V2.5 基模改造,为 309B MoE 架构,采用 SWA+DSA 混合稀疏注意力,原生支持 1M 上下文且无全注意力层。模型由 AI 深度参与研发,配套推理系统 NaiveRT 单流解码峰值达 2122 tokens/s。

Naive-N0.5-Flash

Naive-N0.5-Flash的主要功能

  • 长上下文编程 :原生支持 1M token 上下文,可处理超长代码仓库与长程软件工程任务。

  • AI 研发辅助 :能读论文、复现方法、跑实验、分析结果,直接参与模型研发全流程。

  • 推理加速 :配套 NaiveRT 推理系统,标准模式 50 tokens/s,极速模式单流解码峰值达 2,122 tokens/s。

  • 自主科研 :可在给定目标、算力预算和评测协议后,端到端自主推进研究。

Naive-N0.5-Flash的技术原理

  • SWA–DSA 混合稀疏注意力 :模型基于 MiMo-V2.5 基模,将原本开销大的全局注意力层替换为 DeepSeek 稀疏注意力,与滑动窗口注意力按 5:1 交替堆叠,全网络无任何全注意力层。SWA 处理 128 token 局部窗口,DSA 由轻量索引器对全历史打分并选出 top-2048 token 供主干计算。

  • 轻量索引器设计 :将 DSA 原本的 MLA 改为 GQA,索引器查询头从 64 减至 16,使索引选择路径耗时降低 44%,同时在 1M 上下文的 Agent 任务上保持性能不衰减。

  • 三阶段训练流程 :先在 50B token 上冻结主干、用 KL 散度损失对齐索引器与全注意力分布;再切换稀疏注意力进行 3T token 继续预训练,适配新的信息选择机制并强化编程与研发能力;最后 200B token 监督微调并衰减学习率。全程维持 1M 上下文,AI 自动完成 top-k 召回分析与数值稳定性修复。

  • 混合序列并行与显存优化 :针对 SWA 只需局部窗口、DSA 需全历史的差异,分别采用 Halo 序列并行;显存侧将激活卸载粒度细化到算子级,显式保留 top-k 索引避免重计算改变选择,512 卡约 4 天可训 1T token。

  • NaiveRT 推理优化 :通过巨型算子融合、PDL 让上下流 kernel 重叠执行、投机解码循环完全在 GPU 上推进,将单轮解码延迟从 12.3ms 降至 3.4ms;且支持按随机种子逐位确定性采样,保证 RL 训练中采样与训练 logprob 一致。所有优化以端到端真实模型路径为准入标准。

如何使用Naive-N0.5-Flash

  • 确认硬件 :需要支持 FP8 的 NVIDIA GPU,模型权重约 315GB,需预留额外显存。

  • 获取权重 :从 Hugging Face 拉取 NaiveAI/Naive-N0.5-Flash-FP8 仓库。

  • 安装依赖 :执行 pip install "transformers[torch,kernels]=5.17.0" 。

  • 加载模型 :用 AutoTokenizer 和 AutoModelForCausalLM 以 trust_remote_code=True 、 device_map="auto" 方式加载。

  • 构造输入 :通过 apply_chat_template 传入对话消息并生成输入张量。

  • 生成结果 :调用 model.generate() 生成回复,再用 tokenizer.decode() 解码输出。

  • 设置参数 :通用场景推荐 temperature=1.0、top_p=0.95。

  • 复现高性能推理 :如需 2,122 tokens/s 速度,可获取 NaiveRT 开源代码、Docker Compose 环境和配套基准脚本自行部署。

Naive-N0.5-Flash的核心优势

  • 超长上下文 :原生支持 1M token 上下文,且全网络无全注意力层,长序列解码开销远低于常规架构。

  • 推理速度顶尖 :配套 NaiveRT 系统单流解码峰值达 2,122 tokens/s,投机解码延迟较 SGLang 降低 72.4%。

  • 研发能力突出 :PaperBench 63.2、MLE-bench-30 73.7%、NanoGPT SpeedRun 73.8s,多项 AI 研发评测超越同级模型。

  • AI 原生研发 :模型由 AI 参与架构设计与系统优化,是人类设定目标、AI 执行迭代的AI 研发 AI范式落地。

  • 自主科研潜力 :给定目标与预算后可端到端自主完成研究,400 小时训出 AutoWM 世界模型并登顶 WorldArena。

Naive-N0.5-Flash的项目地址

  • 项目官网 :https://naive.ai/en/research/

  • GitHub仓库 :https://github.com/NaiveAI-Labs/Naive-N0.5-Flash

  • HuggingFace模型库 :https://huggingface.co/NaiveAI/Naive-N0.5-Flash

Naive-N0.5-Flash的同类竞品对比

对比维度 | Naive-N0.5-Flash | DeepSeek-V4.1-Flash

对比维度

Naive-N0.5-Flash

DeepSeek-V4.1-Flash

架构

309B MoE,SWA+DSA 混合稀疏注意力,无全注意力层

MoE(具体稀疏架构以官方披露为准)

总参数 / 激活参数

309B / 15.5B

官方披露(Flash 系列定位轻量激活)

上下文长度

原生 1M tokens

以官方披露为准

推理速度

NaiveRT 单流峰值 2,122 tokens/s,投机解码 3.4ms/轮

常规推理栈,无同等级单流优化数据

NL2Repo 得分

71.9(高于对方)

低于 71.9

研发定位

专为 AI 研发训练,PaperBench 63.2、MLE-bench-30 73.7%

通用编程模型,研发专项评测数据较少

研发模式

AI 参与架构设计与系统优化(AI4AI / RSI 路线)

传统人类主导研发

Naive-N0.5-Flash的应用场景

  • AI 研发助手 :辅助研究员读论文、复现方法、跑实验与分析结果,如 PaperBench、MLE-bench 类研发任务。

  • 长程软件工程 :凭借原生 1M 上下文处理大型代码仓库,完成跨文件理解、Bug 修复与仓库级代码生成。

  • 长上下文 Agent 任务 :在终端操作、多轮工具调用等长交互场景中保持完整任务历史。

  • RL 训练基础设施 :配合 NaiveRT 的高单流解码速度与逐位确定性采样,加速长程强化学习 rollout,减少掉队样本。

相关工具
与本文相关的 AI 工具
AI 智能推荐 ×
输入关键词,AI 从 1000+ 工具中精准匹配推荐