模型动态
模型动态
Qwen3.8-Flash 阿里通义推出的多模态 MoE 模型
Qwen3.8-Flash 是阿里云通义千问推出的多模态 MoE 模型,总参数量 125B,每 token 仅激活 6B,原生支持 262K 上下文。
2026-08-27
模型动态
GLM-5.3-Flash 智谱开源的原生多模态模型
GLM-5.3-Flash 是智谱最新推出的开源大模型,总参数三百二十亿,激活参数仅十八亿,为 GLM-5 系列首个原生多模态模型。模型综合智能指数达五十七分,与 Claude Opus 4.8 持平,定价仅为其四十分之一。
2026-08-27
模型动态
Breeze TTS 2 BreezeBlue 推出的新一代语音合成模型
Breeze TTS 2 是 BreezeBlue 推出的新一代语音合成模型,支持通过自然语言零样本设计角色音色,用自然语言指令精准控制情绪、语速、口音等表演细节。
2026-08-26
模型动态
PixVerse R2 爱诗科技推出的实时全模态世界模型
PixVerse R2 是爱诗科技推出的实时全模态世界模型,为PixVerse R1 的升级版本。模型支持文字、图像、音频及动作信号等多模态输入,能在运行中持续接收用户控制、实时更新世界状态并连续输出同步音视频。
2026-08-26
模型动态
Agnes 2.5 Pro Alpha Agnes AI 开源的多模态推理模型
Agnes 2.5 Pro Alpha 是 Agnes AI 开源的多模态推理模型,采用 Apache 2.0 协议,权重托管于 Hugging Face。模型支持文本与图像输入,上下文窗口达 1M tokens,擅长复杂代码生成、科学推理、长文档分析与 Agent 工作流。
2026-08-25
模型动态
FireRedTTS3 小红书开源的统一语音生成与编辑模型
FireRedTTS3 是小红书 FireRed 团队开源的统一语音生成与编辑模型。模型基于 RedAE 语义增强连续表示与 LLM-DiT 架构,单一模型可实现24 种语言 + 21 种中文方言的零样本音色克隆、自然语言描述的声音设计,以及指定区域的精准语音编辑。
2026-08-25
模型动态
Qwen3.8-27B-DFlash2 Inco AI 开源的投机解码草稿模型
Qwen3.8-27B-DFlash2 是 Inco AI 开源的投机解码草稿模型,专为 Qwen3.8-27B 设计。模型仅 1.92B 参数,通过块级并行预测、轻量路径选择器和双抽头动态卷积,在单次前向传播中并行生成整块 token 草稿。
2026-08-25
模型动态
FreeToken 开源端侧 MoE 大模型推理系统,支持满血运行
FreeToken 是 UC Berkeley 与 MIT 等机构联合开源的端侧 MoE 大模型推理系统。系统通过全层双缓冲、带宽自适应混合调度、Agent 状态复用及弹性显存热扩缩容等技术,将个人电脑的 CPU、内存、PCIe 与 GPU 统一为弹性计算平台。
2026-08-24
模型动态
Mage 微软开源的 4B 参数多模态模型家族
Mage 是微软开源的 4B 参数多模态模型家族,包含流式视频/图像理解模型 Mage-VL 与图像生成与编辑模型 Mage-Flow。Mage-VL 通过 Codec-Native 编码将视觉 Token 减少 75%,推理提速 3.5 倍,支持实时视频理解。
2026-08-22
模型动态
LLM-as-a-Verifier 斯坦福联合英伟达等开源的通用验证框架
LLM-as-a-Verifier 是斯坦福、UC 伯克利与 NVIDIA 研究院联合开源的通用验证框架。框架无需额外训练,通过用 LLM 评分 Token 的完整 logits 分布生成连续细粒度分数,替代传统离散评分。
2026-08-22
模型动态
Qwen-UI-Agent 阿里通义推出的 GUI 智能体基座模型
Qwen-UI-Agent 是阿里巴巴通义团队推出的 GUI 智能体基座模型,能在手机、电脑和网页端像真人一样操作界面。模型基于 100+ 台真机、150+ 应用训练,支持 GUI 与命令行混合执行,可完成跨应用长程任务。
2026-08-21 AI资讯
模型动态
SenseNova U1.5 Lite 商汤科技开源的原生统一多模态大模型
SenseNova U1.5 Lite 是商汤科技开源的轻量级原生统一多模态大模型,专为真实视觉创作流程设计。模型原生支持 3-4k 字符超长指令遵循,具备高质量视觉生成、可靠的图像编辑、精准文字排版、精细视觉控制及原生 4K 输出能力。
2026-08-21 AI资讯