Hy-MT2-1.8B 腾讯混元推出的端侧翻译大模型
Hy-MT2-1.8B是什么
Hy-MT2-1.8B 是腾讯混元推出的端侧翻译大模型,仅 1.8B 参数却支持 33 个语种互译,翻译质量在 FLORES-200 等基准上超越微软、豆包等商业 API。模型通过 2-bit(574MB)与 1.25-bit(440MB)极致量化,可在手机、PC 端本地流畅运行,已落地哔哩哔哩直播弹幕实时翻译,实现低成本、高隐私的端侧高质量翻译。

Hy-MT2-1.8B的主要功能
33 语种互译 :覆盖中英日韩等主流语言及少数民族语言,支持任意方向互译。
端侧本地运行 :通过极低比特量化将模型压缩至 440~574MB,普通手机与 PC 均可常驻后台。
实时翻译 :单条弹幕 500~800ms 响应,已接入哔哩哔哩直播弹幕等高频场景。
隐私保护 :翻译全程在设备本地完成,无需上传云端,数据不出端。
Hy-MT2-1.8B的技术原理
2-bit 极致量化 :采用拉伸弹性量化(SEQ)将参数量化至 {-1.5, -0.5, 0.5, 1.5} 四个离散值,结合量化感知蒸馏(QAD)在压缩至 574MB 的同时保持几乎无损的翻译质量。
1.25-bit 稀疏量化(Sherry) :混元自研的 ACL 2026 Oral 方案,核心为细粒度稀疏策略——每 4 个参数中保留 3 个 ±1、1 个置 0,平均每个参数仅需 1.25-bit;配合专为 CPU 设计的 STQ 内核,模型体积降至 440MB,可常驻后台运行。
x86 算子适配优化 :英特尔团队针对低比特格式优化向量化、权重重排与 VNNI 指令融合,使 Q2_0C 与 STQ 在主流酷睿处理器上的 token 吞吐分别提升约 2.7 倍和 5 倍,将极低 bit 方案从移动端扩展到 PC 与边缘设备。
如何使用Hy-MT2-1.8B
下载模型权重 :访问 Hugging Face 仓库 huggingface.co/collections/AngelSlim/hy-low-bit-model ,下载 2-bit 或 1.25-bit 量化后的模型文件。
获取推理框架 :从 GitHub 克隆 github.com/tencent/AngelSlim 完整代码,该仓库包含极低比特量化的推理内核与加载逻辑。
加载与推理 :用 AngelSlim 框架加载下载的权重,在本地 CPU 上执行翻译推理;x86 设备可调用英特尔优化后的 VNNI 指令集内核以获得最佳性能。
Hy-MT2-1.8B的核心优势
体积极小质量极高 :1.8B 参数经 2-bit / 1.25-bit 量化后仅 440~574MB,翻译质量却超越微软、豆包等商业 API。
端侧隐私优先 :翻译全程在设备本地完成,无需联网上传,彻底杜绝数据泄露风险。
跨平台无缝运行 :同时适配 ARM 移动端与 x86 PC 端,经英特尔算子优化后在酷睿处理器上吞吐提升 2.7~5 倍。
真实场景已落地 :已接入哔哩哔哩直播弹幕实时翻译,单条 500~800ms 响应,能准确处理网络流行语。
多语种全覆盖 :原生支持 33 个语种互译,涵盖主流语言及少数民族语言,满足全球化沟通需求。
Hy-MT2-1.8B的项目地址
GitHub仓库 :https://github.com/Tencent-Hunyuan/Hy-MT2
HuggingFace模型库 :https://huggingface.co/collections/AngelSlim/hy-low-bit-model
Hy-MT2-1.8B的同类竞品对比
对比维度 | Hy-MT2-1.8B | Google TranslateGemma-4B
对比维度 | Hy-MT2-1.8B | Google TranslateGemma-4B |
|---|---|---|
参数规模 | 1.8B | 4B |
支持语种 | 33 个语种互译 + 5 种民族语言/方言 | 覆盖主流语言对 |
端侧体积 | 440MB (1.25-bit) / 574MB (2-bit) | ~2GB+ (原生 FP16,需自行量化压缩) |
核心量化技术 | Sherry 1.25-bit 细粒度稀疏量化(ACL 2026 Oral) | 无官方量化方案,需依赖第三方工具 |
翻译质量 | FLORES-200 整体优于微软、豆包等商业 API | 接近研究级水平,4B 版为移动端效果妥协版 |
推理框架 | AngelSlim(自研,含 x86 VNNI 优化内核) | 需借助 TensorFlow Lite、ExecuTorch 等通用框架 |
商业落地 | 已接入哔哩哔哩直播弹幕实时翻译 | 主要用于研究/开发者实验,无大规模商业集成 |
开源协议 | 权重+代码全开源 | Apache 2.0 开源,可自由商用 |
Hy-MT2-1.8B的应用场景
直播弹幕实时翻译 :已落地哔哩哔哩,单条 500~800ms 响应,可准确翻译网络流行语与梗。