CMMLU

一个综合性的大模型中文评估基准
分类:AI模型评测 更新:2026-08-13 热度:6

产品截图

CMMLU 截图

详细介绍

CMMLU是什么

CMMLU是综合性的中文评估基准,专门用在评估语言模型在中文语境下的知识和推理能力,涵盖从基础学科到高级专业水平的67个主题。包括需要计算和推理的自然科学,需要知识的人文科学和社会科学,及需要生活常识的中国驾驶规则等。CMMLU中的许多任务具有中国特定的答案,可能在其他地区或语言中并不普遍适用。CMMLU提供丰富的测试数据和排行榜,支持多种评估方式,如five-shot和zero-shot测试,是衡量中文语言模型性能的重要工具。

CMMLU的主要功能

如何使用CMMLU

CMMLU的应用场景

核心功能

从GitHub下载:访问 CMMLU GitHub页面:https://github.com/haonan-li/CMMLU/,在data目录中找到开发和测试数据集。
通过Hugging Face获取:访问Hugging Face平台:https://huggingface.co/datasets/haonan-li/cmmlu,直接加载CMMLU数据集。
安装依赖:确保安装了必要的Python库,如transformers、datasets等。
克隆代码库:克隆CMMLU的GitHub仓库,获取测试代码和预处理工具。
选择模型:根据需要评估的语言模型,加载模型和tokenizer。
运行测试脚本:在script目录中,运行测试脚本,评估模型在不同任务上的表现。
开源模型:直接提交拉取请求(PR),更新测试代码和结果。
未开放模型:将测试代码和结果发送到指定邮箱(如haonan.li@librai.tech),等待验证后更新到排行榜。
AI 智能推荐 ×
🎯 输入关键词,AI 从 1000+ 工具中精准匹配推荐