C-Eval

一个全面的中文基础模型评估套件
分类:AI模型评测 更新:2026-08-13 热度:14

产品截图

C-Eval 截图
C-Eval 截图

详细介绍

C-Eval是什么

C-Eval是适用于大语言模型的多层次多学科中文评估套件,由上海交通大学、清华大学和爱丁堡大学研究人员在2023年5月份联合推出,包含13948个多项选择题,涵盖52个不同的学科和四个难度级别,用在评测大模型中文理解能力。通过零样本(zero-shot)和少样本(few-shot)测试,C-Eval 能评估模型在未见过的任务上的适应性和泛化能力。

C-Eval的主要功能

如何使用C-Eval

C-Eval的应用场景

核心功能

数据下载:
Hugging Face 下载:
或者直接下载 ZIP 文件并解压:
零样本(Zero-shot):模型在没有任何示例的情况下直接回答问题。
少样本(Few-shot):模型在少量示例(如 5 个)的提示下回答问题。
零样本提示:
少样本提示:
对于验证集(val),直接计算准确率。
对于测试集(test),需要将结果提交到 C-Eval 官方平台获取评分。
登录 C-Eval 官方平台并提交结果以获取最终评分。
AI 智能推荐 ×
🎯 输入关键词,AI 从 1000+ 工具中精准匹配推荐