产品截图
详细介绍
C-Eval是什么
C-Eval是适用于大语言模型的多层次多学科中文评估套件,由上海交通大学、清华大学和爱丁堡大学研究人员在2023年5月份联合推出,包含13948个多项选择题,涵盖52个不同的学科和四个难度级别,用在评测大模型中文理解能力。通过零样本(zero-shot)和少样本(few-shot)测试,C-Eval 能评估模型在未见过的任务上的适应性和泛化能力。
C-Eval的主要功能
如何使用C-Eval
C-Eval的应用场景
核心功能
✓数据下载:
✓Hugging Face 下载:
✓或者直接下载 ZIP 文件并解压:
✓零样本(Zero-shot):模型在没有任何示例的情况下直接回答问题。
✓少样本(Few-shot):模型在少量示例(如 5 个)的提示下回答问题。
✓零样本提示:
✓少样本提示:
✓对于验证集(val),直接计算准确率。
✓对于测试集(test),需要将结果提交到 C-Eval 官方平台获取评分。
✓登录 C-Eval 官方平台并提交结果以获取最终评分。