MMBench

全方位的多模态大模型能力评测体系
分类:AI模型评测 更新:2026-08-13 热度:8

产品截图

MMBench 截图
MMBench 截图

详细介绍

MMBench是什么

MMBench是多模态基准测试,由上海人工智能实验室、南洋理工大学、香港中文大学、新加坡国立大学和浙江大学的研究人员联合推出。MMBench推出一个综合评估流程,从感知到认知能力逐级细分评估,覆盖20项细粒度能力,从互联网与权威基准数据集采集约3000道单项选择题。打破常规一问一答基于规则匹配提取选项进行评测,循环打乱选项验证输出结果的一致性,基于ChatGPT精准匹配模型回复至选项。MMBench涵盖多种任务类型,如视觉问答、图像描述生成等,基于综合多维度指标,为模型提供全面的性能评估。MMBench 的排行榜展示不同模型在这些任务上的表现,帮助研究者和开发者了解当前多模态技术的发展水平,推动相关领域的技术进步。

MMBench主要功能

如何使用MMBench

MMBench的应用场景

核心功能

运行后,推理结果将保存为一个 Excel 文件,例如:llava_v1.5_7b/MMBench_DEV_EN.xlsx。
在 MMBench 领先榜上提交测试结果,按照以下步骤操作:使用测试集数据进行推理,生成预测结果文件(如llava_v1.5_7b/MMBench_TEST_EN.xlsx)。登录 MMBench 领先榜上传预测结果文件。领先榜将自动计算并展示模型在各个能力维度上的性能表现。
使用测试集数据进行推理,生成预测结果文件(如llava_v1.5_7b/MMBench_TEST_EN.xlsx)。
登录 MMBench 领先榜上传预测结果文件。
领先榜将自动计算并展示模型在各个能力维度上的性能表现。
AI 智能推荐 ×
🎯 输入关键词,AI 从 1000+ 工具中精准匹配推荐