首页/ 资讯/ HarnessEval MirroS 联合清北、英伟达等推出的评测系统

HarnessEval MirroS 联合清北、英伟达等推出的评测系统

灵犀编辑部 2026-08-22 5 阅读

HarnessEval是什么

HarnessEval 是 MirroS 联合清北、Berkeley、MIT、英伟达等机构推出的评测系统。HarnessEval将评测本身 Agent 化。面对每个案例,系统动态规划评测路径,从 Skill Library 选择适用技能,拆解为可验证的子问题,调用工具搜集证据,最终输出可追溯的 evidence tree。HarnessEval突破传统静态 benchmark 的局限,让评测从黑盒分数变成可解释、可复现的智能工作流。首个落地项目 HarnessEval-W 已用于交互式世界模型评测。

HarnessEval

HarnessEval的主要功能

· 动态评测规划 :针对每个案例的上下文与目标,自动生成定制化评测计划。

· 技能路由 :从 Skill Library 中按需选择适用技能,而非跑完所有固定指标。

· 问题拆解 :将抽象评测问题拆分为可测量、可验证的子问题。

· 证据搜集 :调用 sub-agent 和诊断工具,从不同角度搜集视觉与逻辑证据。

· 证据验证 :主智能体验证各分支证据的质量与逻辑关系,确保结论可靠。

· Evidence Tree 输出 :输出完整证据树,记录测试内容、工具调用、推理链与最终分数。

· 可扩展 Skill Library :内置 9 个核心技能模块,支持随模型演进动态添加新技能。

· 评测案例自动构建 :基于场景分类学自动生成初始世界、动作与验证,确保评测质量。

HarnessEval的技术原理

· 四层 Agentic 工作流 :HarnessEval 采用 Plan-Router-Decompose-Verify 四层工作流:Plan 阶段理解案例上下文并生成定制化评测计划;Route 阶段从 Skill Library 中动态选择适用技能;Decompose 阶段将高层问题拆分为子问题并委派给 sub-agent;Verify 阶段由主智能体验证证据质量与逻辑关系,形成最终结论。

· 分层智能体架构 :系统采用主智能体统筹规划与验证,各 Skill Agent 负责专项评测,每个 Skill 再进一步拆分为多个 sub-agent 处理具体子任务,形成层级化的评测执行结构。

· 可扩展 Skill Library :框架内置 9 个核心技能模块,覆盖渲染质量、物理合理性、状态变化验证、漂移分析、重访一致性、离屏演化等维度,并支持随模型能力演进动态添加新技能,实现评测能力的持续扩展。

· Evidence Tree 输出机制 :评测结果以层级式证据树形式呈现,完整记录测试内容、工具调用、视觉证据与推理链,使评测结论可检查、可复现、可追责,而非仅输出单一标量分数。

如何使用HarnessEval

· 克隆仓库 :从 GitHub 拉取 HarnessEval-W 代码库。

· 创建环境 :分别创建 harnesseval-main 、 harnesseval-metrics 和 harnesseval-pavrm 三个 conda 环境。

· 配置凭证 :复制 config/example.env 为 harnesseval.env 并加载环境变量。

· 准备数据 :将待评测模型生成的视频结果放入指定目录,并准备好 manifest.json 清单文件。

· 执行评测 :运行 harnesseval eval 命令,指定模型结果路径、评测计划和输出目录。

· 验证结果 :运行 harnesseval verify run 检查评测输出是否完整、分数是否生成。

· 查看报告 :在输出目录中查看 summary.json 、 leaderboard_latest.csv 和 LEADERBOARD.md 获取详细评分与排名。

HarnessEval的核心优势

· 动态评测规划 :针对每个案例的上下文自动生成定制化评测计划,而非套用固定流程。

· 智能技能路由 :从 Skill Library 中按需选择适用技能,避免对所有案例跑完无关指标。

· 可解释的证据链 :输出完整的 Evidence Tree,可追溯每项分数背后的工具调用、视觉证据与推理逻辑。

· 可扩展的技能库 :Skill Library 支持动态添加新技能,随模型能力演进持续扩展评测维度。

· 分层智能体协作 :主智能体统筹规划与验证,sub-agent 分工处理子问题,实现复杂评测任务的精细化拆解。

· 评测数据自动生成 :基于场景分类学自动构建初始世界、动作与验证,确保评测案例的质量与多样性。

· 评测过程透明可审计 :完整的推理链与证据记录使评测结论可检查、可复现、可追责。

· 贴近人类评测方式 :模拟人类专家理解—规划—取证—推理的评测工作流,而非机械打分。

HarnessEval的项目地址

· 项目官网 :https://mirros.ai/blog/harnesseval

· GitHub仓库 :https://github.com/mirros-lab/harnesseval-w

HarnessEval的同类竞品对比

对比维度 | HarnessEval | VBench

评测对象 | 交互式世界模型(带动作输入、状态转移、物理因果) | 视频生成模型(单场景、无交互输入)

评测方式 | Agentic 动态工作流:Plan → Route → Decompose → Verify | 固定指标流水线:预设 rubric + 批量打分

技能选择 | 根据案例上下文动态路由 Skill Library 中的技能 | 所有案例跑完同一套固定指标

问题拆解 | 将高层评测问题拆分为可测量的子问题,委派 sub-agent | 直接计算指标,无层级拆解

输出形式 | Evidence Tree(证据树):记录测试内容、工具调用、推理链、分数依据 | 标量分数 + 各维度柱状图

可解释性 | 可追溯每项分数的完整推理链与视觉证据 | 仅输出分数,无法解释为什么低分

可扩展性 | Skill Library 可动态添加新技能,支持递归自我改进 | 指标固定,扩展需修改整体框架

物理因果 | 专门评估状态转移正确性、物理合理性、世界持续性 | 仅评估视觉质量与运动流畅度

HarnessEval的应用场景

· 交互式世界模型评测 :评估视频生成模型在动作条件下的状态转移正确性、物理合理性与世界持续性。

· 具身智能与机器人仿真 :评测机器人在虚拟环境中的操控能力、物理交互因果与长期状态一致性。

· 自动驾驶世界模型 :验证生成场景中的相机轨迹遵循、物体 permanence、离屏演化与物理动力学合理性。

· 游戏与虚拟世界生成 :评估开放世界游戏的场景一致性、NPC 行为因果、重访一致性与视觉质量。

· 物理仿真与科学计算 :检验生成视频中的物理定律遵循与因果保真度。

· AI 视频创作平台 :为 Seedance、Kling、Sora 等模型提供可解释的质量诊断,定位具体失败模式(如额外事件、目标漂移、物理违规)。

相关工具
与本文相关的 AI 工具
AI 智能推荐 ×
🎯 输入关键词,AI 从 1000+ 工具中精准匹配推荐