HarnessEval:开启RSI时代的新评测范式

过去一年,AI模型越来越会完成复杂任务,正在进入RSI时代:它们能理解上下文、调用工具、连续行动,也开始根据反馈检查和改进自己的结果。然而,随着模型能力的不断攀升,我们的评测方式却依然停留在过去:准备一套固定数据,设定一组统一指标,最后用一个分数判断模型好不好。这套方法适合答案明确的静态任务,却越来越难评估一个持续学习、不断改变自己的AI系统。
真正的Evaluation该怎么做?
这也是RSI是否能真正形成闭环的关键挑战:
它能否可靠地评估和验证自己的行动与产出?Evaluation本身也必须随着模型迭代而同步迭代。我们所需要的评测系统,不仅是从外部衡量结果的一把尺子,更将成为RSI系统中自监督机制的一环。
这一次,MirroS联合xbench与多家高校、研究机构发布HarnessEval,首次将LLM生态中的重要概念,Harness,引入评测领域。
Harness并非简单的代码封装,而是一套可靠的执行框架。它将复杂的人类工作流程,例如问题分解、工具调用与推理验证,组织成清晰、可执行的步骤,并由此支撑完整的智能体工作流。评测,本质上也是一套工作流。我们将这一过程通过Harness自动化为一个agentic benchmark:由一个agent统筹全局,根据具体案例动态派生多个专业subagent,并为它们提供相应的上下文和诊断工具,从不同角度审视模型输出。
评测由此从一套静态问答规则变成一个具备自我进化能力的智能系统,可以通过引入外部的新Harness、新的工具调用方式、甚至通过自主探索构建新的评测能力,进一步扩展自己的技能库。评测从此进入RSI的循环。

首个应用场景:交互式世界模型
我们率先将HarnessEval应用于交互式世界模型评测,构建了专属评测标准HarnessEval-W。当世界模型致力于预测“下一秒会发生什么”时,现有评测仍局限于固定题目、流程与单一指标。但物理世界从来不是一成不变的:一个模型可能生成了看似合理的下一帧,却没有理解动作带来的因果关系;它可能在短视频内表现稳定,却在镜头重定向后丢失空间记忆;也可能仅看懂了画面,而无法维持一个连贯、可交互的世界。
当模型开始学习世界时,评测需要真正理解世界:目标是否存在?哪只夹爪发生了移动?勺子的最终位置是否正确?场景里的关键物体有没有变化?整个过程中是否出现了额外对象和无关事件?
为此,团队构建了针对世界模型评测的Harness,把任务分为三条主轴:
- 观察质量:生成内容是否清晰、稳定,物体和物理关系是否合理;
- 转移正确性:操作能否引发预期变化,运动过程是否符合因果;
- 世界持续性:镜头离开再回来,场景是否一致,隐藏状态是否继续正确演化。
在三条主轴下进一步设置九个skills,Harness 可以根据每个案例动态组织不同的评测路径。

Agent可以根据场景动态选择使用哪些skills
Benchmark的数据集构建也由Agent参与:系统生成候选场景和动作,再由独立的Validation Agent检查目标是否可见、操作是否可行、预期结果是否明确。不合格的案例会被退回,重新生成。
这意味着,Agent不只负责“阅卷”,也参与“出题”和“质检”。Benchmark从一份冻结的数据集,变成可以持续生产和验证任务的系统。

基于Harness的评测过程
HarnessEval不会拿一套固定指标机械地评估所有案例,而是先判断:这项任务真正需要检查什么?
整个过程可以概括为四步:
- 第一步,选择Skill。系统先理解案例的目标和上下文,再选择真正相关的评测能力。比如评估机器人操作时,动作是否正确、物理过程是否合理,往往比画面是否精美更重要。
- 第二步,拆解问题。选定Skill后,系统会把复杂判断拆成一组可以直接验证的子问题。判断碰撞是否合理,就要分别检查物体位置、接触时间和碰撞前后的速度变化。
- 第三步,寻找证据。不同子智能体调用目标追踪、时序分析和速度估计等工具,分别完成调查;问题仍然复杂时,还可以继续向下拆解。
- 第四步,复核结论。主智能体汇总并交叉验证所有证据,最终形成判断。
因此,HarnessEval交付的不只是一张成绩单,还包括一棵可以逐层展开的Evidence Tree:测了什么、调用了哪些工具、找到了什么证据,以及结论如何产生,都清晰可见。
分数用来排名,证据则用来诊断、审计和复核。

每一个skill都会衍生出来一系列subagents来拆解复杂问题,从不同角度衡量模型能力
为什么Harness for Eval重要?
Harness让模型获得Test-Time Scaling能力:面对更复杂的任务,可以投入更多推理步骤、调用更多工具、执行更长的工作流。当被测Agent越来越强,Evaluator也必须执行更深的搜索、多轮验证和交叉检查。否则,我们可能在用一个能力不足的裁判定义前沿模型的上限。
与此同时,不同行业还需要完全不同的Skills。代码 Agent要检查执行与测试,搜索Agent要核对来源与时效,机器人要验证动作、环境和物理过程,科研 Agent则要审查数据、方法与推理链。这些能力不会被写死在一套统一Rubric中,而会沉淀为可组合、可版本化的Skill Library。每发现一种新的失败模式,系统就可以补充新的Skill;每进入一个新的行业,就可以建立新的Verification Loop。
Benchmark也由此从一次性考试,变成持续生长的 Living System。
这件事在Recursive Self-Improvement(RSI)的语境下更加重要。Agent会根据评测反馈不断更新自己:评测奖励什么,能力就向哪里生长;评测忽略什么,盲点也可能在循环中持续放大。
未来,Evaluator也需要评估自己。面对一个从未见过的案例,它要判断不确定性究竟来自被测模型,还是因为自己缺少相应的Skill。如果能力不足,系统应该暴露缺口、引入工具、补充技能,再回到Harness中重新验证。
模型需要Harness,把推理、工具、记忆和行动组织成可靠工作流;Eval同样需要Harness,把问题、技能、证据和验证组织成可信判断。
让评测不仅衡量智能,也成为推动智能持续进化的系统。
开源地址
Blog: https://mirros.ai/blog/harnesseval
Code: https://github.com/mirros-lab/harnesseval-w
Project Page: https://mirros-lab.github.io/HarnessEval-W
Website: https: //xbench.org/
xbench采用长青评估机制,持续汇报最新模型的能力表现,更多榜单未来将陆续更新。可以在xbench.org上追踪我们的工作和查看实时更新的Leaderboard榜单排名;欢迎通过team@xbench.org与我们取得联系,反馈意见。