FEATURED PROJECT

Agent Harness Evaluation

Harness-Bench

系统评估不同 Agent Harness 如何改变模型的任务成功率、Token 成本与失败模式,把“外壳差异”转化为可复现的实验结论。

THE MISSING VARIABLE

同一个模型,
换一套 Harness,
可能就是另一种 Agent。

同一个模型接入不同 Harness 后,提示组织、工具协议、状态管理与失败恢复都会变化。只比较最终成功率无法解释差异来自模型还是系统,也无法定位长程执行中真正的失败环节。

TRACE INSPECTOR15 TASKS

工作区与工具

文件、Shell、本地网页与多模态产物

01 · TASK加载离线环境与验收条件
02 · ACTIONHarness 组织上下文并调用工具
03 · FAILURE SIGNAL工具返回成功,但最终文件没有写入指定路径
04 · ORACLE检查产物,而不只读最终回答
106 TASKS选择一个真实工作域HOVER TO SWITCH · 悬停切换
BASE MODEL推理与生成能力
×
HARNESS上下文、工具、状态、恢复
=
OBSERVED AGENT真实执行能力
5,194

条完整执行轨迹,让评测从“答对没有”深入到“为什么失败”。

MY SCOPE

我把运行过程变成可以追溯的证据

我参与 106 个离线沙箱任务的环境与评测链路建设,汇总并分析 5,194 条完整执行轨迹;从配置层追踪任务失败、Token 消耗和长程行为差异,使实验可以被复现并支持 Harness 级诊断。