同一个模型,
换一套 Harness,
可能就是另一种 Agent。
同一个模型接入不同 Harness 后,提示组织、工具协议、状态管理与失败恢复都会变化。只比较最终成功率无法解释差异来自模型还是系统,也无法定位长程执行中真正的失败环节。
工作区与工具
文件、Shell、本地网页与多模态产物
BASE MODEL推理与生成能力
×HARNESS上下文、工具、状态、恢复
=OBSERVED AGENT真实执行能力
5,194
条完整执行轨迹,让评测从“答对没有”深入到“为什么失败”。
MY SCOPE
我把运行过程变成可以追溯的证据
我参与 106 个离线沙箱任务的环境与评测链路建设,汇总并分析 5,194 条完整执行轨迹;从配置层追踪任务失败、Token 消耗和长程行为差异,使实验可以被复现并支持 Harness 级诊断。