FEATURED PROJECT

Long-Horizon Repository Generation

NL2Repo-Bench

从一份自然语言需求和空工作区出发,要求 Coding Agent 自主重建可安装、可运行的完整 Python 仓库,并用真实上游 pytest 衡量长程软件工程能力。

FROM INTENT TO REPOSITORY

不是修一个函数。
是从空目录交付整个软件系统。

函数补全、单文件修复和已有仓库中的 Issue 解决,都预先提供了大量结构信息,难以判断 Agent 能否持续完成架构设计、依赖管理、跨文件实现、调试和打包交付。完整仓库生成需要一个更长、更严格且能够客观验收的评测场景。

01 / EVALUATION PROTOCOL

把长程软件工程拆成一条可执行验收链

开发阶段只看需求,评测阶段才加载真实上游测试。结构先验和测试泄漏被移除,最终结果只由可运行的软件行为决定。

01
SPECIFICATION单一需求文档

只提供项目目标、目录约束与 API 行为,不提供源代码、函数签名脚手架或测试。

02
WORKSPACE空工作区起步

Agent 自主决定架构、包结构、依赖和实现顺序,从零建立可以安装的 Python 项目。

03
DELIVERABLE完整仓库交付

评价对象不是一段代码,而是跨模块一致、依赖闭合且能够实际运行的软件仓库。

04
VERIFICATION上游测试判定

生成仓库进入隔离环境,由真实项目原有 pytest 套件执行,避免主观模型评分。

02 / EXECUTION RESULTS

最强系统仍未跨过一半

40.2%
Claude 4.5 · Claude Code
40.2%
Claude 4.5 · OpenHands
39.9%
Claude 4.5 · Cursor
39.2%
Gemini 3 Pro · Cursor
34.2%
GPT-5 · OpenHands
21.7%
03 / FAILURE TAXONOMY

测试失败只是结果,轨迹才说明系统为何失败。

EARLY STOP过早终止

尚未完成全部模块与验证,Agent 已把局部可运行误判为项目完成。

GLOBAL COHERENCE全局一致性丢失

后续实现忘记早期架构决定,模块边界、数据结构与公共接口逐渐分叉。

CROSS-FILE LINKS跨文件依赖脆弱

单个文件看似合理,但导入、调用约定和状态传递无法在整个仓库闭合。

LONG-HORIZON PLAN长程计划失效

数百轮操作中缺少持续检查与重规划,错误积累到最终测试阶段才集中暴露。

MY SCOPE

参与把“完整仓库生成”变成可以严格复现的研究问题

我参与完整仓库生成基准的研究与实验分析:围绕真实需求文档、空工作区、隔离执行环境与上游测试组织统一评测链路,并分析 Agent 在长程规划、跨文件一致性和依赖管理上的失败表现。