01
SPECIFICATION单一需求文档只提供项目目标、目录约束与 API 行为,不提供源代码、函数签名脚手架或测试。
FEATURED PROJECT
从一份自然语言需求和空工作区出发,要求 Coding Agent 自主重建可安装、可运行的完整 Python 仓库,并用真实上游 pytest 衡量长程软件工程能力。
函数补全、单文件修复和已有仓库中的 Issue 解决,都预先提供了大量结构信息,难以判断 Agent 能否持续完成架构设计、依赖管理、跨文件实现、调试和打包交付。完整仓库生成需要一个更长、更严格且能够客观验收的评测场景。
开发阶段只看需求,评测阶段才加载真实上游测试。结构先验和测试泄漏被移除,最终结果只由可运行的软件行为决定。
只提供项目目标、目录约束与 API 行为,不提供源代码、函数签名脚手架或测试。
Agent 自主决定架构、包结构、依赖和实现顺序,从零建立可以安装的 Python 项目。
评价对象不是一段代码,而是跨模块一致、依赖闭合且能够实际运行的软件仓库。
生成仓库进入隔离环境,由真实项目原有 pytest 套件执行,避免主观模型评分。
尚未完成全部模块与验证,Agent 已把局部可运行误判为项目完成。
后续实现忘记早期架构决定,模块边界、数据结构与公共接口逐渐分叉。
单个文件看似合理,但导入、调用约定和状态传递无法在整个仓库闭合。
数百轮操作中缺少持续检查与重规划,错误积累到最终测试阶段才集中暴露。
我参与完整仓库生成基准的研究与实验分析:围绕真实需求文档、空工作区、隔离执行环境与上游测试组织统一评测链路,并分析 Agent 在长程规划、跨文件一致性和依赖管理上的失败表现。