FEATURED PROJECT

Closed-Loop RSI Research

Self-Developing Agents

面向闭环递归自我改进的研究项目:把 Agent 的成长拆成目标形成、经验整合与系统演化三道检验,关注的不是“有没有完成更新”,而是更新能否迁移到隐藏条件并被可靠保留。

CLOSED-LOOP RSI

真正的自我改进,不是完成一次更新,而是知道哪次更新值得保留。

许多自我改进系统默认存在一个始终正确的 Golden Verifier:目标已经明确、反馈足够可靠、执行系统也能持续承载变化。现实中,这三个条件都可能失效,Agent 即使完成训练或改写,也不代表真正获得了可迁移的能力。

02 / S³GYM

一次经历能改善下一次决策吗?

BUILD

在交互环境中完成 Self-Testing 与 Self-Judging,再分别通过原始历史、摘要记忆或参数训练复用经验。

VERIFY

在更严格、种子隔离的条件下验证经验是否可执行、可迁移。

RETENTION GATE只有隐藏评测确认的增益,才进入下一轮。
CHOOSE选择目标把宽泛目标变成可验证能力
LEARN产生经验探索、判断并整合交互轨迹
VERIFY隐藏验证隔离可见反馈与真实收益
KEEP保留或回滚只让可迁移的变化进入下一轮
EXPERIENCE INTEGRATION / S³GYM

经验有用,但没有一种用法能够通吃所有环境。

实验表明经验不会自动变成能力:没有一种记忆形式能在所有环境中获胜,参数更新也可能产生负迁移;Agent 的自评分数对下一轮收益几乎没有预测力,因此闭环必须同时验证目标、经验和系统,而不是只追踪更新是否发生。

VERIFIER-BACKED7

个交互游戏,把 Agent 自评与环境真实结果分开记录。

MEMORY ROUTES3 / 3

原始 History 与 Summary Memory 在七个游戏中各领先三项,另有一项分裂。

SELF-JUDGMENT → GAINρ≈0

自评与下一轮增益的相关系数为 −0.010 和 −0.018,几乎没有预测力。

MY SCOPE · S³GYM CONTRIBUTOR

我的参与聚焦在“经验怎样真正变成能力”。

作为 S³Gym Contributor,我参与经验整合方向的研究工作与实验分析:在七个带可执行验证器的交互游戏中,对比 History ICL、Summary Memory 与参数训练,检查 Agent 的自我判断能否转化为严格 held-out 条件下的真实增益。