RSI 火了,但自进化也会过拟合:Google 等提出 RRSI,给自进化施加正则化
1 小时前
当前 Agent 领域的递归式自我改进(RSI)已有现实落地路径:无需修改模型权重,Agent 可通过迭代调整 Prompt、工具调用规则、记忆管理等外围 Harness 组件形成自我改进闭环。但传统无约束的 Harness 进化过程反复使用同一组任务迭代优化,易出现基准拟合、追逐评估噪声、复杂度累积三类问题,导致进化集分数持续上涨,但在未见过的 OOD 任务上收益大幅缩水,还会推高推理成本。谷歌提出的正则化递归自我改进框架 RRSI 不限制 Agent 的自我修改空间,而是从提案端限制单轮修改复杂度、留存完整进化历史引导探索,从筛选端严格验证修改的泛化性、性价比,过滤无效改动。实验显示,RRSI 在进化集分数略低于无约束进化的情况下,在多类未参与进化的 OOD 基准上表现更优,同时大幅降低推理 Token 消耗,30 轮进化中仅约三分之一的改动被验证有效并留存。该研究指出 RSI 的核心不应是追求无限制的自我修改,而是要实现可泛化的自我改进,让 Agent 能筛选出真正具备普适性的有效进步。
2026-09-14
谷歌 DeepMind 疑似实现 RSI 引发行业热议体验专业版特色功能,拓展更丰富、更全面的相关内容。