Agent 驱动的模型训练,基元律动做了一次迈向 RSI 的实验
57 分钟前
基元律动发布开源的 NeoHorse-1(含 4B 与 9B 两个尺寸),以其此前开源的 OpenSquilla 路由系统产生的「需求预测 — 路由决策 — 执行过程 — 环境结果」完整轨迹为教学档案,将 Agent 的「推理 — 行动 — 反馈」链条作为训练单元,经轨迹筛选、基于路由能力需求的课程学习、路由引导的 On-Policy Distillation 等步骤完成单轮闭环训练,实现了模型在 Harness Agent、工具交互等任务上的能力提升,这被视为迈向递归自我改进(RSI)的可复现单轮闭环验证。该项目由无问芯穹提供底层支撑,清北团队参与算法研究,其构建的模型与 Harness 飞轮,有望推动 Agent 从执行过程中持续成长。
Agent 驱动的模型训练,基元律动做了一次迈向 RSI 的实验
机器之心 / 腾讯网
2026-09-10
Agent 驱动的模型训练,基元律动做了一次迈向 RSI 的实验2026-09-08
基元律动发布 Agent-Native 模型 NeoHorse体验专业版特色功能,拓展更丰富、更全面的相关内容。