header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
扫码下载APP

又一条RSI路线出现:模型参数不动,Agent靠Memory持续进化

动察 Beating AI 快讯,UCSD 助理教授黄碧薇创办的因果世界模型公司 Aether AI 开源 RSIAgent。


这是一套不训练模型的递归自我改进框架。底层模型参数全程固定,Agent 会自己寻找值得练习的任务、实际操作、检查结果,再把成功方法和失败教训写进长期 Memory。下一轮继续利用这些经验,逐步补上能力短板。


系统由三个 Agent 配合。Curriculum Agent 决定接下来练什么,Actor Agent 真正操作软件,Verifier Agent 独立检查结果。探索分成两步:先广泛尝试不同任务,再针对失败、隐藏限制和边界情况继续深挖。最后 Memory 会被冻结,直接拿去执行正式任务。


在 OSWorld 2.0 上,加入这套 RSI 后,平均部分得分从 71.97% 提升到 78.98%;Agents’ Last Exam 从 83.75% 提升到 84.82%。不过这不是整套测试的严格 A/B 对比。OSWorld 只有一半任务实际用了 RSI 后的新结果,其余任务继续沿用原成绩。


它和 Prime Agent 这类 Harness 自我改进思路属于同一个大方向:模型权重不变,持续更新模型外面的东西。 RSIAgent 的特点是把改进重点放在 Memory,再用自主出题和独立验证,让这份外部经验库不断积累。

AI 解读
黄碧薇创办的因果世界模型公司 Aether AI 开源 RSIAgent,把递归自我改进从权重挪到 Memory:Curriculum 出题、Actor 执行、Verifier 验收,经验写回长期记忆,正式任务前冻结。它与 8 月 Pi、DeepSeek Harness 的持久运行时/可插拔插件,以及 Scale 的 RSI Bench、HarnessOpt-Bench 同一方向:模型不动,改的是外部 Harness、技能库和记忆。3 月 Memento-Skills、Meta Hyperagents 已铺过失败反思与元改进;9 月 DeepMind 的 RSI 传闻推高情绪,落点仍在工程评测。关键在口径:OSWorld 2.0 仅一半任务启用 RSI 后新结果,其余沿用原成绩,71.97% 到 78.98% 并非严格 A/B。Memory 被做成可冻结、可复用的外部资产,RSI 正下沉为 Agent 工程与评测生意。
展开
举报 纠错/举报
纠错/举报
提交
新增文库
仅自己可见
公开
保存
选择文库
新增文库
取消
完成