header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
扫码下载APP

谷歌让Agent学会「做梦」:复盘过去试错,下一轮自己少走弯路

动察 Beating AI 快讯,谷歌研究团队发布 Dream-RSI,让 AI Agent 做完一轮任务后,把过去的成功和失败拿来「做梦」。系统会保存每次尝试和结果,再利用这些旧记录推演不同做法,比如先试哪条路、什么时候放弃、要不要同时多试几个方案。因为结果以前已经跑过,这些推演不用重新执行任务。


系统会从中选出表现更好的做法,直接用到下一轮。新一轮又会留下更多成功和失败,再拿来「做梦」、继续改策略。这样一轮接一轮,就是论文所谓的「递归自我改进」。目前底层模型本身不会变化,真正被改进的是 Agent「下一步怎么做」的方法。


论文在算法、数学优化和 GPU kernel 等 8 个任务上测试了这套方法。以 Gemini 3.1 Pro 的一个算法任务为例,相比固定做法,Agent 调用从 550 次降到 317 次,同时最终找到的程序运行得更快。

AI 解读
谷歌研究团队把 RSI 从模型权重层拉回 Agent 策略层。Dream-RSI 冻结 Gemini 3.1 Pro,将每轮成功/失败存档,离线“做梦”推演不同路径,再选更优策略进入下一轮;8 个任务中,某算法任务调用从 550 次降至 317 次,程序还更快。它与 9 月 12 日 DeepMind RSI 传闻、9 月 15 日 Aether AI 开源 RSIAgent 同线:递归自我改进正落到 Memory、Harness 与策略优化。最关键是“底层模型不变”:这轮改进只发生在策略层,不产出更强 Gemini,让同一模型更省调用、更快收敛,也可能接入 Gemini Enterprise,成为企业 Agent 集群的可审计管控层。
展开
举报 纠错/举报
纠错/举报
提交
新增文库
仅自己可见
公开
保存
选择文库
新增文库
取消
完成