在自我演化的世界里做递归自我改进:让智能体自己改进探索策略
来源:arxiv.org — arxiv.org · 99 分 · by bananaflag
📋 概述
论文针对智能体做递归自我改进时的探索瓶颈:固定策略在搜索空间放大后不再适用,而在线策略优化又要在庞大的元搜索空间里、面对延迟且昂贵的反馈做长程试错。Dream-RSI 用一层轻量编排把探索显式化、可编程化,底层编码智能体保持不变;关键洞察是把历史发现积累成一颗发现树,再把它当作回放模拟器,让探索策略在模拟器里「做梦」,用低成本的历史反馈评估与打磨策略,而不必反复调用昂贵的在线评估。
🔑 核心要点
- 轻量编排层让探索显式且可编程,底层智能体不动。
- 把历史发现树当作回放模拟器,在其中做 dreaming。
- 用离策略反馈替代重复且昂贵的在线评估。
- 改进后的策略再回到线上,形成自改进闭环并持续扩充模拟器池。
- 在算法工程、数学优化与GPU kernel 工程上验证,质量相当而成本显著下降。
💡 金句
关键洞察是:积累下来的发现历史,本身就是一台覆盖已实现搜索空间的重放模拟器。
👍 0
👎 0
← 返回 Hacker News 首页