[论文解读] Environment Generation for Zero-Shot Compositional Reinforcement Learning
本文提出组合环境设计(CoDE),一种利用生成代理自动创建渐进式复杂组合任务课程的方法,这些任务根据强化学习代理的技能水平量身定制。通过采用基于遗憾的稳定化与任务难度调节的多目标奖励函数,CoDE 在基线方法基础上实现了 4 倍的成功率提升,并实现了对未见过的真实世界网页导航任务的零样本泛化。
Many real-world problems are compositional - solving them requires completing interdependent sub-tasks, either in series or in parallel, that can be represented as a dependency graph. Deep reinforcement learning (RL) agents often struggle to learn such complex tasks due to the long time horizons and sparse rewards. To address this problem, we present Compositional Design of Environments (CoDE), which trains a Generator agent to automatically build a series of compositional tasks tailored to the RL agent's current skill level. This automatic curriculum not only enables the agent to learn more complex tasks than it could have otherwise, but also selects tasks where the agent's performance is weak, enhancing its robustness and ability to generalize zero-shot to unseen tasks at test-time. We analyze why current environment generation techniques are insufficient for the problem of generating compositional tasks, and propose a new algorithm that addresses these issues. Our results assess learning and generalization across multiple compositional tasks, including the real-world problem of learning to navigate and interact with web pages. We learn to generate environments composed of multiple pages or rooms, and train RL agents capable of completing wide-range of complex tasks in those environments. We contribute two new benchmark frameworks for generating compositional tasks, compositional MiniGrid and gMiniWoB for web navigation.CoDE yields 4x higher success rate than the strongest baseline, and demonstrates strong performance of real websites learned on 3500 primitive tasks.
研究动机与目标
- 为解决训练强化学习代理在复杂、组合式真实任务(如网页导航和表单填写)中泛化的问题。
- 克服现有课程学习与领域随机化在组合任务设置中的局限性,其中任务难度与代理能力不匹配。
- 开发一种与领域无关、可扩展的环境生成框架,支持分层的、基于依赖关系的任务结构。
- 通过针对性能弱点设计的课程进行训练,实现代理对未见任务的零样本泛化。
- 提出两个开源基准——组合式 MiniGrid 和 gMiniWoB——用于评估组合任务学习。
提出的方法
- 使用多目标奖励函数训练生成代理,通过最大化群体中代理之间的遗憾来稳定学习并避免局部极小值。
- 生成器引入难度激励机制,根据学习者的当前表现动态调整任务复杂度,成功时增加难度,失败时降低难度。
- 采用佩特里网形式化方法将组合任务建模为依赖图,实现从基本组件出发的结构化、分层任务生成。
- 采用与领域无关的生成器架构,通过可重用的基本组件(如导航栏、表单字段、商品轮播图)组合生成环境,实现可扩展且多样化的环境创建。
- 通过逐步增加活跃和非活跃基本组件的数量,支持课程学习,随时间推移逐步引入更复杂、更相关的组件。
- 在巨大可能环境空间(例如,真实网站的 ~10^31 种)上训练生成器,使模型能够接触到多样化且真实的任务拓扑结构。
实验结果
研究问题
- RQ1生成代理能否自动构建一个适应代理技能水平演化的组合任务课程?
- RQ2结合遗憾估计与难度调节的多目标奖励函数在组合式强化学习中如何提升学习稳定性和性能?
- RQ3通过 CoDE 训练的强化学习代理在未见的真实世界网页导航任务中,其零样本泛化能力有多强?
- RQ4通过佩特里网建模的任务拓扑在实现结构化且可泛化的任务学习中起到何种作用?
- RQ5所提出的基准——组合式 MiniGrid 和 gMiniWoB——在复杂度和真实性方面与现有基准相比如何?
主要发现
- CoDE 在多个组合任务中相比最强基线实现了 4 倍的成功率提升,显著提升了性能。
- 随着环境复杂度增加,CoDE 代理保持了稳定的表现,而课程学习(CL)和领域随机化(DR)等基线方法由于难度错配而性能下降。
- 在真实网站上,CoDE 在登录任务中达到 62% 的成功率,在购物任务中达到 44%,在支付任务中下降至 9%,反映出基本组件分布偏移的影响。
- 生成器成功扩展到约 10^31 种可能环境的空间,使用比以往基准大 100 倍的基本组件集合,实现了真实网页导航训练。
- 尽管存在分布偏移,CoDE 代理仍能泛化到 MiniWoB 中手工设计的基本组件,在地址任务中达到 90% 的成功率,在简单文本输入任务中为 0%,表明其具备选择性泛化能力。
- 该方法使单一强化学习代理能够掌握跨多个页面和复杂工作流的广泛任务,包括表单填写和导航,实现在未见网站上的零样本部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。