Skip to main content
QUICK REVIEW

[论文解读] Adversarial Environment Generation for Learning to Navigate the Web

İzzeddin Gür, Natasha Jaques|arXiv (Cornell University)|Mar 2, 2021
Influenza Virus Research Studies参考文献 18被引用 5
一句话总结

本文提出 Flexible b-PAIRED,一种对抗性环境生成方法,通过使用组合式设计原语动态创建日益复杂的网站,以训练强化学习智能体完成复杂、现实世界的网页任务。该方法通过结合基于遗憾的课程学习与预算化复杂度惩罚,优于先前的方法,在未见过的测试任务上成功率超过80%。

ABSTRACT

Learning to autonomously navigate the web is a difficult sequential decision making task. The state and action spaces are large and combinatorial in nature, and websites are dynamic environments consisting of several pages. One of the bottlenecks of training web navigation agents is providing a learnable curriculum of training environments that can cover the large variety of real-world websites. Therefore, we propose using Adversarial Environment Generation (AEG) to generate challenging web environments in which to train reinforcement learning (RL) agents. We provide a new benchmarking environment, gMiniWoB, which enables an RL adversary to use compositional primitives to learn to generate arbitrarily complex websites. To train the adversary, we propose a new technique for maximizing regret using the difference in the scores obtained by a pair of navigator agents. Our results show that our approach significantly outperforms prior methods for minimax regret AEG. The regret objective trains the adversary to design a curriculum of environments that are "just-the-right-challenge" for the navigator agents; our results show that over time, the adversary learns to generate increasingly complex web navigation tasks. The navigator agents trained with our technique learn to complete challenging, high-dimensional web navigation tasks, such as form filling, booking a flight etc. We show that the navigator agent trained with our proposed Flexible b-PAIRED technique significantly outperforms competitive automatic curriculum generation baselines -- including a state-of-the-art RL web navigation approach -- on a set of challenging unseen test environments, and achieves more than 80% success rate on some tasks.

研究动机与目标

  • 为解决训练强化学习智能体在具有庞大、组合式状态空间和动作空间的多样化现实世界网页导航任务中泛化能力的挑战。
  • 通过生成可扩展、自适应的网页环境课程,克服专家演示和固定课程方法的局限性。
  • 设计一种对抗性环境生成器,根据智能体当前的能力水平调整难度,避免任务过难或过易。
  • 通过引入灵活的遗憾计算方式和预算机制,在智能体失败时对过度复杂性施加惩罚,从而改进基于遗憾的环境生成。
  • 发布 gMiniWoB,一个用于组合式网页环境生成的开源基准,以加速网页导航强化学习的研究。

提出的方法

  • 提出 gMiniWoB,一个新型开源环境,支持通过组合式原语(如导航栏、网页表单、产品轮播图)构建网站。
  • 提出 Flexible b-PAIRED,一种新颖的 AEG 技术,通过计算两个导航智能体性能差异来生成遗憾信号,指导对抗者。
  • 通过使用表现最佳的导航智能体作为对手,增强遗憾估计,即使在训练初期智能体表现相似时,也能提供一致且富有信息量的遗憾信号。
  • 引入预算机制,在智能体失败时对对抗者生成的环境复杂性施加惩罚,促进课程的平衡发展。
  • 采用最小最大遗憾目标函数,训练对抗者生成既具挑战性又可解的环境,适应智能体能力的动态演化。
  • 采用双智能体架构,其中对抗者生成网站,而导航智能体使用 DOM 级动作学习完成表单填写和导航任务。

实验结果

研究问题

  • RQ1与固定或随机课程方法相比,对抗性环境生成能否产生更有效、更自适应的网页导航强化学习课程?
  • RQ2如何改进基于遗憾的训练,以避免在网页导航 AEG 中陷入局部极小值并确保稳定学习?
  • RQ3引入一种在过度复杂时施加惩罚的预算机制,是否能提升生成环境的质量与可学习性?
  • RQ4在未见过的、高复杂度的网页任务上,使用 Flexible b-PAIRED 训练的智能体能多大程度上实现泛化?
  • RQ5在训练过程中,生成网站中活跃原语与被动原语的分布如何演变,其变化是否与智能体性能相关?

主要发现

  • Flexible b-PAIRED 显著优于原始的 PAIRED 算法,后者因智能体奖励相近导致遗憾信号无信息量而无法学习。
  • 所提出的预算机制显著提升了 Flexible b-PAIRED 和原始 PAIRED 的性能,增强了学习的稳定性和有效性。
  • Flexible b-PAIRED 在最具挑战性的测试任务上成功率超过80%,证明了其在未见环境中的强大泛化能力。
  • 即使在环境复杂度持续增加的情况下,使用 Flexible b-PAIRED 训练的智能体仍表现出持续的性能提升,表明课程推进有效。
  • 生成网站中活跃原语的比例随训练过程上升,从初始约60%逐步提高至更高水平,反映出对抗者能根据智能体能力动态提升难度。
  • 由于 Flexible b-PAIRED 对智能体性能反应更准确,能更快适应,因此其学习速度优于 Flexible PAIRED 和基线方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。