[論文レビュー] Adversarial Environment Generation for Learning to Navigate the Web
本論文では、構成的設計プリミティブを用いて動的に洗練されていく複雑なウェブサイトを生成することで、強化学習エージェントが複雑で現実世界のウェブタスクをナビゲートできるように訓練する、敵対的環境生成手法であるFlexible b-PAIREDを提案する。この手法は、レジットベースのカリキュラム学習と予算化された複雑さペナルティを用いることで、未観測のテストタスクで80%を超える成功を達成し、先行手法を上回る性能を発揮する。
Learning to autonomously navigate the web is a difficult sequential decision making task. The state and action spaces are large and combinatorial in nature, and websites are dynamic environments consisting of several pages. One of the bottlenecks of training web navigation agents is providing a learnable curriculum of training environments that can cover the large variety of real-world websites. Therefore, we propose using Adversarial Environment Generation (AEG) to generate challenging web environments in which to train reinforcement learning (RL) agents. We provide a new benchmarking environment, gMiniWoB, which enables an RL adversary to use compositional primitives to learn to generate arbitrarily complex websites. To train the adversary, we propose a new technique for maximizing regret using the difference in the scores obtained by a pair of navigator agents. Our results show that our approach significantly outperforms prior methods for minimax regret AEG. The regret objective trains the adversary to design a curriculum of environments that are "just-the-right-challenge" for the navigator agents; our results show that over time, the adversary learns to generate increasingly complex web navigation tasks. The navigator agents trained with our technique learn to complete challenging, high-dimensional web navigation tasks, such as form filling, booking a flight etc. We show that the navigator agent trained with our proposed Flexible b-PAIRED technique significantly outperforms competitive automatic curriculum generation baselines -- including a state-of-the-art RL web navigation approach -- on a set of challenging unseen test environments, and achieves more than 80% success rate on some tasks.
研究の動機と目的
- 大規模で組み合わせ的状態空間と行動空間を持つ多様で現実世界のウェブナビゲーションタスクに一般化するためのRLエージェントの訓練という課題に対処すること。
- エキスパートデモンストレーションや固定カリキュラム手法の限界を克服し、スケーラブルで適応的なウェブ環境のカリキュラムを生成すること。
- エージェントの現在のスキルレベルに応じて難易度を調整する敵対的環境生成器を設計することにより、難しすぎるか易しすぎるタスクを避けること。
- 失敗時に過剰な複雑さにペナルティを課す予算化メカニズムを導入することで、レジットベースの環境生成を改善すること。
- ウェブナビゲーションRL分野の研究を加速するために、構成的ウェブ環境生成を可能にするオープンソースベンチマークgMiniWoBをリリースすること。
提案手法
- ナビゲーションバー、ウェブフォーム、製品カルーセルなどの構成的プリミティブからウェブサイトを構築できる、新しいオープンソース環境gMiniWoBを提案する。
- レジットを2つのナビゲーター・エージェント間のパフォーマンス差として計算することで、敵対者を誘導する新しいAEG技術であるFlexible b-PAIREDを導入する。
- 最もパフォーマンスの良いナビゲーターをアントゴニストとして使用することで、エージェントが類似している初期段階でも一貫性があり情報量の多いレジット信号を保証する。
- エージェントが失敗した際に過剰に複雑な環境を生成するのを防ぐために、敵対者に複雑さペナルティを課す予算化メカニズムを統合する。
- エージェントの進化する能力に応じて、挑戦的ではあるが解ける環境を生成するように敵対者を訓練するため、ミニマックス・レジット目的関数を用いる。
- 敵対者がウェブサイトを生成し、ナビゲーター・エージェントがDOMレベルの行動を用いてフォーム入力やナビゲーションタスクを完了するという、二重エージェント構造を採用する。
実験結果
リサーチクエスチョン
- RQ1固定またはランダムなカリキュラム手法と比較して、敵対的環境生成は、ウェブナビゲーションRLエージェントのためのより効果的で適応的なカリキュラムを生み出せるか?
- RQ2レジットベースの学習をどのように改善すれば、ウェブナビゲーションのAEGにおいて局所最適解を避けて安定した学習を実現できるか?
- RQ3過剰な複雑さにペナルティを課す予算化メカニズムを導入することで、生成された環境の質と学習可能性が向上するか?
- RQ4Flexible b-PAIREDで訓練されたエージェントは、トレーニング中に見なかった高複雑度の未観測ウェブタスクにどの程度一般化できるか?
- RQ5生成されたウェブサイトにおけるアクティブプリミティブとパッシブプリミティブの分布は、時間経過とともにどのように変化するか?また、エージェントのパフォーマンスと相関があるか?
主な発見
- Flexible b-PAIREDは、エージェントの報酬が類似している場合に情報のないレジット信号が生じるため学習に失敗する元のPAIREDアルゴリズムを著しく上回る。
- 提案された予算化メカニズムは、Flexible b-PAIREDおよび元のPAIREDの両方の性能を向上させ、学習の安定性と有効性を高めている。
- Flexible b-PAIREDは、最も挑戦的なテストタスクで80%を超える成功率を達成しており、未観測環境への強い一般化能力を示している。
- エージェントは、環境の複雑さが増加する中でも、トレーニングの進行に伴い一貫したパフォーマンス向上を示しており、効果的なカリキュラム進行が実現している。
- 生成されたウェブサイトにおけるアクティブプリミティブの割合は、トレーニングの進行に伴い上昇し、初期の約60%からより高い水準に達している。これは、敵対者がエージェントの能力に応じて難易度を適切にスケーリングできていることを示している。
- Flexible b-PAIREDは、エージェントのパフォーマンスにより正確に対応するため、Flexible PAIREDおよびベースライン手法よりも高速に学習を進める。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。