[論文レビュー] Read and Reap the Rewards: Learning to Play Atari with the Help of Instruction Manuals
この論文では、人間が書いたゲームマニュアルを外部知識として活用することで、Atariゲームにおけるサンプル効率の悪い強化学習を向上させるフレームワーク「Read and Reward」を提案する。ゼロショットの質問応答を用いてキーパラメータを抽出し、大規模言語モデルによる推論によって補助報酬を生成することで、SOTAと比較して1,000倍少ないフレーム数で、112倍速い学習と、Skiingでは60%の性能向上を達成した。
High sample complexity has long been a challenge for RL. On the other hand, humans learn to perform tasks not only from interaction or demonstrations, but also by reading unstructured text documents, e.g., instruction manuals. Instruction manuals and wiki pages are among the most abundant data that could inform agents of valuable features and policies or task-specific environmental dynamics and reward structures. Therefore, we hypothesize that the ability to utilize human-written instruction manuals to assist learning policies for specific tasks should lead to a more efficient and better-performing agent. We propose the Read and Reward framework. Read and Reward speeds up RL algorithms on Atari games by reading manuals released by the Atari game developers. Our framework consists of a QA Extraction module that extracts and summarizes relevant information from the manual and a Reasoning module that evaluates object-agent interactions based on information from the manual. An auxiliary reward is then provided to a standard A2C RL agent, when interaction is detected. Experimentally, various RL algorithms obtain significant improvement in performance and training speed when assisted by our design.
研究の動機と目的
- 人間が読めるゲームマニュアルを外部知識として活用することで、Atariゲームにおける強化学習の高いサンプル複雑性を軽減すること。
- タスク固有の報酬形状や合成データを必要とせず、標準的なRLエージェントの学習効率と性能を向上させること。
- 人間が読むことを想定した現実世界のマニュアルを読み取り、RLエージェントが実行可能な報酬に変換する汎用的でエンドツーエンドのフレームワークを構築すること。
- 非構造的な自然言語文書が、異なるマニュアルソースに対しても一貫性を保ちながら、RLの学習を顕著に加速できることを示すこと。
提案手法
- ゼロショットの抽出型QAモジュールが、ゲームマニュアルから目的、ルール、相互作用に関する関連情報を抽出し要約する。
- 大規模言語モデルによって駆動される推論モジュールが、抽出されたマニュアル内容を用いて、ゲーム内オブジェクトの相互作用を評価する。
- オブジェクト検出と局所化を用いて、近接に基づく相互作用(例:障害物に当たる)を特定し、それらを補助報酬にマッピングする。
- 補助報酬は、相互作用がマニュアルに記載されたルール(例:「障害物を避けよ」または「ペレットを収集せよ」)と整合するかどうかに基づき、+5または-5として計算される。
- 標準的なA2CおよびAgent57 RLエージェントと統合されており、再訓練なしに即座に統合可能で、プラグアンドプレイの改善が可能である。
- 公式開発者マニュアルやWikipediaのゲームプレイセクションなど、異なるマニュアルソースに対しても一般化可能で、一貫した性能を示している。

実験結果
リサーチクエスチョン
- RQ1RLエージェントは、人間が書いたゲームマニュアルを読むことで、Atariゲームにおけるサンプル効率を向上させることができるか?
- RQ2自然言語のマニュアルに対してゼロショットQAと推論を用いることで、RLに実行可能なゲームルールを効果的に抽出できるか?
- RQ3公式開発者ガイドやWikipediaの記事など、異なるソースからのマニュアルに対しても、このフレームワークは一般化可能か?
- RQ4非構造的なテキストから導出された補助報酬は、標準的なRLベースラインと比較して、どれほど学習を加速できるか?
- RQ5合成データやキュレート済みテキストデータへの明示的トレーニングが不要な状態で、このフレームワークは性能を向上させられるか?
主な発見
- Skiingゲームでは、ベースラインと比較して1,000倍少ないトレーニングフレーム数で60%の性能向上を達成した。
- Agent57にRead and Rewardを適用した場合、遅延報酬を用いることで、ベースラインと同等の性能に到達するまでのトレーニングステップ数が最大112倍まで短縮された。
- 公式ゲームマニュアルとWikipediaのゲームプレイセクションの両方で一貫した性能向上が得られ、一般化の強さが確認された。
- 「エナジーピル」のような重要なオブジェクトが明示的に検出されなくても、依然として性能向上が見られたことから、不完全な検出に対しても耐性があることが示された。
- 遅延報酬がなければ、Read and Rewardでも最大112倍の学習速度向上が達成されたが、スコアの向上は観察されなかった。これは報酬形状の役割を裏付けるものであった。
- QA抽出モジュールは、複数のゲームにおいて、ゴーストを避けることやペレットを収集することといった、すべての重要なゲームプレイ情報を正常に抽出できた。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。