[論文レビュー] Transformers are Sample-Efficient World Models
この論文では、離散自己符号化器と自己回帰的Transformerから構成される世界モデル内で完全に学習する、サンプル効率の高い強化学習エージェントであるirisを紹介する。Atari 100kベンチマークでわずか2時間のプレイデータで訓練されたirisは、人間正規化スコア1.046を達成し、26ゲーム中の10ゲームで人間を上回り、先行するアプローチに比べて新たなSOTAを樹立した。
Deep reinforcement learning agents are notoriously sample inefficient, which considerably limits their application to real-world problems. Recently, many model-based methods have been designed to address this issue, with learning in the imagination of a world model being one of the most prominent approaches. However, while virtually unlimited interaction with a simulated environment sounds appealing, the world model has to be accurate over extended periods of time. Motivated by the success of Transformers in sequence modeling tasks, we introduce IRIS, a data-efficient agent that learns in a world model composed of a discrete autoencoder and an autoregressive Transformer. With the equivalent of only two hours of gameplay in the Atari 100k benchmark, IRIS achieves a mean human normalized score of 1.046, and outperforms humans on 10 out of 26 games, setting a new state of the art for methods without lookahead search. To foster future research on Transformers and world models for sample-efficient reinforcement learning, we release our code and models at https://github.com/eloialonso/iris.
研究の動機と目的
- 深層強化学習におけるサンプル非効率性という重要な課題に取り組むこと、特に実世界への適用を念頭に置いたものである。
- 最小限の相互作用データで高精度で長時間にわたる環境シミュレーションを可能にする世界モデルアーキテクチャを開発すること。
- Transformerと離散自己符号化器を組み合わせることで、サンプル効率の高い方策学習に有効な世界モデルとしての有効性を示すこと。
- 先行のアプローチに比べて、先行探索を用いないモデルベース強化学習の新たなベンチマークを確立すること。
- 再現可能性と拡張性を高めるために、コードとモデルを公開することで、今後の研究を促進すること。
提案手法
- 世界モデルは、生のピクセル観測をコンパクトな離散トークンの系列に圧縮するための離散自己符号化器を用いる。
- 自己回帰的Transformer(G)は、潜在コードと行動系列から将来のフレームトークン、報酬、エピソード終了信号を予測することで、環境のダイナミクスをモデル化する。
- 方策ネットワーク(π)は、世界モデルと想像上の状態で相互作用することで、予測された将来の状態に基づいて行動を生成する。
- 世界モデルは、方策学習を開始する前に、環境との相互作用データの少量を用いて自己教師付きで事前学習される。
- 全システムは、再構成損失、報酬と終了信号の予測損失、強化学習による方策最適化の組み合わせを用いて、エンドツーエンドで訓練される。
- ゲーティング層のような複雑な変更を避け、自己教師付き事前学習の安定性に依存する。
実験結果
リサーチクエスチョン
- RQ1離散自己符号化器を用いたTransformerベースの世界モデルは、最小限の相互作用データから高精度で長時間にわたる環境モデリングを達成できるか?
- RQ2わずか2時間の実環境相互作用データのみで、想像上の学習に特化した方策が、人間水準のパフォーマンスを上回ることができるか、その程度はいかほどか?
- RQ3離散自己符号化器と自己回帰的Transformerの組み合わせは、従来のモデルベース強化学習手法と比較して、どの程度サンプル効率に優れているか?
- RQ4世界モデルは、ゲームメカニクスの深い理解を反映した、リアルでピクセル単位の正確な予測を生成できるか?
- RQ5先行探索を一切用いずに、想像に基づく訓練に依存するだけで、SOTAのパフォーマンスを達成することは可能か?
主な発見
- irisは、Atari 100kベンチマークで、わずか2時間分の実プレイに相当するデータのみを用いて、平均の人間正規化スコア1.046を達成した。
- エージェントは26ゲーム中の10ゲームで人間プレーヤーを上回り、サンプル効率の高い環境下で超人間レベルのパフォーマンスを示した。
- 世界モデルは、いくつかのゲームで非常に正確でピクセル単位の正確な予測を生成しており、ゲームメカニクスに対する深い理解を示している。
- 先行探索を用いないアプローチの中で、SOTAのパフォーマンスを達成し、DreamerV2などの先行手法をサンプル効率の面で上回った。
- 世界モデルは強力な生成能力を示し、想像ベースの訓練中に豊富で多様なゲームプレイ体験を可能にした。
- 従来のエージェントと比較して、最小限のハイパーパrameterチューニングで安定しており、一般化性能が高く、導入も容易であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。