Skip to main content
QUICK REVIEW

[論文レビュー] Scaling Imitation Learning in Minecraft

Artemij Amiranashvili, Nicolai Dorka|arXiv (Cornell University)|Jul 6, 2020
Human Pose and Action Recognition参考文献 20被引用数 7
ひとこと要約

この論文は、鉄のピックアックスの作成など、複雑で報酬が疎であるMinecraftのタスクを習得するための強力な模倣学習フレームワークを提示している。専門家の行動データとアーキテクチャの革新を用い、Deep Impalaネットワーク、交差エントロピー損失、データ拡張、Treechopの行動データを組み合わせることで、74.5の平均報酬という最先端の性能を達成した。これは、先行手法や強化学習のベースラインを上回った。

ABSTRACT

Imitation learning is a powerful family of techniques for learning sensorimotor coordination in immersive environments. We apply imitation learning to attain state-of-the-art performance on hard exploration problems in the Minecraft environment. We report experiments that highlight the influence of network architecture, loss function, and data augmentation. An early version of our approach reached second place in the MineRL competition at NeurIPS 2019. Here we report stronger results that can be used as a starting point for future competition entries and related research. Our code is available at https://github.com/amiranas/minerl_imitation_learning.

研究の動機と目的

  • Minecraftのような報酬が疎でアクション空間が広い環境における強化学習のデータ非効率性を解決すること。
  • ネットワークアーキテクチャ、損失関数、データ拡張が画像ベースの3次元環境における模倣学習のパフォーマンスに与える影響を評価すること。
  • 今後のMineRLコンペティション参加やインマージブルな環境における模倣学習の研究のための強力なベースラインを確立すること。
  • 訓練中に環境との相互作用なしに模倣学習が近似的に最適なパフォーマンスに到達できることを示すこと。

提案手法

  • 本手法は、Minecraft-v0データセットに含まれる専門家の行動データを用い、鉄のピックアックスを入手するタスクについて500時間を超える人間の経路データを含む。
  • 入力観測値として1人称視点とリソースインVENTORYを用い、畳み込みエンコーダーと再帰的処理を経由するDeep Impalaニューラルネットワークアーキテクチャを採用している。
  • 専門家の行動に対して交差エントロピー損失を用いてポリシーを訓練しており、画像の反転、明るさ調整、シャープネス、コントラスト、ポスタリゼーションなどの追加的なデータ拡張を実施している。
  • 関連するサブタスクにおける一般化とパフォーマンス向上を図るため、追加のTreechop行動データを統合している。
  • パフォーマンスは100エピソードの平均報酬で評価され、複数回の訓練ランの平均と標準偏差が報告されている。
  • 本手法はDQfDおよびRainbow RLエージェントと比較され、報酬が疎な環境における相対的パフォーマンスを評価している。

実験結果

リサーチクエスチョン

  • RQ1DQN、Impala、Deep Impalaなどの異なるニューラルネットワークアーキテクチャは、Minecraftにおける模倣学習のパフォーマンスにどのように影響するか?
  • RQ2画像の反転、明るさ、コントラストなどのデータ拡張技術は、ポリシーの一般化と最終的なパフォーマンスにどのような影響を与えるか?
  • RQ3交差エントロピー損失とマージン損失の違いは、模倣学習におけるポリシーの安定性と報酬にどのように影響するか?
  • RQ4報酬が疎で観測空間が広い環境、例えばMinecraftにおいて、模倣学習は強化学習を上回ることができるか?
  • RQ5関連タスク(例:Treechop)からの追加の行動データを統合することで、ターゲットタスクにおけるパフォーマンスはどのように向上するか?

主な発見

  • 交差エントロピー損失と完全なデータ拡張(反転、明るさ、長方形除去)を組み合わせたDeep Impalaネットワークは、鉄のピックアックスタスクで53.4 ± 7.5の最高平均報酬を達成した。
  • 最も優れたパフォーマンスを示したポリシーは、交差エントロピー損失とTreechop行動データを用い、3回の訓練ランで平均報酬74.5を達成した。これは、以前のコンペティション参加エントリ(42.4)とトップのRLベースラインを著しく上回った。
  • データ拡張、特に画像の反転と明るさ調整により、報酬は49.7 ± 2.0から53.4 ± 7.5に向上し、一般化への強力な利点が示された。
  • argmax行動選択を用いた交差エントロピー損失は、マージン損失や組み合わせ損失(マージン+TD)を上回った。これは、この設定ではハイブリッドDQfDスタイルの訓練よりも純粋な模倣学習がより効果的であることを示唆している。
  • 模倣学習はたった50,000ステップの訓練でほぼ最適なパフォーマンスに到達したが、Rainbow RLは3回の訓練ランのうち2回で非ゼロ報酬を達成できず、模倣学習のデータ効率の高さが顕著に示された。
  • ポリシーは82%のエピソードで石のピックアックスに到達でき、まれに鉄インゴットを入手できたが、鉄のピックアックスの作成は依然として稀(1%の成功率)であり、長期間にわたる逐次意思決定の課題が残っていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。