Skip to main content
QUICK REVIEW

[論文レビュー] Playing Minecraft with Behavioural Cloning

Anssi Kanervisto, Janne Karttunen|arXiv (Cornell University)|May 7, 2020
Artificial Intelligence in Games参考文献 23被引用数 4
ひとこと要約

本論文では、人間のプレイデモを用いた行動学習(BC)アプローチを提示し、Minecraft用のエージェントを訓練した。このアプローチはMineRL 2019コンテストで5位を達成した。単純であるが故に、訓練の停止タイミング、行動分布におけるクラス不均衡、およびエンジニアリングの選択に強く依存しており、強化学習と同様にBCに対しても注意深いチューニングと分散の報告が求められることを示している。

ABSTRACT

MineRL 2019 competition challenged participants to train sample-efficient agents to play Minecraft, by using a dataset of human gameplay and a limit number of steps the environment. We approached this task with behavioural cloning by predicting what actions human players would take, and reached fifth place in the final ranking. Despite being a simple algorithm, we observed the performance of such an approach can vary significantly, based on when the training is stopped. In this paper, we detail our submission to the competition, run further experiments to study how performance varied over training and study how different engineering decisions affected these results.

研究の動機と目的

  • 強化学習の不安定性を回避するため、行動学習のみを用いて、Minecraft用にロバストでサンプル効率の高いエージェントを開発すること。
  • 行動学習が単純であるにもかかわらず、訓練の繰り返しにおいて性能が著しく異なる理由を調査すること。
  • データセットのサンプリング戦略、クラス不均衡、データ拡張がエージェントの性能に与える影響を分析すること。
  • 早期停止、リプレイメモリ、ラベルスムージングといったエンジニアリング意思決定が行動学習の結果に与える影響を評価すること。
  • 強化学習のベストプラクティスに従い、行動学習の結果についても分散の報告を提唱すること。

提案手法

  • エージェントは、MineRLデータセットからの人間のデモを模倣して、観測から行動を予測する教師あり学習を用いる。
  • 検証性能に基づき、特定のエポックで訓練を停止させ、過学習や分布シフトを回避するための早期停止を適用する。
  • 特にレアな行動の予測を改善するために、訓練データから再サンプリングするリプレイメモリバッファを用いて学習の安定化を図る。
  • 不均衡なデータセットにおける過剰に代表される行動へのバイアスを軽減するために、ラベルスムージングを適用する。
  • 性能が低いレアな行動(例:工作、工作台の設置)を補完するために、ハードコードされた行動を用い、最終的な性能を向上させる。
  • モデルはビジョンベースの観測空間と離散的行動空間で訓練され、13の離散的行動と2つの連続的カメラ操作を含む。

実験結果

リサーチクエスチョン

  • RQ1Minecraftにおける行動学習エージェントの性能は、異なる訓練エポックでどのように変化するのか。その変動の原因は何か?
  • RQ2人間のプレイデモデータセットにおけるクラス不均衡は、エージェントがレアだが重要な行動を学習する能力にどの程度影響を与えるか?
  • RQ3データサンプリング、リプレイメモリ、ラベルスムージングといったエンジニアリングの選択が、行動学習性能に与える影響は何か?
  • RQ4代表されない行動に対してハードコードされた行動を適用することで、複雑な環境におけるサンプル効率の良い模倣学習が著しく向上するか?
  • RQ5行動学習が単純な教師あり学習法であるにもかかわらず、なぜ性能に高いばらつきが生じるのか?

主な発見

  • エージェントはMineRL 2019コンテストで5位を達成し、行動学習が視覚ベースの複雑な環境において強化学習と競合可能な性能を発揮できることを示した。
  • 訓練の停止タイミングに大きく依存しており、最適な停止タイミングでは評価スコアが30–92%向上した。
  • データセットに極めて低い頻度で登場する(例:木のピックアックスの工作は0.01%)にもかかわらず、モデルは50%以上の確率でその行動を予測できた。これはある程度の一般化能力があることを示している。
  • 必要な際でも、工作台の設置に99.52%の確率で「なし」の行動を選択し続け、重要な行動を実行できないという深刻な失敗を示した。
  • 工作や工作台の設置にハードコードされた行動を追加することで、評価スコアが30–92%向上し、1つのエージェントは200試行中3試行で報酬291を達成した。
  • クラスのレア度に応じて損失を重み付けするか、共通行動をアンダーサンプリングしても結果の向上が得られず、より洗練されたサンプリング手法(例:SMOTE)の導入が求められると示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。