Skip to main content
QUICK REVIEW

[論文レビュー] Imitation Learning from Pixel-Level Demonstrations by HashReward

Xin-Qiang Cai, Yao-Xiang Ding|arXiv (Cornell University)|Sep 9, 2019
Multimodal Machine Learning Applications参考文献 39被引用数 4
ひとこと要約

本論文は、高次元ピクセル環境における次元削減と識別的学習のバランスをとるために教師ありハッシングを用いる、新しい模倣学習手法HashRewardを提案する。埋め込み学習と報酬生成を共同で最適化することで、HashRewardは効果的な敵対的模倣学習を可能にし、AtariおよびMuJoCoベンチマークにおいて、最先端の手法を著しく上回る性能を発揮する。

ABSTRACT

One of the key issues for imitation learning lies in making policy learned from limited samples to generalize well in the whole state-action space. This problem is much more severe in high-dimensional state environments, such as game playing with raw pixel inputs. Under this situation, even state-of-the-art adversary-based imitation learning algorithms fail. Through empirical studies, we find that the main cause lies in the failure of training a powerful discriminator to generate meaningful rewards in high-dimensional environments. Although it seems that dimensionality reduction can help, a straightforward application of off-the-shelf methods cannot achieve good performance. In this work, we show in theory that the balance between dimensionality reduction and discriminative training is essential for effective learning. To achieve this target, we propose HashReward, which utilizes the idea of supervised hashing to realize such an ideal balance. Experimental results show that HashReward could outperform state-of-the-art methods for a large gap under the challenging high-dimensional environments.

研究の動機と目的

  • 敵対的模倣学習が高次元状態空間、特に生のピクセル入力において失敗する問題に対処すること。
  • 既存手法における性能低下の原因が、次元削減と識別的学習の間のアンバランスに起因することを特定すること。
  • 次元削減中に識別的情報を保持しつつ、効果的な報酬信号生成を可能にする統合フレームワークを設計すること。
  • 限られた専門家デモンストレーションの下で、一般化性能とサンプル効率を向上させること。
  • 教師ありハッシングが敵対的模倣学習における識別性と報酬生成のトレードオフを効果的にバランスできることを実証すること。

提案手法

  • 敵対的模倣学習と統合された教師ありハッシングを組み合わせた共同最適化フレームワークであるHashRewardを提案する。
  • 専門家と専門家に類似したポリシーの軌道から64ビットのハッシュコードを学習するためのシアンプルネットワークアーキテクチャを用いる。
  • 埋め込み空間における識別的構造を保持するため、ハードネガティブマイニングを伴うコントラスト損失を導入する。
  • ハッシュコードを入力として受けるディスクラミネーターを採用し、意味的類似性に基づいて意味のある報酬信号を生成可能にする。
  • ディスクラミネーターの損失に分類とコントラストの両方の監督を組み合わせたGAILに類似した目的関数を用いて、ポリシーとディスクラミネーターをエンドツーエンドで訓練する。
  • 学習済み埋め込みの安定性と一般化性能を向上させるために、温度スケーリングを施したコントラスト損失を適用する。

実験結果

リサーチクエスチョン

  • RQ1なぜ最先端の敵対的模倣学習手法が高次元ピクセル環境で失敗するのか?
  • RQ2模倣学習における非教師付き次元削減を用いる際に性能が低下する原因は何か?
  • RQ3次元削減と識別的学習をどのようにバランスさせれば、意味のある報酬信号を保持できるか?
  • RQ4教師ありハッシングは、次元削減の際の識別的情報を効果的に保持しながら、模倣学習に有効に機能するか?
  • RQ5ハッシングと識別性のための統合的なトレーニング手順は、分離された事前学習に比べて、より優れたポリシー一般化をもたらすか?

主な発見

  • HashRewardは、AtariゲームにおいてGAIL、VAIL、GAIL-UHを著しく上回り、より高い最終報酬と高速な収束を達成した。
  • HashRewardの疑似報酬曲線は真の報酬とよく一致しており、安定的で意味のある報酬信号を示している。これに対して、GAIL-UHやVAILは、不良または偏った報酬信号を示している。
  • t-SNE可視化により、HashRewardの埋め込みは、時間の経過とともに専門家とポリシーのサンプル間の重なりが増加するグローバルにクラスタ構造を持つことが確認され、ポリシーの模倣が向上していることが示された。
  • 64ビット埋め込みの分析から、トレーニングの進行に従い、ポリシーが生成するコードが専門家コードに次第に近づくことが分かった。これは、HashRewardが意味的で構造的な埋め込み空間を学習していることを検証するものである。
  • HashRewardのディスクラミネーターは過剰な識別を避け、識別と報酬生成のバランスの取れたトレードオフを維持している。これに対して、GAILやGAIL-AEは識別に過剰に適合し、過学習を起こしている。
  • 実験により、非教師付きハッシング(例:GAIL-UH)は識別的情報を保持できず、効果のない報酬信号と劣悪なポリシー性能をもたらすことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。