Skip to main content
QUICK REVIEW

[論文レビュー] Object-Aware Regularization for Addressing Causal Confusion in Imitation Learning

Jongjin Park, Younggyo Seo|arXiv (Cornell University)|Oct 26, 2021
Reinforcement Learning in Robotics参考文献 56被引用数 5
ひとこと要約

本論文では、行動コーディングにおける因果的誤認知を軽減するために、意味的オブジェクトに均等に注目するよう促すことで、模倣学習における行動コーディングの性能を向上させる、オブジェクトに配慮した正則化(OREO)を提案する。VQ-VAEを用いてオブジェクトレベルの離散的コードを特定し、学習中に全般的に意味的オブジェクトをランダムにマスキングすることで、一般化性能が著しく向上し、AtariおよびCARLA環境において、従来の正則化法や因果関係に基づく手法を上回る性能を発揮する。さらに、膨大な環境インタラクションを要する逆強化学習をも凌駆する結果を示している。

ABSTRACT

Behavioral cloning has proven to be effective for learning sequential decision-making policies from expert demonstrations. However, behavioral cloning often suffers from the causal confusion problem where a policy relies on the noticeable effect of expert actions due to the strong correlation but not the cause we desire. This paper presents Object-aware REgularizatiOn (OREO), a simple technique that regularizes an imitation policy in an object-aware manner. Our main idea is to encourage a policy to uniformly attend to all semantic objects, in order to prevent the policy from exploiting nuisance variables strongly correlated with expert actions. To this end, we introduce a two-stage approach: (a) we extract semantic objects from images by utilizing discrete codes from a vector-quantized variational autoencoder, and (b) we randomly drop the units that share the same discrete code together, i.e., masking out semantic objects. Our experiments demonstrate that OREO significantly improves the performance of behavioral cloning, outperforming various other regularization and causality-based methods on a variety of Atari environments and a self-driving CARLA environment. We also show that our method even outperforms inverse reinforcement learning methods trained with a considerable amount of environment interaction.

研究の動機と目的

  • 行動コーディングにおける因果的誤認知を解消すること。具体的には、Atariにおけるスコアなど、誤った相関関係(スコアなど)に依存するのではなく、真の因果的意思決定ルールを学習すること。
  • ポリシーがすべての意味的オブジェクトに均等に注目するよう正則化する手法を開発すること。これにより、余分な変数への過剰依存を防ぐ。
  • 逆強化学習やインタラクティブな因果発見と異なり、高価な環境インタラクションを必要としない、強固な模倣学習の性能を達成すること。
  • 意味的マスキングによるオブジェクトに配慮した正則化が、混同された環境において優れた一般化性能と性能をもたらすことを実証すること。

提案手法

  • 画像特徴から離散的コードを抽出するために、ベクトル量子化変分オートエンコーダ(VQ-VAE)を用いる。これにより、類似した意味的性質(例:背景、スコア)を持つ空間的ユニットが同じコードにグループ化される。
  • VQ-VAEが出力する同じ離散的コードを持つ特徴マップユニットの集合として、意味的オブジェクトを特定する。
  • 学習中に、同じ離散的コードに関連するすべてのユニットをランダムにマスキングすることで、実質的に全般的な意味的オブジェクトをマスキングする。
  • ポリシーが特定の意味的オブジェクトの有無に依存しないように正則化することで、均等な注目を促進し、誤った手がかりへの依存を低減する。
  • 標準的な行動コーディングと同様に、マスクされた画像を入力として用いて、ポリシーをエンドツーエンドで最適化する。
  • すべての環境で同じVQ-VAEエンコーダを使用することで、タスク固有の再トレーニングなしに一貫した意味的オブジェクト抽出が可能になる。

実験結果

リサーチクエスチョン

  • RQ1意味的オブジェクトに均等に注目するよう促すことで、オブジェクトに配慮した正則化が、行動コーディングにおける因果的誤認知を軽減できるか?
  • RQ2VQ-VAEのコードを用いて意味的オブジェクト全体をマスキングすることで、混同された環境におけるポリシーの一般化性能が向上するか?
  • RQ3この手法は、環境インタラクションを要しない既存の正則化法や因果関係に基づくアプローチを上回るか?
  • RQ4逆強化学習手法(広範な環境インタラクションを要する)と比較して、OREOはどのように性能を発揮するか?

主な発見

  • OREOは、混同されたAtari環境における行動コーディング性能を顕著に向上させ、17ゲームにわたる中央値のヒューマン正規化スコア(HNS)を46.7%から53.6%に向上させた。
  • CARLA自動運転環境において、OREOは標準的な行動コーディングや他の正則化手法を上回る優れた性能を発揮した。
  • インタラクティブな専門家クエリや環境フィードバックを必要とするde Haanらが提唱した因果関係ベースの手法よりも、OREOは優れた性能を示した。
  • 平均して、OREOはAtariゲームで114.9%の平均HNSを達成し、次に優れた手法(91.7%)を大きく上回り、強力な一般化性能を示した。
  • Pong環境では、OREOで訓練されたポリシーはマスクされたスコア画像に対しても一般化し(12.5 ± 0.7の報酬)、一方で標準的なBCポリシーは失敗した(3.1 ± 1.4の報酬)。これは、誤った手がかりへの依存が低減されたことを確認している。
  • OREOは、膨大な環境インタラクションを要する逆強化学習手法でさえも凌駆しており、低データ量・非インタラクティブな環境設定においても効果的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。