Skip to main content
QUICK REVIEW

[論文レビュー] Offline Imitation Learning with Variational Counterfactual Reasoning

Bowei He, Zexu Sun|arXiv (Cornell University)|Oct 7, 2023
Machine Learning in HealthcareComputer Science被引用数 3
ひとこと要約

本論文は、識別可能な変分オートエンコーダーを用いて反事後的専門家軌道を生成し、データ拡張に活用する、OILCAと呼ばれる新しいオフライン強化学習フレームワークを提案する。この手法により、専門家データが少ない状況下でも、ポリシーの一般化性能が顕著に向上する。本手法は、因果的根拠に基づいた分離可能なデータ合成により、耐性を高めることで、イン・ディストリビューション(DeepMind Control Suite)およびアウト・オブ・ディストリビューション(CausalWorld)のベンチマークにおいて、強力なベースラインを上回る性能を発揮する。

ABSTRACT

In offline imitation learning (IL), an agent aims to learn an optimal expert behavior policy without additional online environment interactions. However, in many real-world scenarios, such as robotics manipulation, the offline dataset is collected from suboptimal behaviors without rewards. Due to the scarce expert data, the agents usually suffer from simply memorizing poor trajectories and are vulnerable to variations in the environments, lacking the capability of generalizing to new environments. To automatically generate high-quality expert data and improve the generalization ability of the agent, we propose a framework named \underline{O}ffline \underline{I}mitation \underline{L}earning with \underline{C}ounterfactual data \underline{A}ugmentation (OILCA) by doing counterfactual inference. In particular, we leverage identifiable variational autoencoder to generate extit{counterfactual} samples for expert data augmentation. We theoretically analyze the influence of the generated expert data and the improvement of generalization. Moreover, we conduct extensive experiments to demonstrate that our approach significantly outperforms various baselines on both extsc{DeepMind Control Suite} benchmark for in-distribution performance and extsc{CausalWorld} benchmark for out-of-distribution generalization. Our code is available at \url{https://github.com/ZexuSun/OILCA-NeurIPS23}.

研究の動機と目的

  • 限られた専門家デモしか利用できない状況における、オフライン強化学習における一般化性能の悪化という課題に対処すること。
  • ラベルなしのオフラインデータに含まれる最適でないまたはノイジーな軌道によって引き起こされる性能低下を軽減すること。
  • オンライン相互作用なしに、イン・ディストリビューションおよびアウト・オブ・ディストリビューションの環境におけるポリシーの一般化性能を向上させること。
  • 反事後的推論を用いて、理論的根拠に基づいた高品質な因果的妥当性を持つ専門家データを生成する手法を開発すること。

提案手法

  • フレームワークは、専門家データの潜在的構造をモデル化し、外生的変数を操作することで反事後的状態を生成する識別可能な変分オートエンコーダー(VAE)を採用する。
  • 反事後的軌道は、変更された状態でVAEを条件づけることで生成され、エージェントが異なるように行動する「もし〜なら」のシナリオをシミュレートする。
  • 外生的変数が観測されない環境的変動を捉える構造的因果モデル(SCM)を通じて、因果的構造を導入する。
  • 生成された反事後的専門家データは、トレーニングデータセットの拡張に使用され、分布シフトに対するポリシーの耐性が向上する。
  • 理論的分析により、外生的変数の分離が反事後的妥当性の識別可能性を保証し、一般化誤差をバインドすることを示している。
  • サンプリングポリシーを用いて、拡張データの影響を評価し、生成された軌道が多様かつ行動的に整合的であることを保証する。

実験結果

リサーチクエスチョン

  • RQ1限られた専門家データ下でのオフライン強化学習において、反事後的推論はポリシーの一般化性能を向上させ得るか?
  • RQ2オンライン相互作用なしに、最適でないオフラインデータセットから高品質で因果的妥当性を持つ専門家データを生成する方法は何か?
  • RQ3反事後的データ拡張がポリシー一般化誤差バウンドに与える理論的影響は何か?
  • RQ4VAEにおける外生的変数の分離は、生成された軌道の品質および多様性にどのように影響するか?
  • RQ5提案手法は、イン・ディストリビューションおよびアウト・オブ・ディストリビューションの一般化設定において、既存のオフラインILベースラインを上回るか?

主な発見

  • DeepMind Control Suiteベンチマークでは、OILCAはイン・ディストリビューション一般化において最先端の性能を達成し、ORIL や DWBC といったすべてのベースラインを上回った。
  • CausalWorldベンチマークでは、OILCAは全タスクにおける平均リターンが最高であり、スタックド・ブロックスのタスクでBC-expに対して2.6倍の向上を示した(2617.71 ± 88.07 対 1000.00 ± 0.00)。
  • BCND や LobsDICE とは異なり、OILCAは誤差蓄積や過度に保守的な正則化による性能劣化を回避している。
  • CausalWorldのリーチングタスクでは、OILCAが976.60 ± 20.13のリターンを達成し、2番目に良い手法(DWBC: 479.92 ± 18.75)の2倍以上に達した。
  • タワーのタスクでは、OILCAが994.82 ± 5.76を達成し、次に良い手法(768.68 ± 24.77)を225ポイント以上上回った。
  • アブレーションスタディにより、反事後的データ拡張が不可欠であることが確認され、これを除去すると、標準的な行動コーディングと同等の性能低下が生じた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。