Skip to main content
QUICK REVIEW

[論文レビュー] Discriminator-Weighted Offline Imitation Learning from Suboptimal Demonstrations

Haoran Xu, Xianyuan Zhan|arXiv (Cornell University)|Jul 20, 2022
Reinforcement Learning in Robotics被引用数 9
ひとこと要約

本論文では、劣化した示範データが多数を占める状況下でも、行動変容学習(BC)ポリシーと示範データと非示範データを区別するための識別器を同時に学習させることで、劣化した示範データからのポリシー学習を改善する、軽量なオフライン強化学習アルゴリズム「識別器重み付き行動変容学習(DWBC)」を提案する。識別器の出力がBC損失を重みづけするため、劣化データが支配的であってもロバストな模倣が可能となり、報酬学習やオフラインRLを必要としないベースラインと比較して、より高い報酬と高速な学習が達成される。

ABSTRACT

We study the problem of offline Imitation Learning (IL) where an agent aims to learn an optimal expert behavior policy without additional online environment interactions. Instead, the agent is provided with a supplementary offline dataset from suboptimal behaviors. Prior works that address this problem either require that expert data occupies the majority proportion of the offline dataset, or need to learn a reward function and perform offline reinforcement learning (RL) afterwards. In this paper, we aim to address the problem without additional steps of reward learning and offline RL training for the case when demonstrations contain a large proportion of suboptimal data. Built upon behavioral cloning (BC), we introduce an additional discriminator to distinguish expert and non-expert data. We propose a cooperation framework to boost the learning of both tasks, Based on this framework, we design a new IL algorithm, where the outputs of discriminator serve as the weights of the BC loss. Experimental results show that our proposed algorithm achieves higher returns and faster training speed compared to baseline algorithms.

研究の動機と目的

  • エキスパートの示範データが不足しており、劣化データがデータセットを支配する状況におけるオフライン模倣学習を解決すること。オンライン環境インタラクションやエキスパートのアノテーションを必要としない。
  • 劣化した、ノイズの多い示範データに対して行動変容学習のロバスト性を向上させるために、エキスパート軌道と非エキスパート軌道を区別する識別器を組み込むこと。
  • 高価な報酬学習やオフラインRLのファインチューニングステップを回避する、軽量で効率的なアルゴリズムを開発すること。
  • 訓練済みの識別器の信頼度スコアを用いて、環境とのインタラクションなしにオフラインポリシー選択を可能にすること。
  • ポリシーと識別器の両方の性能を共同で最適化する協調フレームワークを提供すること。

提案手法

  • エキスパート軌道と劣化軌道を分類する識別器を導入し、行動変容学習ポリシーとともに学習する。
  • ポリシーと識別器のトレーニングを共同で最適化する協調フレームワークを提案し、両タスクのパフォーマンスを向上させる。
  • 識別器のトレーニング中にロバスト性を確保するため、最悪ケース誤差最小化をポリシーの目的関数に適用する。
  • 得られた目的関数と一般化されたBC損失との間の同等性を導出する。ここで識別器の出力がBC損失関数内のサンプル重みとして機能する。
  • 識別器の出力をポリシー品質の代理指標として用い、環境とのインタラクションなしにオフラインポリシー選択を可能にする。
  • 従来の方法とは異なり、内側のRLループやアンサンブル学習を避けることで、計算効率を維持する。

実験結果

リサーチクエスチョン

  • RQ1エキスパートと劣化データを区別するように学習された識別器は、劣化データが大多数を占める状況下でも、行動変容学習の性能を向上させることができるか?
  • RQ2ポリシーと識別器のトレーニングを協調的に行うフレームワークは、独立したトレーニングよりも優れたパフォーマンスをもたらすか?
  • RQ3識別器の出力は、オンライン評価なしに、候補ポリシーの順位付けや最良選択に利用できるか?
  • RQ4提案手法は、報酬学習やオフラインRLのファインチューニングを必要とする既存のオフラインIL手法と比較して、より高いデータ効率と高速な学習を達成できるか?
  • RQ5識別器ベースの重み付け機構は、異なる環境や示範データの構成にわたって一般化しやすいか?

主な発見

  • DWBCは、Hopper、Walker2d、Penを含む複数の環境で、BC、BCND、ORIL、DemoDICEと比較してより高い報酬を達成する。特に劣化データが支配的である状況で顕著な性能向上を示す。
  • DWBCはORILやBCNDと比較して、著しく高速に学習が進み、標準BCと比較して実行時間はわずかに上回るにとどまる。計算的にも効率的である。
  • DWBCにおける識別器は、効果的なオフラインポリシー選択を可能にする。識別器の出力値は真のポリシー報酬と強く相関しており、オンライン評価なしに候補ポリシーの正確な順位付けが可能である。
  • ノイズの多いデータの割合が高い状況では、DemoDICEのKL正則化が過剰に慎重になりすぎるため、本手法はDemoDICEを上回る性能を発揮する。
  • 提案された協調フレームワークにより、識別器はよりロバストになり、ポリシーは独立して学習させるよりも正確になる。
  • 提案された目的関数と重み付きBC損失との同等性は、本手法の有効性を理論的に裏付けている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。