[論文レビュー] Addressing reward bias in Adversarial Imitation Learning with neutral reward functions
本稿では、単一または複数の終端状態を有するタスクベースの環境において、生存バイアスおよび終了バイアスを解消する中立的報酬関数を、生成対抗的模倣学習(GAIL)に提案する。標準の正または負の報酬関数に代えて、対称的な対数比形式を用いることで、優れた模倣性能を達成し、複雑な終了ダイナミクスを有する環境において、既存のGAILおよびDAC手法を上回る性能を発揮する。
Generative Adversarial Imitation Learning suffers from the fundamental problem of reward bias stemming from the choice of reward functions used in the algorithm. Different types of biases also affect different types of environments - which are broadly divided into survival and task-based environments. We provide a theoretical sketch of why existing reward functions would fail in imitation learning scenarios in task based environments with multiple terminal states. We also propose a new reward function for GAIL which outperforms existing GAIL methods on task based environments with single and multiple terminal states and effectively overcomes both survival and termination bias.
研究の動機と目的
- GAILにおける報酬バイアス、特に生存バイアスおよび終了バイアスを特定・解決すること。これは、タスクベースの環境における模倣を妨げる要因である。
- 複数の終端状態を有する環境において、既存の報酬関数(正/負)が最適でない方策を導くメカニズムを分析すること。
- 生存や早期終了に対してバイアスをかけない中立的報酬関数を提案し、多様なタスクベースの設定において堅牢な模倣を可能にすること。
- 単一および複数の終端状態を有する環境において、DACおよび標準のGAIL変種と比較して、中立的報酬関数の優位性を実証的に検証すること。
提案手法
- 判別器の出力 $ D(s,a) $ を用いて定義される新しい報酬関数 $ R = \log(D(s,a)) - \log(1 - D(s,a)) $ を提案し、対称的かつ中立的な報酬信号を生成する。
- 標準の $ \log(D(s,a)) $ または $ -\log(1 - D(s,a)) $ の形式に代えて、この中立的報酬をGAILフレームワークに統合し、生存や終了に偏ったバイアスを回避する。
- ポリシーが判別器からの中立的報酬信号を最大化するように最適化される、標準のGAILトレーニングパイプラインとオンポリシー強化学習アルゴリズムを用いる。
- 判別器を、専門家の遷移と専門家を模倣する軌道を区別するように訓練し、GAILの目的関数を維持するが、バランスの取れた報酬信号を提供する。
- ポリシーおよび価値ネットワークに2層のMLPとLeaky ReLU活性化関数を用い、結果の信頼性を高めるために3つの異なる乱数シードで平均化する。
- 成功確率と環境報酬の両方を用いて、終端状態構造が異なる5つのMiniGrid環境での性能を評価する。
実験結果
リサーチクエスチョン
- RQ1GAILにおける正または負の報酬関数は、複数の終端状態を有するタスクベースの環境で、どのように生存バイアスおよび終了バイアスを引き起こすか?
- RQ2DACのような既存の手法は、単純な設定ではバイアスを是正しているが、複数の終端状態を有するタスクベースの環境ではなぜ失敗するのか?
- RQ3生存や終了に偏らない中立的報酬関数は、複雑なタスクベースの環境において模倣性能を向上させることができるか?
- RQ4提案された中立的報酬関数は、単一および複数の終端状態を有する環境において、正または負の報酬ベースラインおよびDACを上回る性能を発揮するか?
主な発見
- 中立的報酬関数は、EmptyおよびDoorKey環境で成功確率 1.00 ± 0.00 を達成し、専門家の性能に等しく、すべてのベースラインを上回った。
- GoToDoorでは、中立的報酬関数が 0.97 ± 0.15 の成功確率を達成し、DAC(0.26 ± 0.44)および負の報酬(0.38 ± 0.48)を著しく上回った。
- RedBlueDoors環境では、中立的報酬関数が 0.91 ± 0.27 の成功確率を達成し、DAC(0.70 ± 0.45)および負の報酬(0.00 ± 0.00)を上回った。
- DistShift環境では、中立的報酬関数が 0.97 ± 0.15 の成功確率を達成し、DAC(0.76 ± 0.42)および負の報酬(0.65 ± 0.47)を上回った。
- 正の報酬を用いたGAILは、複数の終端状態を有する環境すべてで完全に失敗し、成功確率 0.00 ± 0.00 を記録した。
- 負の報酬関数は、GoToDoorでわずか 0.25 ± 0.43 の成功確率にとどまり、正しいドアに到達する確率がランダムな場合の影響による強い終了バイアスを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。