[論文レビュー] Imitation Learning by Estimating Expertise of Demonstrators
本論文では、オффラインの示範データから複数の示範者の状態に依存する熟練度を同時に学習する新しい模倣学習フレームワーク、ILEEDを提案する。不確実な熟練度推定を通じて示範者の非最適性をモデル化することで、ベースラインを上回り、最良の個々の示範者ですら上回る性能を達成し、23の環境のうち21で最終報酬が最大60%向上し、平均で7%の向上を達成した。
Many existing imitation learning datasets are collected from multiple demonstrators, each with different expertise at different parts of the environment. Yet, standard imitation learning algorithms typically treat all demonstrators as homogeneous, regardless of their expertise, absorbing the weaknesses of any suboptimal demonstrators. In this work, we show that unsupervised learning over demonstrator expertise can lead to a consistent boost in the performance of imitation learning algorithms. We develop and optimize a joint model over a learned policy and expertise levels of the demonstrators. This enables our model to learn from the optimal behavior and filter out the suboptimal behavior of each demonstrator. Our model learns a single policy that can outperform even the best demonstrator, and can be used to estimate the expertise of any demonstrator at any state. We illustrate our findings on real-robotic continuous control tasks from Robomimic and discrete environments such as MiniGrid and chess, out-performing competing methods in $21$ out of $23$ settings, with an average of $7\%$ and up to $60\%$ improvement in terms of the final reward.
研究の動機と目的
- 標準の模倣学習アルゴリズムが、実際の熟練度にかかわらずすべての示範者を同様に扱うという制限に対処すること。
- データセット内の最適行動と非最適行動を区別するために、示範者IDの情報を活用して模倣学習の性能を向上させること。
- 真のスキルレベルの事前知識がなくとも、ポリシーと状態に依存する示範者の熟練度レベルを同時に学習する共同モデルを開発すること。
- 非最適行動をフィルタリングし、複数の示範者の熟練度を統合することで、学習されたポリシーが最良の示範者をも上回ることを可能にすること。
提案手法
- ポリシー、状態埋め込み、示範者埋め込み、および状態に依存する熟練度レベルをパrameter化する共同確率モデルを導入する。
- 熟練度レベルρは、状態埋め込みと示範者埋め込みの関数としてモデル化され、状態ごとの示範者の質の評価が可能になる。
- 最大尤度推定を用いてポリシーと熟練度パrameterを同時に最適化し、反復的改善によって両者を向上させる。
- ニューラルネットワークを用いて状態と示範者の表現を学習し、多様な環境とタスクに一般化可能にする。
- 報酬信号を必要とせず、状態-行動ペアと示範者IDのみに依存して、オフラインの示範データをエンドツーエンドで学習する。
- 自己教師付きコンponentを含み、改善されたポリシー推定が状態および示範者埋め込みを精緻化し、その結果、熟練度推定が向上する。
実験結果
リサーチクエスチョン
- RQ1非均質な示範者を含むデータセットにおいて、示範者の熟練度を無教師で推定することで、模倣学習の性能が向上するか?
- RQ2ポリシーと熟練度レベルを同時に学習する共同モデルは、標準的な行動クラーニングや他の模倣学習ベースラインを上回るか?
- RQ3複数の示範者から得た混合品質の示範データを用いて学習した場合、最適ポリシーをどの程度回復できるか?
- RQ4特に、最良の示範者が特定の状態で非最適である場合に、モデルの性能は示範者の非最適性の度合いにどのように依存するか?
主な発見
- ILEEDは、23のテスト環境のうち21ですべてのベースラインを上回り、多様なタスクで一貫した向上を示した。
- 標準の模倣学習と比較して、最終報酬の平均で7%の向上を達成し、最も困難な設定では最大60%の向上を記録した。
- 3人の示範者を含むマルチスキル環境では、非最適性が高い状況(β < 0.5)において、ILEEDは最良の示範者をも上回るポリシーを学習した。
- β = 1.0(すべての示範が最適)の状況では、ILEEDは最良の示範者の89%の性能に達し、優れた一般化性と頑健性を示した。
- アブレーションスタディにより、状態埋め込みと示範者IDの両方がILEEDの性能にとって不可欠であることが確認され、それぞれが最終結果に顕著な寄与をした。
- モデルは高い精度で真の熟練度レベルを推定でき、データから意味のある非最適性パターンを回復できる能力を検証した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。