[論文レビュー] Offline Reinforcement Learning with Pseudometric Learning
本稿では、ログされた遷移から状態-行動擬似距離を学習することで、分布外行動の外挿を低減する、オフライン強化学習手法PLOffを提案する。この学習済み擬似距離を用いてアクタ・クリティックフレームワーク内で照合ベースのボーナスを計算することで、PLOffはD4RLのハンド操作およびロケモーションタスクにおいて、既存の最先端手法と同等またはそれを上回る性能を達成し、タスクに特化した近接度測定をもたらす。
Offline Reinforcement Learning methods seek to learn a policy from logged transitions of an environment, without any interaction. In the presence of function approximation, and under the assumption of limited coverage of the state-action space of the environment, it is necessary to enforce the policy to visit state-action pairs close to the support of logged transitions. In this work, we propose an iterative procedure to learn a pseudometric (closely related to bisimulation metrics) from logged transitions, and use it to define this notion of closeness. We show its convergence and extend it to the function approximation setting. We then use this pseudometric to define a new lookup based bonus in an actor-critic algorithm: PLOFF. This bonus encourages the actor to stay close, in terms of the defined pseudometric, to the support of logged transitions. Finally, we evaluate the method on hand manipulation and locomotion tasks.
研究の動機と目的
- 関数近似が用いられる際のオフライン強化学習における分布外行動外挿問題に対処すること。
- 過去の双方向シミュレーション距離の研究をオフラインおよび状態-行動設定に拡張し、ログされた遷移からタスクに適した状態-行動ペアの擬似距離を学習すること。
- この擬似距離に基づくボーナス機構を設計し、方策がログされたデータのサポートから離れないように促進すること。
- この擬似距離に基づくボーナスを標準的なアクタ・クリティックアルゴリズムに統合し、サンプル効率と性能を向上させること。
- D4RLベンチマークの挑戦的タスクにおいて本手法を実証的に検証し、既存の最先端オフラインRL手法と同等以上の性能を示すこと。
提案手法
- 本手法は、シアンプソンネットワークにインspiredされたニューラルネットワークアーキテクチャを用いて、期待リターンの差に基づくコントラスト型損失により訓練される、状態-行動ペアにおける擬似距離を学習する。
- この擬似距離は、共有される行動シーケンスにわたる累積報酬差に基づく類似度を測るベルマンに類似した作用素の不動点として定義される。
- 学習済み擬似距離を用いて照合ベースのボーナスを計算し、ログされた遷移のサポートから離れた行動をペナルティ付ける。
- ボーナスは2通りの方法で適用される:アクター更新時に非許容行動をフィルタリングするため、およびクリティック評価時に分布外行動に対して高い価値予測をペナルティ付けるため。
- 状態-行動ペアの統合埋め込みと擬似距離の計算を同時に実行するニューラルネットワークアーキテクチャを用いて、関数近似へと拡張する。
- 学習手順は反復的であり、オフラインデータセットを複数回走査することで、擬似距離を段階的に改善する。
実験結果
リサーチクエスチョン
- RQ1オフライン強化学習において、ログされた遷移のサポートに近接するかを測る、学習済みの状態-行動ペアの擬似距離は、有効に機能するか?
- RQ2このような擬似距離を用いて、関数近似設定における外挿誤差を低減する実用的なボーナスを設計できるか?
- RQ3提案されたPLOff手法は、標準ベンチマーク環境において、既存のオフラインRLアルゴリズムを上回る性能を示すか?
- RQ4擬似距離学習手順は、表形式およびディープラーニング設定の両方で安定的かつ収束するか?
- RQ5行動クラッシングや分布制約を用いる手法と比較して、PLOffの性能はどのように異なるか?
主な発見
- PLOffはD4RLベンチマークのハンド操作スイートにおいて、最先端の性能を達成し、既存手法を上回る。
- ロケモーションタスクでは、比較対象手法の中で2位を記録し、多様な制御環境にわたる優れた一般化性能を示している。
- 学習済み擬似距離はMDP内の構造的類似性を的確に捉えており、分布外行動のフィルタリングに効果的である。
- 本手法は表形式設定では収束を示し、ニューラルネットワークによる関数近似へも良好に一般化される。
- オフライン設定において、分布制約や行動クラッシングよりも、擬似距離に基づくボーナスがより効果的なインダクティブバイアスを提供する。
- 計算コストは、特に低データ環境において、向上したロバストネスと性能によって正当化される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。