Skip to main content
QUICK REVIEW

[論文レビュー] Improving TD3-BC: Relaxed Policy Constraint for Offline Learning and Stable Online Fine-Tuning

Alex Beeson, Giovanni Montana|arXiv (Cornell University)|Nov 21, 2022
Reinforcement Learning in Robotics被引用数 8
ひとこと要約

本論文は、TD3-BCにおける行動変容(BC)の影響を、オフライン学習中に動的に弱める緩和されたポリシー制約を提案する。これにより、元のベースラインを上回る洗練されたポリシーが得られ、D4RLベンチマークで優れた性能を発揮するとともに、性能の低下を伴わずに安定したオンラインファインチューニングが可能になる。

ABSTRACT

The ability to discover optimal behaviour from fixed data sets has the potential to transfer the successes of reinforcement learning (RL) to domains where data collection is acutely problematic. In this offline setting, a key challenge is overcoming overestimation bias for actions not present in data which, without the ability to correct for via interaction with the environment, can propagate and compound during training, leading to highly sub-optimal policies. One simple method to reduce this bias is to introduce a policy constraint via behavioural cloning (BC), which encourages agents to pick actions closer to the source data. By finding the right balance between RL and BC such approaches have been shown to be surprisingly effective while requiring minimal changes to the underlying algorithms they are based on. To date this balance has been held constant, but in this work we explore the idea of tipping this balance towards RL following initial training. Using TD3-BC, we demonstrate that by continuing to train a policy offline while reducing the influence of the BC component we can produce refined policies that outperform the original baseline, as well as match or exceed the performance of more complex alternatives. Furthermore, we demonstrate such an approach can be used for stable online fine-tuning, allowing policies to be safely improved during deployment.

研究の動機と目的

  • データセットに存在しない行動が誤差の累積を引き起こす、オフライン強化学習における過大評価バイアスを是正すること。
  • TD3-BCにおける固定された行動変容(BC)重みの制限を克服し、示された行動を超えたポリシー改善を可能にすること。
  • オフライン事前学習後に性能の崩壊を伴わずに、デプロイ時における安定したオンラインファインチューニングを可能にすること。
  • 状態最良の性能を達成または上回るか、もしくは最小限のハイパーパrameterチューニングでシンプルさを維持すること。

提案手法

  • オフライン学習中に時間の経過とともに行動変容の影響を弱める動的BC重みスケジュールを導入する。
  • この緩和をTD3-BCに適用し、ポリシー更新の目的関数をBCに従う行動からポリシー勾配最適化へ段階的にシフトさせる。
  • BC係数αの減衰スケジュールを用い、初期段階では高い値に設定して過大評価を防ぎ、徐々に低下させてより良い行動の探索を可能にする。
  • Q値と状態を正規化して訓練を安定化させ、異なる環境間で一貫したスケーリングを保証する。
  • 標準的なRL更新ルールを用いて、洗練されたポリシーをオンラインファインチューニングに適用し、デプロイ時の安定性を維持する。
  • 50回の評価における平均正規化スコアと標準偏差を用い、D4RL-v2ベンチマークで性能を追跡する。

実験結果

リサーチクエスチョン

  • RQ1オフライン学習中に行動変容成分を動的に弱めることで、固定BCベースラインを上回るポリシー性能が向上するか?
  • RQ2TD3-BCが性能を発揮しない中程度のデータや中程度のリプレイデータセットにおいて、提案されたポリシー洗練プロセスが性能向上をもたらすか?
  • RQ3デプロイ時に性能低下を伴わずに、洗練されたポリシーを安全にオンラインファインチューニングできるか?
  • RQ4多様なオフラインRLベンチマークにおいて、洗練されたポリシーの性能は最先端手法と比較してどうなるか?
  • RQ5標準TD3-BCポリシーではなく、洗練されたオフラインポリシーから開始した場合、オンラインファインチューニングの安定性が保たれるか?

主な発見

  • 洗練されたポリシー(PR)は、すべてのマッチドおよびマッチドリプレイD4RLタスクで元のTD3-BCベースラインを上回り、特に hopper-medium-replay(91.9 ± 11.1 vs. 91.5 ± 15.8)で顕著な改善を示した。
  • エキスパートレベルのデータでは、洗練されたポリシーはTD3-BCおよび最先端手法と同等またはそれを上回り、walker2d-medium-expertで119.1 ± 2.8のスコアを達成した。
  • オンラインファインチューニングは、ベースラインおよび洗練されたポリシーの両方を向上させ、ファインチューニング後には walker2d-expert で121.4 ± 1.9のスコアを達成した。
  • 学習曲線から、すべての環境でオンラインファインチューニング中に安定した性能が維持されており、hopper-medium-expertを除き、性能の低下は最小限に抑えられた。
  • 本手法はシンプルさを保ちながら、より複雑な代替手法を上回る性能を発揮し、ハイパーパrameterチューニングも最小限に抑えられる。
  • 本手法はデータ品質に対してロバストである:性能向上は、TD3-BCが最も苦戦する中程度のデータセットで最も顕著に現れた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。