[論文レビュー] CCLF: A Contrastive-Curiosity-Driven Learning Framework for Sample-Efficient Reinforcement Learning
本稿では、CCLF を提案する。CCLF はモデルに依存しない、対照的で好奇心に基づいたフレームワークであり、未発見の経験を優先し、情報量の多いデータ拡張を選択し、驚きに基づく好奇心を用いて Q ネットワークとエンコーダーを正則化することで、強化学習におけるサンプル効率を向上させる。CCLF は DeepMind Control、Atari、MiniGrid ベンチマークで、顕著に少ないデータ使用量と向上した安定性を伴い、最先端の性能を達成する。
In reinforcement learning (RL), it is challenging to learn directly from high-dimensional observations, where data augmentation has recently been shown to remedy this via encoding invariances from raw pixels. Nevertheless, we empirically find that not all samples are equally important and hence simply injecting more augmented inputs may instead cause instability in Q-learning. In this paper, we approach this problem systematically by developing a model-agnostic Contrastive-Curiosity-Driven Learning Framework (CCLF), which can fully exploit sample importance and improve learning efficiency in a self-supervised manner. Facilitated by the proposed contrastive curiosity, CCLF is capable of prioritizing the experience replay, selecting the most informative augmented inputs, and more importantly regularizing the Q-function as well as the encoder to concentrate more on under-learned data. Moreover, it encourages the agent to explore with a curiosity-based reward. As a result, the agent can focus on more informative samples and learn representation invariances more efficiently, with significantly reduced augmented inputs. We apply CCLF to several base RL algorithms and evaluate on the DeepMind Control Suite, Atari, and MiniGrid benchmarks, where our approach demonstrates superior sample efficiency and learning performances compared with other state-of-the-art methods.
研究の動機と目的
- 高次元の強化学習における均一なデータ拡張の非効率性を解消するため、学習に寄与する重要度が等しくないことを同定する。
- 未発見の経験と情報量の多い経験を優先する自己教師ありの好奇心駆動メカニズムを導入することで、サンプル効率と学習の安定性を向上させる。
- 経験リプレイ、入力選択、正則化、内因性探索の4つの主要な強化学習コンポーネントにわたる対照的で好奇心に基づいたフレームワークを統合するモデルに依存しないフレームワークを構築する。
- 過剰な拡張入力を減少させつつ、表現の不変性を維持し、生のピクセルから一般化性能を向上させる。
- 標準的な強化学習ベンチマークで、分散が小さく、データ効率が高い状態で最先端の性能を達成する。
提案手法
- CCLF は、対照的表現学習モジュールからの予測誤差に基づく対照的で好奇心に基づいた信号を導入し、ネットワークパラメータを追加せずに CURL 損失を再利用して驚きを定量化する。
- 対照的で好奇心に基づいた信号を用いて、リプレイバッファ内の遷移を優先し、より驚きや未学習度の高いものを優先する。
- 予測の不確実性を最大化するような、情報量の多い拡張入力を選択するのを支援する。
- 好奇心信号を Q 関数とエンコーダーの両方の正則化に用い、驚きや未発見の観測に学習を集中させる。
- 内因性の好奇心に基づく報酬を追加し、エージェントが新規で未学習の状態を探索するよう促進する。
- フレームワークは、モデルに依存しないモジュラーな方法で、オンポリシーおよびオフポリシーの強化学習アルゴリズムに適用可能である。

実験結果
リサーチクエスチョン
- RQ1対照的表現学習に基づく自己教師ありの好奇心メカニズムは、深層強化学習におけるサンプル効率を向上させることができるか?
- RQ2未発見の経験と情報量の多いデータ拡張を優先することは、均一なデータ拡張と比較して、より安定的かつ効率的な学習をもたらすか?
- RQ3対照的で好奇心に基づいたメカニズムを、経験リプレイ、入力選択、正則化、探索の強化学習パイプラインの複数のコンポーネントに統合できるか?モデルの複雑さを増さずに効果的に統合できるか?
- RQ44つのコンポーネントにわたる対照的で好奇心に基づいたメカニズムの協調的利用が、学習の安定性と最終的な性能にどのように影響を与えるか?
- RQ5CCLF は、表現の不変性とサンプル効率を維持または向上させるかぎりで、過剰な拡張入力の数をどの程度削減できるか?
主な発見
- CCLF は、最高性能を示したベースライン(Reward+Selection)と比較して、100K 環境ステップで 1.22 倍高い平均スコアを達成し、優れたサンプル効率を示した。
- 500K ステップでは、CCLF は最高の漸近的性能(869 ± 9)と最小の標準偏差(±9)を達成し、安定的かつ強固な学習を示した。
- 選択または正則化コンポーネントを削除すると、100K ステップで 29–33% の性能低下と高い分散が生じ、これらが安定性と効率性において重要な役割を果たしていることを示した。
- 報酬なしのバージョンでも、複数のベースラインを上回る性能を示したため、CCLF の主な利点は内因性報酬に起因するのではなく、優先順位付け、選択、正則化に起因することが示された。
- CCLF は、情報量が多く驚きのあるサンプルにのみ焦点を当てることで、過剰なデータ拡張の必要性を低減し、不変性学習を損なわず、データ効率を向上させた。
- CCLF は、DeepMind Control、Atari、MiniGrid を含む多様なベンチマークで有効であり、広範な適用可能性と最先端の性能を示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。