Skip to main content
QUICK REVIEW

[論文レビュー] CIC: Contrastive Intrinsic Control for Unsupervised Skill Discovery

Michael Laskin, Hao Liu|arXiv (Cornell University)|Feb 1, 2022
Reinforcement Learning in Robotics被引用数 12
ひとこと要約

CICは、ノイズ対比推定と粒子ベースのエントロピー推定を用いて、状態遷移と潜在的スキルベクトル間の相互情報量を最大化することで、教師なしスキル発見のための対照的内因的制御アルゴリズムを提案する。これは、教師なし強化学習ベンチマーク(Unsupervised RL Benchmark)において、先行手法よりも1.79倍の下流タスク報酬と1.18倍の次善の探索アルゴリズムを上回る、最先端の適応効率を達成する。

ABSTRACT

We introduce Contrastive Intrinsic Control (CIC), an algorithm for unsupervised skill discovery that maximizes the mutual information between state-transitions and latent skill vectors. CIC utilizes contrastive learning between state-transitions and skills to learn behavior embeddings and maximizes the entropy of these embeddings as an intrinsic reward to encourage behavioral diversity. We evaluate our algorithm on the Unsupervised Reinforcement Learning Benchmark, which consists of a long reward-free pre-training phase followed by a short adaptation phase to downstream tasks with extrinsic rewards. CIC substantially improves over prior methods in terms of adaptation efficiency, outperforming prior unsupervised skill discovery methods by 1.79x and the next leading overall exploration algorithm by 1.18x.

研究の動機と目的

  • 外在的報酬なしに、教師なし強化学習における効率的探索とスキル発見の課題に対処すること。
  • 知識ベースおよびデータベースの手法と比較して、訓練の安定性とパフォーマンスに課題を抱える既存の熟達度ベースの手法を改善すること。
  • 状態遷移と潜在的スキルの間の相互情報量の最大化を通じて、多様で再利用可能な行動を学習する手法を開発すること。
  • 報酬なしの事前学習フェーズの後、下流タスクにおけるファインチューニングをより速く、より効果的に可能にすること。
  • 連続制御に特化した、スキルベクトルと状態遷移を区別する新しい対照的学習目的を導入すること。

提案手法

  • CICは、状態遷移(s, s')と潜在的スキルベクトル間の相互情報量を最大化するための対照的学習目的を用い、エージェントが多様な行動を学習するよう促進する。
  • 行動の多様性を明示的に促進するため、状態遷移エントロピーの粒子ベース推定器を採用する。
  • 状態遷移が与えられたときのスキルの条件付きエントロピーに、ノイズ対比推定(NCE)損失を適用し、正例と負例のスキル遷移を効果的に区別できるようにする。
  • 温度スケーリングを用いた対照的損失を通じて、両方の目的である高い相互情報量と高いエントロピーを同時に最適化する。
  • スキルネットワークと遷移ネットワークが、スキルと状態遷移を共通の埋め込み空間にマップするアーキテクチャを有し、対照的損失で正規化された特徴量が使用される。
  • 訓練中、アルゴリズムはリプレイバッファから状態遷移タプルをサンプリングし、対照的およびエントロピー目的を通じたバックプロパゲーションにより、ポリシーとスキルネットワークを更新する。

実験結果

リサーチクエスチョン

  • RQ1熟達度ベースの探索手法は、先行する教師なし強化学習アルゴリズムと比較して、優れた適応効率を達成できるか?
  • RQ2粒子ベースのエントロピー推定とノイズ対比推定を組み合わせることで、スキルの多様性と学習効率が向上するか?
  • RQ3状態遷移と潜在的スキルの間の対照的学習は、連続制御において、視覚ベースの対照的学習手法を上回るか?
  • RQ4知識ベースおよびデータベースの探索手法と比較して、CICは下流タスクのパフォーマンスで優れているか?
  • RQ5状態遷移とスキルの間の相互情報量の最大化は、再利用可能で一般化可能なスキルをどれほど達成するか?

主な発見

  • CICは、Unsupervised RL Benchmarkにおいて、先行する熟達度ベースの教師なし強化学習手法よりも1.79倍高い下流タスク報酬を達成する。
  • CICは、同じベンチマークで次善の全体的な探索アルゴリズムよりも1.18倍高い適応効率を示す。
  • CICは、Walker や Quadruped のような固定長でリセットなしの環境でも学習を可能にし、従来の熟達度ベース手法が不安定さのため失敗する状況を克服する。
  • CICは、連続制御環境において意味のあるスキルを効果的に発見する。具体的には、Walkerにおけるバランスと歩行、Quadrupedにおけるひっくり返しと歩行、6自由度ロボットアームにおけるロックしない運動を発見する。
  • ノイズ対比推定に基づくCICの対照的損失は、正しいと誤ったスキル遷移を効果的に区別でき、ポリシーの一般化を向上させる。
  • 実験的結果から、粒子推定器とNCE推定器によるCICのMI推定は、相互情報量の上限が緩い場合でも安定した訓練と優れたパフォーマンスを実現することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。