Skip to main content
QUICK REVIEW

[论文解读] CIC: Contrastive Intrinsic Control for Unsupervised Skill Discovery

Michael Laskin, Hao Liu|arXiv (Cornell University)|Feb 1, 2022
Reinforcement Learning in Robotics被引用 12
一句话总结

CIC 提出了一种用于无监督技能发现的对比式内在控制算法,通过噪声对比估计和基于粒子的熵估计,最大化状态转移与潜在技能向量之间的互信息。该方法在无监督强化学习基准(Unsupervised RL Benchmark)上实现了最先进水平的适应效率,下游任务回报比之前的方法高出1.79倍,且比次优的探索算法高出1.18倍。

ABSTRACT

We introduce Contrastive Intrinsic Control (CIC), an algorithm for unsupervised skill discovery that maximizes the mutual information between state-transitions and latent skill vectors. CIC utilizes contrastive learning between state-transitions and skills to learn behavior embeddings and maximizes the entropy of these embeddings as an intrinsic reward to encourage behavioral diversity. We evaluate our algorithm on the Unsupervised Reinforcement Learning Benchmark, which consists of a long reward-free pre-training phase followed by a short adaptation phase to downstream tasks with extrinsic rewards. CIC substantially improves over prior methods in terms of adaptation efficiency, outperforming prior unsupervised skill discovery methods by 1.79x and the next leading overall exploration algorithm by 1.18x.

研究动机与目标

  • 为解决无外部奖励下无监督强化学习中高效探索与技能发现的挑战。
  • 改进现有基于能力的方法,这些方法在训练稳定性与性能方面相较于基于知识和数据的方法表现较差。
  • 开发一种通过最大化状态转移与潜在技能之间互信息来学习多样化、可重用行为的方法。
  • 在无奖励预训练阶段后,实现更快、更有效的下游任务微调。
  • 提出一种专为连续控制设计的新型对比学习目标,能够有效区分技能向量与状态转移。

提出的方法

  • CIC 使用对比学习目标,以最大化状态转移(s, s')与潜在技能向量之间的互信息,从而促使智能体学习多样化的行为。
  • 采用基于粒子的估计器计算状态转移的熵,以促进探索并显式提升行为的多样性。
  • 对给定状态转移的技能条件熵应用噪声对比估计(NCE)损失,实现对正样本与负样本技能转移的有效区分。
  • 通过温度缩放的对比损失,联合优化技能空间中的高互信息与高熵。
  • 网络架构包含一个技能网络和一个转移网络,分别将技能和状态转移映射到共享嵌入空间,对比损失中使用归一化特征。
  • 训练过程中,算法从经验回放缓冲区采样状态转移三元组,并通过反向传播联合更新策略网络与技能网络,优化对比损失与熵目标。

实验结果

研究问题

  • RQ1基于能力的探索方法是否能在适应效率方面超越先前的无监督强化学习算法?
  • RQ2将基于粒子的熵估计与噪声对比估计相结合,是否能提升技能多样性与学习效率?
  • RQ3在连续控制任务中,状态转移与潜在技能之间的对比学习是否能优于基于视觉的对比学习方法?
  • RQ4在下游任务性能方面,CIC 与基于知识和数据的探索方法相比表现如何?
  • RQ5状态转移与技能之间互信息最大化在多大程度上能产生可重用、泛化能力强的技能?

主要发现

  • 在无监督强化学习基准(Unsupervised RL Benchmark)上,CIC 的下游任务回报比先前基于能力的无监督强化学习方法高出1.79倍。
  • 在相同基准上,CIC 的适应效率比次优的整体探索算法高出1.18倍。
  • CIC 能够在固定长度、不重置的环境中进行学习——例如 Walker 和 Quadruped 环境,而先前基于能力的方法因稳定性问题而失败。
  • 该方法成功在连续控制环境中发现有意义的技能,包括 Walker 中的平衡与行走、Quadruped 中的翻滚与行走,以及6自由度机械臂中的非锁死运动。
  • 基于噪声对比估计的 CIC 对比损失,能够有效区分正确与错误的技能转移,从而提升策略的泛化能力。
  • 实验结果表明,CIC 通过粒子估计器与 NCE 估计器实现的互信息估计,即使在互信息上界较松的情况下,也能实现稳定训练并取得优越性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。