Skip to main content
QUICK REVIEW

[Paper Review] Data-Efficient Reinforcement Learning with Self-Predictive Representations

Max Schwarzer, Anand, Ankesh|arXiv (Cornell University)|Jul 12, 2020
Reinforcement Learning in RoboticsComputer Science55 references50 citations
TL;DR

SPR augments a strong RL agent with self-supervised, latent-space future prediction and data augmentation to improve sample efficiency, achieving state-of-the-art results on Atari 100k and surpassing human scores on several games.

ABSTRACT

L'efficacité des données reste un défi majeur dans l'apprentissage par renforcement profond. Bien que les techniques modernes soient capables d'atteindre des performances élevées dans des tâches extrêmement complexes, y compris les jeux de stratégie comme le StarCraft, les échecs, le shogi et le go, ainsi que dans des domaines visuels exigeants comme les jeux Atari, cela nécessite généralement d'énormes quantités de données interactives, limitant ainsi l'application pratique de l'apprentissage par renforcement. Dans ce mémoire, nous proposons la SPR, une méthode inspirée des récentes avancées en apprentissage auto-supervisé de représentations, conçue pour améliorer l'efficacité des données des agents d'apprentissage par renforcement profond. Nous évaluons cette méthode sur l'environement d'apprentissage Atari, et nous montrons qu'elle améliore considérablement les performances des agents avec un surcroît de calcul modéré. Lorsqu'on lui accorde à peu près le même temps d'apprentissage qu'aux testeurs humains, un agent d'apprentissage par renforcement augmenté de SPR atteint des performances surhumaines dans 7 des 26 jeux, une augmentation de 350% par rapport à l'état de l'art précédent, tout en améliorant fortement les performances moyennes et médianes. Nous évaluons également cette méthode sur un ensemble de tâches de contrôle continu, montrant des améliorations substantielles par rapport aux méthodes précédentes. Le chapitre 1 présente les concepts nécessaires à la compréhension du travail présenté, y compris des aperçus de l'apprentissage par renforcement profond et de l'apprentissage auto-supervisé de représentations. Le chapitre 2 contient une description détaillée de nos contributions à l'exploitation de l'apprentissage de représentation auto-supervisé pour améliorer l'efficacité des données dans l'apprentissage par renforcement. Le chapitre 3 présente quelques conclusions tirées de ces travaux, y compris des propositions pour les travaux futurs.

Motivation & Objective

  • Motivate data-efficient RL when environment interaction is limited.
  • Leverage self-supervised objectives based on structure in visual input and temporal dynamics.
  • Learn representations that are predictive of future latent states.
  • Enforce consistency of representations across augmented views of observations.
  • Integrate SPR with a strong RL agent to boost performance in pixel-based tasks.

Proposed method

  • Use an online encoder f_o to produce representations z_t from observations s_t.
  • Maintain a target encoder f_m whose parameters are an exponential moving average of the online encoder (EMA).
  • Introduce a transition model h that predicts future latent representations from past latent states and actions.
  • Apply projection heads g_o, g_m and a predictor q to map representations to a space for a cosine-similarity SPR loss.
  • Compute SPR loss as the negative cosine similarity between predicted and target projections across K future steps.
  • Combine SPR loss with the Rainbow RL loss: L_total = L_RL + lambda * L_SPR.

Experimental results

Research questions

  • RQ1Does Self-Predictive Representations improve data efficiency in Atari 100k regimes?
  • RQ2How does data augmentation affect the quality of SPR representations and RL performance?
  • RQ3What is the impact of different future-prediction depths K on SPR performance?
  • RQ4How important is the target encoder (EMA) for preventing representation collapse and achieving good performance?

Key findings

  • SPR with data augmentation achieves a median human-normalized score of 0.415 on Atari 100k, a new state-of-the-art.
  • SPR without augmentation also outperforms prior methods, indicating the value of the predictive latent objective.
  • SPR exceeds expert human scores on 7 of 26 games, demonstrating robust data-efficient performance.
  • A separate target encoder with EMA (tau) is essential for best performance; tau = 0 with augmentation performs best in this setting.
  • Increasing the prediction depth up to K = 5 improves performance across games, with diminishing returns for larger K.
  • Projection and prediction heads are crucial; removing them degrades performance compared to using projected latent representations.

Better researchstarts right now

From reading papers to final review, dramatically reduce your research time.

No credit card · Free plan available

This review was created by AI and reviewed by human editors.