Skip to main content
QUICK REVIEW

[논문 리뷰] Language Reward Modulation for Pretraining Reinforcement Learning

Ademi Adeniji, Amber Xie|arXiv (Cornell University)|2023. 08. 23.
Reinforcement Learning in Robotics인용 수 4
한 줄 요약

LAMP는 강화학습 전훈 중에 다양한 언어 조건 부여 탐색 보상을 생성하기 위해 동결된 시각-언어 모델(VLM)을 사용한다. 이는 VLM 보상과 새로운 탐색을 추구하는 내재적 보상(내재적 보상)을 결합하여 일반적인, 언어 조건 부여된 정책을 학습한다. 이 방법은 RLBench에서의 후행 로봇 조작 작업에서 샘플 복잡도를 크게 감소시키며, 제로샷 전이 성능이 뛰어나고 프롬프팅 변형에 대해 강건함을 입증한다.

ABSTRACT

Using learned reward functions (LRFs) as a means to solve sparse-reward reinforcement learning (RL) tasks has yielded some steady progress in task-complexity through the years. In this work, we question whether today's LRFs are best-suited as a direct replacement for task rewards. Instead, we propose leveraging the capabilities of LRFs as a pretraining signal for RL. Concretely, we propose $ extbf{LA}$nguage Reward $ extbf{M}$odulated $ extbf{P}$retraining (LAMP) which leverages the zero-shot capabilities of Vision-Language Models (VLMs) as a $ extit{pretraining}$ utility for RL as opposed to a downstream task reward. LAMP uses a frozen, pretrained VLM to scalably generate noisy, albeit shaped exploration rewards by computing the contrastive alignment between a highly diverse collection of language instructions and the image observations of an agent in its pretraining environment. LAMP optimizes these rewards in conjunction with standard novelty-seeking exploration rewards with reinforcement learning to acquire a language-conditioned, pretrained policy. Our VLM pretraining approach, which is a departure from previous attempts to use LRFs, can warmstart sample-efficient learning on robot manipulation tasks in RLBench.

연구 동기 및 목표

  • 복잡한 환경에서 희박한 보상 강화학습 문제를 해결하기 위해, 직접적인 작업 보상으로서가 아니라 전훈 신호로서 학습된 보상 함수를 활용하고자 한다.
  • 시각-언어 모델(VLM)이 다각도로 확장 가능하고 제로샷으로 작동하는 보상 생성기로서 기능할 수 있는지 탐색하고자 한다.
  • VLM에서 유도된 다양한 의미적 구조를 가진 보상으로 전훈된 에이전트를 통해 후행 RL 피니팅의 샘플 복잡도를 감소시키고자 한다.
  • VLM에서 생성된 보상과 Plan2Explore와 같은 내재적 탐색 목표 간의 상호보완적 관계를 조사하고자 한다.
  • 다양한 프롬프팅 전략과 VLM 아키텍처에 걸쳐 전훈 방법의 강건성과 전이 가능성 평가를 수행하고자 한다.

제안 방법

  • LAMP는 VLM에서 생성된 언어 조건 부여 보상과 Plan2Explore에서 유도된 내재적 낙관적 보상의 조합을 최적화하여 정책을 전훈한다.
  • 동결된 사전학습된 VLM를 사용하여 이미지 관측치와 다양한 언어 지시문 간의 대비 정렬을 계산함으로써, 의미적으로 구조화된 탐색 보상을 생성한다.
  • 보상은 시각적 및 언어적 델타 임베딩의 내적곱으로 매개변수화된다: $ r_i = (F_\phi(s_i) - F_\phi(s_0)) \cdot (L_\alpha(\mathbf{x}) - L_\alpha(\mathbf{x}_0)) $, 여기서 $ F_\phi $ 및 $ L_\alpha $ 는 동결된 CLIP 인코더이다.
  • 다중 작업, 언어 조건 부여 강화학습 목표를 사용하여 일반 목적의 정책을 학습함으로써, 후행 작업에 대해 피니팅할 수 있도록 전훈한다.
  • 이 방법은 VLM의 제로샷 능력을 활용하여 인간이 설계한 보상 함수나 도메인 특화 튜닝 없이도 보상 생성을 확장한다.
  • 피니팅 후 RLBench 작업에서 성능을 평가하며, 다양한 프롬프팅 스타일과 VLM를 비교한다.
Figure 1 : LAMP Framework . Given a diverse set of tasks generated by hand or by a LLM, we extract VLM rewards for language-conditioned RL pretraining. At finetuning time, we condition the agent on the new task language embedding and train on the task reward.
Figure 1 : LAMP Framework . Given a diverse set of tasks generated by hand or by a LLM, we extract VLM rewards for language-conditioned RL pretraining. At finetuning time, we condition the agent on the new task language embedding and train on the task reward.

실험 결과

연구 질문

  • RQ1VLM에서 생성된 보상은 RL 전훈에 효과적인 신호로 작용할 수 있는가? 이는 후행 샘플 효율성을 향상시키는가?
  • RQ2언어 지시문의 다양성과 의미적 구조는 전훈 성능과 후행 전이에 어떤 영향을 미치는가?
  • RQ3VLM 보상과 Plan2Explore의 내재적 탐색 목표 간의 상호보완적 관계는 무엇인가?
  • RQ4프롬프팅 스타일과 VLM 선택에 따른 변화에 대해 전훈 방법은 얼마나 강건한가?
  • RQ5LAMP는 제로샷 전이 없이도 새로운 작업에 일반화될 수 있는가? 그리고 VLM의 품질은 성능에 어떤 역할을 하는가?

주요 결과

  • 다양한 언어 지시문을 사용한 LAMP 전훈은 RLBench에서 후행 RL 피니팅의 샘플 복잡도를 크게 감소시켜 빠른 수렴을 가능하게 한다.
  • 지시문의 의미적으로 유사하지만 다양한 표현 방식을 사용한 프롬프팅 스타일 2가 가장 우수한 후행 피니팅 성능을 기록한다.
  • VLM 보상과 Plan2Explore의 내재적 탐색의 조합은 개별적으로 사용할 때보다 더 효율적인 전훈을 이끈다.
  • ZeST 스타일의 CLIP 보상과 함께 LAMP는 뛰어난 성능을 기록하며, 향후 더 강력한 VLM이 제공될 경우 성능 향상이 기대된다.
  • 다양한 프롬프팅 전략에 대해 강건하며, 스타일 간 성능 저하가 최소한이어서 광범위한 적용 가능성을 보여준다.
  • 탐색 목표와 결합된 비행위 기반 지시문을 사용한 베이스라인과 비교해 LAMP는 보상 품질과 커버리지의 중요성을 입증한다.
Figure 2 : LAMP Method . We use R3M [ 24 ] for our VLM-based rewards. We query the R3M score predictor for pixel and language alignment, which is pretrained on the Ego4D dataset [ 15 ] . The reward model is frozen.
Figure 2 : LAMP Method . We use R3M [ 24 ] for our VLM-based rewards. We query the R3M score predictor for pixel and language alignment, which is pretrained on the Ego4D dataset [ 15 ] . The reward model is frozen.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.