Skip to main content
QUICK REVIEW

[논문 리뷰] History Compression via Language Models in Reinforcement Learning

Fabian Paischer, Thomas Adler|arXiv (Cornell University)|2022. 05. 24.
Reinforcement Learning in Robotics인용 수 4
한 줄 요약

이 논문은 부분 관측 강화 학습에서 역사 표현을 위한 메모리 모듈로 고정된 미사전학습된 언어 모델(PLT)을 사용하는 새로운 프레임워크인 HELM(History compression via Language Models)을 제안한다. 고정된 히프델드(FrozenHopfield)—관측치를 랜덤 프로젝션을 통해 PLT 토큰 임베딩으로 매핑하는 트레이닝 없이 작동하는 연관 기억 장치—를 활용함으로써, PLT를 미세조정 없이도 샘플 효율적인 정책 학습이 가능하게 하며, Minigrid 및 Procgen 환경에서 최신 기준 성능을 달성한다.

ABSTRACT

In a partially observable Markov decision process (POMDP), an agent typically uses a representation of the past to approximate the underlying MDP. We propose to utilize a frozen Pretrained Language Transformer (PLT) for history representation and compression to improve sample efficiency. To avoid training of the Transformer, we introduce FrozenHopfield, which automatically associates observations with pretrained token embeddings. To form these associations, a modern Hopfield network stores these token embeddings, which are retrieved by queries that are obtained by a random but fixed projection of observations. Our new method, HELM, enables actor-critic network architectures that contain a pretrained language Transformer for history representation as a memory module. Since a representation of the past need not be learned, HELM is much more sample efficient than competitors. On Minigrid and Procgen environments HELM achieves new state-of-the-art results. Our code is available at https://github.com/ml-jku/helm.

연구 동기 및 목표

  • 미사전학습된 언어 모델을 역사 표현에 활용하여 부분 관측 강화 학습의 샘플 효율성을 향상시키기 위해.
  • 고정된 언어 모델을 온-폴리시 강화 학습에 통합할 때, 미세조정이나 가중치 갱신 없이도 문제를 해결하기 위해.
  • 미사전학습된 트랜스포머의 입력 공간으로 관측치와 행동을 매핑하는 트레이닝 없이 작동하는 메커니즘을 설계하기 위해.
  • 액터-크리틱 네트워크가 압축되고 추상화된 역사 표현을 사용하여 POMDP 환경에서 더 나은 의사결정을 내릴 수 있도록 하기 위해.
  • 최소한의 학습 오버헤드로 Minigrid 및 Procgen 환경에서 최신 기준 성능을 달성하기 위해.

제안 방법

  • 관측치와 행동을 랜덤 프로젝션을 통해 미사전학습된 토큰 임베딩으로 매핑하는 고정된 연관 기억 장치인 FrozenHopfield를 도입한다.
  • 현대 히프델드 네트워크(MHN)를 사용하여 미사전학습된 토큰 임베딩을 저장하고 검색함으로써, 학습 없이도 검색 기능을 제공한다.
  • 고정된 관측치 프로젝션을 통해 MHN에서 관련 토큰 임베딩을 검색할 쿼리를 생성한다.
  • 검색된 PLT 역사 표현과 현재 관측치를 CNN으로 임베딩한 결과를 연결하여 정책 및 가치 네트워크의 입력으로 사용한다.
  • 학습 가능한 구성 요소로는 얕은 다층 퍼셉트론과 CNN만을 사용하며, 전체 학습 과정에서 PLT를 고정한다.
  • PPO와 같은 액터-크리틱 알고리즘에 이 프레임워크를 적용하여 추상적이고 압축된 역사 표현을 사용하는 엔드 투 엔드 강화 학습을 가능하게 한다.

실험 결과

연구 질문

  • RQ1미세조정 없이도 고정된 미사전학습된 언어 모델을 부분 관측 강화 학습에서 역사 표현에 효과적으로 사용할 수 있는가?
  • RQ2언어 모델의 입력 공간으로 비어 있는 모odal(예: 픽셀 관측치)을 트레이닝 없이 어떻게 매핑할 수 있는가?
  • RQ3고정된 PLT를 역사 압축에 사용할 경우, 기존의 RNN 기반 메모리 기법보다 샘플 효율성이 향상되는가?
  • RQ4현대 히프델드 네트워크가 고정된 PLT의 관련 토큰 임베딩을 신뢰할 수 있고, 파rameter-free 방식으로 검색할 수 있는가?
  • RQ5어떤 정도로 HELM는 어려운 POMDP 벤치마크에서 기존 방법보다 샘플 효율성과 최종 성능 측면에서 뛰어나게 성과를 내는가?

주요 결과

  • HELM는 Minigrid 및 Procgen 환경에서 최신 기준 성능을 달성하며, 기존 방법보다 샘플 효율성과 최종 성능에서 뛰어난 성능을 보였다.
  • 고정된 PLT를 역사 표현에 사용함으로써 샘플 효율성이 크게 향상되었으며, 이는 모델이 역사 추상화를 처음부터 학습할 필요가 없기 때문이다.
  • FrozenHopfield는 랜덤 프로젝션과 현대 히프델드 네트워크만을 사용하여 트레이닝 없이도 효과적이고 안정적인 관련 토큰 임베딩 검색이 가능함을 보여주었다.
  • MHN 내의 검색 오차는 패턴 간 간격이 커질수록 지수적으로 감소하여 고정밀도의 기억 복원이 가능함을 보장한다.
  • MHN의 온도 매개변수 β를 증가시킴으로써 패턴 간 거리가 증가하고, 표현 붕괴가 감소하며, 다양한 환경 간 일반화 능력이 향상된다.
  • 정성적 분석 결과, 유사한 시각적 상태들이 PLT 공간에서 동일하거나 유사한 토큰으로 매핑됨을 확인하여, 의미적으로 유사한 경험들이 효과적으로 추상화되고 군집화됨을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.