[논문 리뷰] Transformers are Sample-Efficient World Models
이 논문은 이산 오토인코더와 자동회귀형 트랜스포머로 구성된 월드 모델 내에서만 학습하는 샘플 효율적인 강화학습 에이전트인 iris를 소개한다. 아타리 100k 벤치마크에서 단 두 시간 동안의 플레이어 게임 데이터로 훈련된 iris는 인간 정규화 점수 1.046을 기록하며, 26개 게임 중 10개에서 인간을 초월하여, 룩어헤드 검색을 사용하지 않는 방법 중 최고의 성능을 기록했다.
Deep reinforcement learning agents are notoriously sample inefficient, which considerably limits their application to real-world problems. Recently, many model-based methods have been designed to address this issue, with learning in the imagination of a world model being one of the most prominent approaches. However, while virtually unlimited interaction with a simulated environment sounds appealing, the world model has to be accurate over extended periods of time. Motivated by the success of Transformers in sequence modeling tasks, we introduce IRIS, a data-efficient agent that learns in a world model composed of a discrete autoencoder and an autoregressive Transformer. With the equivalent of only two hours of gameplay in the Atari 100k benchmark, IRIS achieves a mean human normalized score of 1.046, and outperforms humans on 10 out of 26 games, setting a new state of the art for methods without lookahead search. To foster future research on Transformers and world models for sample-efficient reinforcement learning, we release our code and models at https://github.com/eloialonso/iris.
연구 동기 및 목표
- 딥 강화학습에서의 샘플 비효율성 문제, 특히 실세계 적용을 고려할 때의 핵심 과제를 해결하기 위해.
- 최소한의 상호작용 데이터로도 고정밀도의 장기 예측 환경 시뮬레이션을 가능하게 하는 월드 모델 아키텍처를 개발하기 위해.
- 트랜스포머와 이산 오토인코더의 조합이 샘플 효율적인 정책 학습을 위한 효과적인 월드 모델이 될 수 있음을 보여주기 위해.
- 루크어헤드 검색을 사용하지 않는 모델 기반 강화학습의 새로운 벤치마크를 설정하기 위해, 최소한의 데이터로 인간 수준의 성능을 달성하기 위해.
- 재현 가능성과 확장 가능성을 위해 코드와 모델을 공개하여 향후 연구를 촉진하기 위해.
제안 방법
- 월드 모델은 원시 픽셀 관측값을 압축하여 이산 토큰의 압축된 시퀀스로 변환하기 위해 이산 오토인코더를 사용한다.
- 자기회귀형 트랜스포머(G)는 잠재 코드와 액션 시퀀스로부터 미래 프레임 토큰, 보상, 에피소드 종료 신호를 예측함으로써 환경의 역학을 모델링한다.
- 정책 네트워크(π)는 월드 모델과의 상호작용을 통해 상상 속에서만 훈련되며, 예측된 미래 상태를 바탕으로 액션을 생성한다.
- 정책 훈련이 시작되기 전에 월드 모델은 소량의 환경 상호작용 데이터를 바탕으로 자기지도 학습 방식으로 사전 훈련된다.
- 전체 시스템은 재구성 손실, 보상 및 종료 예측 손실, 그리고 강화학습을 통한 정책 최적화를 조합하여 엔드 투 엔드로 훈련된다.
- 게이팅 레이어 등의 복잡한 수정을 피하고, 자기지도 사전 훈련의 안정성에 의존한다.
실험 결과
연구 질문
- RQ1이산 오토인코더와 함께 사용되는 트랜스포머 기반 월드 모델이 최소한의 상호작용 데이터로도 고정밀도의 장기 예측 환경 모델링을 달성할 수 있는가?
- RQ2실제 환경 상호작용 데이터를 단 두 시간만 사용한 정책이 순수하게 상상 속에서 훈련된 결과로 인간 수준의 성능을 초월할 수 있는가?
- RQ3이산 오토인코더와 자동회귀형 트랜스포머의 조합이 이전의 모델 기반 강화학습 접근법에 비해 샘플 효율성에서 얼마나 뛰어난가?
- RQ4월드 모델이 게임 메커니즘에 대한 깊은 이해를 반영하는 실제 픽셀 수준의 정확한 예측을 생성할 수 있는가?
- RQ5루크어헤드 검색을 사용하지 않고도 상상 기반 훈련에 의존하여 최고 성능을 달성하는 것이 가능한가?
주요 결과
- iris는 아타리 100k 벤치마크에서 실질적으로 두 시간 분량의 실제 플레이어 게임 데이터만으로 평균 인간 정규화 점수 1.046을 기록했다.
- 에이전트는 아타리 게임 26종 중 10종에서 인간 플레이어를 초월하여 샘플 효율적인 환경에서 초인 수준의 성능을 입증했다.
- 월드 모델는 여러 게임에서 매우 정확하고 픽셀 수준의 정확도를 갖춘 예측을 생성하여 게임 메커니즘에 대한 깊은 이해를 보여주었다.
- 루크어헤드 검색을 사용하지 않는 방법 중에서 최고 성능을 기록했으며, 이전의 접근 방식인 드림어V2에 비해 샘플 효율성이 뛰어났다.
- 월드 모델는 강력한 생성 능력을 보이며, 상상 기반 훈련 중에 rich하고 다양한 게임 플레이 경험을 가능하게 했다.
- 기존의 에이전트에 비해 최소한의 하이퍼파라미터 튜닝으로도 안정적이며, 일반화 능력이 뛰어나 배포가 용이하다는 점을 시사했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.