[논문 리뷰] Instruction-Following Agents with Multimodal Transformer
이 논문은 지시를 따르는 로봇 에이전트를 위한 언어 지시와 시각적 관찰을 공동으로 인코딩하는 통합 다중모달 트랜스포머 아키텍처인 Instruct RL을 제안한다. 사전 훈련된 다중모달 트랜스포머를 통한 다중모달 정렬과 트랜스포머 기반 정책를 활용함으로써, 74개의 RLBench 작업 전반에서 최신 기술 수준(SOTA) 성능을 달성하며, 우수한 일반화 능력, 확장성, 장문이고 세부적인 지시에 대한 강건성을 입증한다.
Humans are excellent at understanding language and vision to accomplish a wide range of tasks. In contrast, creating general instruction-following embodied agents remains a difficult challenge. Prior work that uses pure language-only models lack visual grounding, making it difficult to connect language instructions with visual observations. On the other hand, methods that use pre-trained multimodal models typically come with divided language and visual representations, requiring designing specialized network architecture to fuse them together. We propose a simple yet effective model for robots to solve instruction-following tasks in vision-based environments. Our \ours method consists of a multimodal transformer that encodes visual observations and language instructions, and a transformer-based policy that predicts actions based on encoded representations. The multimodal transformer is pre-trained on millions of image-text pairs and natural language text, thereby producing generic cross-modal representations of observations and instructions. The transformer-based policy keeps track of the full history of observations and actions, and predicts actions autoregressively. Despite its simplicity, we show that this unified transformer model outperforms all state-of-the-art pre-trained or trained-from-scratch methods in both single-task and multi-task settings. Our model also shows better model scalability and generalization ability than prior work.
연구 동기 및 목표
- 다양한 작업과 환경에서 일반화 가능한 지시를 따르는 에이전트를 개발하는 데 도전하는 것.
- 시각적 기반을 갖추지 못한 언어 중심 모델의 한계와 별개의 시각 및 언어 표현을 갖는 다중모달 모델의 한계를 극복하는 것.
- 복잡한 융합 모듈을 피하면서도 언어 지시와 시각적 관찰 간 강력한 다중모달 정렬을 가능하게 하는 단순하고 통합된 아키텍처를 개발하는 것.
- 장문이고 세부적인 지시, 다중 작업 학습, 그리고 훈련 중에 볼 수 없었던 작업 변형에 대한 제로샷 일반화 성능 향상.
- 모델 확장성은 아키텍처의 복잡성 없이 성능 향상을 이끌 수 있음을 입증함으로써, 더 나은 일반화와 강건성을 가능하게 한다.
제안 방법
- 모델은 이미지-텍스트 쌍과 텍스트 전용 데이터에 대해 공동으로 미세조정된 사전 훈련된 다중모달 트랜스포머(Geng et al., 2022)를 사용하여 시각적 관찰과 언어 지시의 일반적인 다중모달 표현을 생성한다.
- 다중 카메라에서 온 시각적 관찰, 언어 지시, 프로 prioceptive 데이터, 액션 이력이 토큰화되고 시퀀스로 임베딩되어 다중모달 트랜스포머의 입력으로 제공된다.
- 다중모달 트랜스포머는 언어와 시각 간의 다중모달 종속성을 인코딩하여 지시와 시각 콘텐츠 간의 세밀한 정렬을 가능하게 한다.
- 별도의 트랜스포머 기반 정책이 인코딩된 관찰과 액션의 전체 이력을 기반으로 7-DoF 로봇 액션(위치, 회전, 그립퍼 상태)을 순차적으로 예측한다.
- 모든 모odal을 종단 간(end-to-end)으로 처리하는 통합 트랜스포머를 사용함으로써 전용 융합 모듈을 회피함으로써 훈련 및 추론을 단순화한다.
- 모델은 RLBench 벤치마크에서 강화학습을 통해 훈련되며, 정책 최적화는 모방 학습과 조밀한 보상 형태(shape)를 사용한다.
실험 결과
연구 질문
- RQ1통합 다중모달 트랜스포머 아키텍처는 별도의 시각 및 언어 인코더와 맞춤형 융합 모듈을 사용하는 기존 방법보다 지시를 따르는 로봇 작업에서 더 뛰어난 성능을 낼 수 있는가?
- RQ2사전 훈련된 다중모달 모델은 훈련 중에 볼 수 없었던 새로운 작업 변형(예: 다른 물체 색상 또는 순서)에 대해 얼마나 잘 제로샷 일반화를 달성할 수 있는가?
- RQ3통합 트랜스포머 아키텍처를 사용할 때 모델 확장성은 지시를 따르는 작업에서 성능에 어떤 영향을 미치는가?
- RQ4장문이고 세부적인 자연어 지시를 성능 저하 없이 효과적으로 따를 수 있는가?
- RQ5단일 트랜스포머 내에서 시각과 언어를 공동으로 인코딩하는 것이 별개의 파ipeline에 비해 다중모달 정렬을 얼마나 향상시키는가?
주요 결과
- Instruct RL은 RLBench 벤치마크의 모든 74개 작업에서 최신 기술 수준 성능을 달성하며, CLIPort, HiveFormer, SayCan과 같은 이전 방법들을 능가한다.
- 모델은 훈련 중에 볼 수 없었던 작업 변형, 예를 들어 블록 스택 작업에서 다른 물체 색상이나 순서에 대해 효과적으로 일반화하여 강력한 제로샷 일반화 능력을 입증한다.
- Instruct RL은 장문이고 세부적인 지시에서 뛰어난 성능을 보이며, 시각적 맥락 내에서 강력한 언어 이해와 기반을 제공함을 시사한다.
- 모델 크기가 커질수록 성능 향상이 이루어지며, 이는 강력한 확장성과 통합 아키텍처의 효과성을 입증한다.
- 다양한 조작 작업 간의 강력한 전이 능력을 보이며, 다중 작업 학습 환경에서 높은 성공률을 기록한다.
- 전용 융합 모듈이 없는 통합 아키텍처가 복잡한 융합 구성 요소가 필요한 이전 방법보다 더 뛰어난 성능을 달성한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.