[논문 리뷰] Human Instruction-Following with Deep Reinforcement Learning via Transfer-Learning from Text
이 논문은 SHIFTT를 소개합니다. SHIFTT는 사전 학습된 텍스트 인코더(예: BERT)를 사용하여 심층 RL 에이전트를 부트스트랩하고, 템플릿 기반 지시에서 자연스러운 인간 지시로의 제로샷 전이를 3D 물체 조작 과제에서 가능하게 합니다.
Recent work has described neural-network-based agents that are trained with reinforcement learning (RL) to execute language-like commands in simulated worlds, as a step towards an intelligent agent or robot that can be instructed by human users. However, the optimisation of multi-goal motor policies via deep RL from scratch requires many episodes of experience. Consequently, instruction-following with deep RL typically involves language generated from templates (by an environment simulator), which does not reflect the varied or ambiguous expressions of real users. Here, we propose a conceptually simple method for training instruction-following agents with deep RL that are robust to natural human instructions. By applying our method with a state-of-the-art pre-trained text-based language model (BERT), on tasks requiring agents to identify and position everyday objects relative to other objects in a naturalistic 3D simulated room, we demonstrate substantially-above-chance zero-shot transfer from synthetic template commands to natural instructions given by humans. Our approach is a general recipe for training any deep RL-based system to interface with human users, and bridges the gap between two research directions of notable recent success: agent-centric motor behavior and text-based representation learning.
연구 동기 및 목표
- 템플릿에서 생성된 언어에 대한 의존도를 줄여 강건한 지시 따르기를 촉진한다.
- 텍스트 인코더에서 RL 정책으로의 간단한 전이 학습 방법을 제시한다.
- ShapeNet 물체가 있는 3D 룸에서 자연스러운 인간 지시로의 제로샷 일반화를 Demonstrate 한다.
- 다양한 언어 인코더와 학습 보강이 일반화와 강건성에 미치는 영향을 분석한다.
제안 방법
- 시각 처리, 언어 임베딩, 기억, 행동/가치 헤드를 갖춘 표준 RL 아키텍처를 사용한다.
- 사전 학습된 언어 인코더(BERT)를 다수의 인코딩 스킴(평균 풀링, 자기 주의, 교차 모달 주의)으로 도입한다.
- 과적합을 피하기 위해 BERT 가중치를 고정하고, 필요 시 시각과 언어를 융합하는 학습된 자기 주의 층이나 교차 모달 자기 주의를 추가한다.
- SHIFTT 단계를 사용하여 정책 매개변수에 의미 지식을 분산시키며 합성 텍스트 지시로 시뮬레이션에서 에이전트를 학습한다.
- 현실적인 인간 지시와 Crowd-sourcing으로 수집된 동의어에 대해 재학습 없이 제로샷 성능을 평가한다.
- 오타 소음 및 Tokenization(WordPiece)이 인간 지시에 대한 강건성에 미치는 영향을 검토한다.
실험 결과
연구 질문
- RQ1사전 학습된 언어 인코더가 RL 에이전트에서 템플릿 지시에서 자연스러운 인간 지시로의 제로샷 전이를 가능하게 하는가?
- RQ2어떤 언어 인코더 아키텍처(BERT의 평균 풀링, 자기 주의, 교차 모달 주의)가 시각과 행동에 대한 언어의 근거 마련을 가장 잘 지원하는가?
- RQ3오타 소음과 WordPiece 토큰화가 인간 지시에 대한 강건성에 어떤 영향을 미치는가?
- RQ4합성 언어로 시뮬레이션에서 학습된 에이전트가 자연스럽고 다양한 인간 지시에서 어느 정도까지 성능을 발휘하는가?
- RQ5SHIFTT 접근법이 현실적인 환경에서 객체 식별 및 객체 배치 관계를 요구하는 과제로 확장될 수 있는가?
주요 결과
- 사전 학습된 텍스트 인코더는 참조 작업과 배치 작업 모두에서 비사전 학습 기반 대비 정확도를 크게 향상시킨다.
- 평균 풀링을 사용하는 BERT 기반 인코더는 각각의 테스트에서 최대 77%(동의어 평가)와 94%(참조 유사 평가)의 정확도를 달성했다.
- 맥락 기반 표현(BERT)은 맥락 독립 임베딩 및 WordPiece 단독보다 자연스러운 지시 일반화에서 더 나은 성능을 보인다.
- 교차 모달 자기 주의와 오타 소음은 특히 자연 배치 지시에 대해 인간 지시의 강건성에 강력한 영향을 준다(예: 자연 지시 테스트에서 70% 정확도).
- WordPiece 토큰화와 조정된 자기 주의 층은 오타 소음과 결합될 때 강건성을 제공하지만, BERT 가중치를 고정해 과적합 위험을 줄인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.