[논문 리뷰] From Language to Goals: Inverse Reinforcement Learning for Vision-Based Instruction Following
논문은 Language-Conditioned Reward Learning (LC-RL)을 제안하고, 자연어 명령을 최대 엔트로피 IRL(MaxEnt IRL)로 transferable reward functions로 접지하며, 보상은 새로운 작업과 장면으로 일반화되고 언어-조건 정책은 일반화에서 열등하다.
Reinforcement learning is a promising framework for solving control problems, but its use in practical situations is hampered by the fact that reward functions are often difficult to engineer. Specifying goals and tasks for autonomous machines, such as robots, is a significant challenge: conventionally, reward functions and goal states have been used to communicate objectives. But people can communicate objectives to each other simply by describing or demonstrating them. How can we build learning algorithms that will allow us to tell machines what we want them to do? In this work, we investigate the problem of grounding language commands as reward functions using inverse reinforcement learning, and argue that language-conditioned rewards are more transferable than language-conditioned policies to new environments. We propose language-conditioned reward learning (LC-RL), which grounds language commands as a reward function represented by a deep neural network. We demonstrate that our model learns rewards that transfer to novel tasks and environments on realistic, high-dimensional visual environments with natural language commands, whereas directly learning a language-conditioned policy leads to poor performance.
연구 동기 및 목표
- 직접 정책 조건화 대신 자연어 명령을 보상 함수로 접지하는 동기를 부여한다.
- 작업과 환경 전반에 일반화되는 언어 조건 보상을 학습하는 확장 가능한 방법을 개발한다.
- 보상 기반 방법이 새롭고의 장면과 작업으로의 전달에서 언어 조건 정책보다 더 나은 일반화를 보이는지 평가한다.
제안 방법
- 여러 작업에 걸쳐 공유되는 언어 조건 보상 함수 r(o, a, L)를 학습하기 위해 MaxEnt IRL을 채택한다.
- 파노라믹 이미지 관찰과 언어 입력을 받는 신경망으로 보상을 표현한다; 언어는 LSTM 임베딩으로, 이미지는 뷰 간 가중치를 공유하는 CNN으로 처리한다.
- 정확한 IRL 기울기 업데이트를 사용하여 알려진 동역학(동적 프로그래밍을 통해)과 함께 여러 작업에서 전문가 궤적 분포를 일치시키도록 학습한다.
- 관찰/동작 공간을 공유하고 언어 L을 작업 맥락으로 기반으로 하는 다중 작업 설정을 사용하여 교차 작업 전달을 가능하게 한다.
- LC-RL을 정책 기반 기준선(최적 정책 클로닝, AGILE, GAIL 변형) 및 오라클 보상 회귀 기준선과 비교한다.
실험 결과
연구 질문
- RQ1IRL로 학습된 언어 조건 보상이 언어 조건 정책보다 새로운 작업과 보이지 않는 환경으로 더 효과적으로 전달되는가?
- RQ2언어를 보상 함수로 접지하는 것이 비전 기반 지시 이행에서 서로 다른 장면과 작업 구성에 대해 강건한 일반화를 가능하게 하는가?
- RQ3LC-RL은 일반화 성능 측면에서 정책 기반 방법 및 오라클 보상 회귀와 어떻게 비교되는가?
- RQ4학습 시 동역학이 알려져 있고 테스트 시에는 알려져 있지 않을 때 정확한 IRL 학습의 실용적 한계와 트레이드-offs는 무엇인가?
주요 결과
- LC-RL은 새로운 작업과 미지의 가정에서도 강한 일반화를 달성하며 테스트 설정에서 정책 기반 기준선보다 우수하다.
- 보상 회귀(오라클 보상)는 절대 성능이 더 높지만, 학습된 보상과 실제 보상 간 차이를 보여주며 LC-RL은 오라클 감독 없이도 경쟁력을 유지한다.
- SUNCG 실내 내비게이션/픽 앤 플레이스 과제에서 LC-RL은 Test-Task에서 66.9%, Test-House에서 51.9%의 총 성공률을 달성하며 여러 설정에서 GAIL-Exact와 AGILE 기준선을 능가한다.
- 정책 복제는 학습 및 테스트 시나리오 모두에서 성능이 떨어지며, 언어 조건 작업의 제로샷 정책 전달의 어려움을 강조한다.
- DQN으로 학습된 보상을 재최적화하는 것은 도전적이며, 정확한 해법(Q-iteration)은 모델 프리 RL로 학습된 보상보다 상당히 강력한 성능을 보이지만 동역학이 알려진 경우 보상 회귀도 형상을 통해 여전히 이점을 얻을 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.