Skip to main content
QUICK REVIEW

[논문 리뷰] Few-shot Object Grounding and Mapping for Natural Language Robot Instruction Following

Valts Blukis, Ross A. Knepper|arXiv (Cornell University)|2020. 11. 14.
Multimodal Machine Learning Applications참고 문헌 45인용 수 6
한 줄 요약

이 논문은 로봇에서 자연어 지시어를 따르는 데 있어 소수의 예시 이미지와 설명만 추가하여 이전에 본 적이 없는 물체에 대해 추론할 수 있도록 하는, 몇 번의 예시에 기반한 언어 조건부 물체 기반 및 맵핑 기법을 제안한다. 이 방법은 기존 최고 수준의 방법보다 인간 평가 점수에서 27%의 절대적 향상을 달성한다. 이는 해당 모델이 모든 물체에 대해 훈련된 후에도 여전히 성능을 높이는 데 기여한다.

ABSTRACT

We study the problem of learning a robot policy to follow natural language instructions that can be easily extended to reason about new objects. We introduce a few-shot language-conditioned object grounding method trained from augmented reality data that uses exemplars to identify objects and align them to their mentions in instructions. We present a learned map representation that encodes object locations and their instructed use, and construct it from our few-shot grounding output. We integrate this mapping approach into an instruction-following policy, thereby allowing it to reason about previously unseen objects at test-time by simply adding exemplars. We evaluate on the task of learning to map raw observations and instructions to continuous control of a physical quadcopter. Our approach significantly outperforms the prior state of the art in the presence of new objects, even when the prior approach observes all objects during training.

연구 동기 및 목표

  • 재훈련이나 미세조정 없이도 로봇이 이전에 본 적이 없는 물체를 포함한 자연어 지시어를 따를 수 있도록 하는 것.
  • 학습 가능한 물체 중심 맵을 통해 인식과 추론을 분리함으로써 모듈식 지시어 따르기 시스템의 공학적 및 통합 오버헤드를 줄이는 것.
  • 예시를 활용하여 증강현실 데이터를 활용해 다양한 물체 유형 간 일반화를 이룰 수 있는 소수의 예시 기반 기반 기법을 설계하는 것.
  • 물체 위치와 지시된 사용법을 인코딩하는 학습된 맵 표현을 구축하여 데이터베이스 확장에 의해 새로운 물체에 대한 추론을 가능하게 하는 것.

제안 방법

  • 이 방법은 합성 증강현실(AR) 데이터로 훈련된 소수의 예시 기반 기반 모듈을 사용하여 지시어 내 언어 언급을 예시 데이터베이스를 통해 시각적 물체와 정렬한다.
  • 물체 기반은 각 물체의 외관과 이름에 대한 저장된 예시와 언어 언급 간의 유사도를 비교하는 모델을 통해 수행되며, 각 물체별 훈련이 필요로 하지 않는다.
  • 기반 출력에서 학습된 맵 표현이 구성되며, 물체 위치와 지시어에서의 역할을 인코딩하여 물체 중심 추론을 가능하게 한다.
  • SuReAL을 사용하여 시뮬레이션에서 종합적으로 훈련된 정책은 첫 번째 정책 단계에 대해 지도학습을, 두 번째 단계에 대해 PPO를 사용한 강화학습을 통합한다.
  • 지도학습과 강화학습 과정 간에 데이터를 공유함으로써 정책의 강건성을 향상시키고 열악한 행동을 방지한다.
  • 기반 모듈의 AR 데이터 소스를 시뮬레이터 기반 AR 데이터에서 실제 세계 AR 데이터로 교체함으로써 도메인 적응 없이 직접 물리적 헬리코프터에 배포할 수 있다.

실험 결과

연구 질문

  • RQ1재훈련이나 미세조정 없이도 로봇 정책이 새로운 물체 유형을 포함한 자연어 지시어 따르기에서 일반화할 수 있는가?
  • RQ2예시를 활용한 소수의 예시 기반 기반 기법이 실제 환경에서 새로운 물체에 대한 추론을 얼마나 효과적으로 가능하게 하는가?
  • RQ3물체 위치와 지시된 사용법을 인코딩하는 학습된 맵 표현이 지시어 따르기 작업에서 제로샷 일반화를 향상시키는가?
  • RQ4소수의 예시 기반 기반 기법을 정책 아키텍처에 통합하는 것이 전체 훈련 데이터 커버리지가 필요한 종합적 학습 접근법보다 성능이 뛰어나게 되는가?
  • RQ5완전히 새로운 물체를 포함한 환경에서 시험했을 때, 제안된 방법이 기존 최고 수준의 모델을 얼마나 뛰어넘는가?

주요 결과

  • 제안된 방법은 새로운 물체로 일반화할 때 기존 최고 수준의 방법보다 인간 평가 점수에서 27%의 절대적 향상을 달성한다.
  • 시험 환경의 63개 모든 물체에 대해 훈련된 베이스라인보다 인간 평가에서 10% 높은 성능을 기록함으로써, 뛰어난 제로샷 일반화 능력을 입증한다.
  • 데이터베이스에 몇 장의 예시 이미지와 설명만 추가함으로써, 추가 훈련 없이도 이전에 본 적이 없는 물체를 포함한 지시어를 성공적으로 따를 수 있다.
  • 기반 모듈의 AR 데이터 소스를 교체함으로써 시뮬레이션에서 실제 세계로의 일반화가 효과적으로 이루어지며, 도메인 적응이나 실제 세계에서의 미세조정 없이도 가능하다.
  • 지도학습과 강화학습 단계 간의 데이터 공유 메커니즘이 열악한 행동을 방지하고 정책의 강건성을 향상시킨다.
  • 실제 물리적 헬리코프터에서의 실시간 배포에서도 높은 성능을 유지함으로써, AR 기반 훈련 및 전이 전략의 효과성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.