Skip to main content
QUICK REVIEW

[논문 리뷰] FILM: Following Instructions in Language with Modular Methods

So-Yeon Min, Devendra Singh Chaplot|arXiv (Cornell University)|2021. 10. 12.
Multimodal Machine Learning Applications참고 문헌 34인용 수 14
한 줄 요약

FILM은 전문가 트레이젝터리나 저수준 언어 지시 없이도 ALFRED 벤치마크에서 최고 성능(24.46% 성공률)을 달성하는 모듈러하고 체계적인 접근 방식을 제안한다. 이는 환경의 의미적 지ap을 구축하고 의미적 검색 정책을 통해 탐색을 이끌어내는 방식으로, 장기적인 작업 수행 능력을 향상시키기 위해 공간 기억을 명시적으로 모델링한다.

ABSTRACT

Recent methods for embodied instruction following are typically trained end-to-end using imitation learning. This often requires the use of expert trajectories and low-level language instructions. Such approaches assume that neural states will integrate multimodal semantics to perform state tracking, building spatial memory, exploration, and long-term planning. In contrast, we propose a modular method with structured representations that (1) builds a semantic map of the scene and (2) performs exploration with a semantic search policy, to achieve the natural language goal. Our modular method achieves SOTA performance (24.46 %) with a substantial (8.17 % absolute) gap from previous work while using less data by eschewing both expert trajectories and low-level instructions. Leveraging low-level language, however, can further increase our performance (26.49 %). Our findings suggest that an explicit spatial memory and a semantic search policy can provide a stronger and more general representation for state-tracking and guidance, even in the absence of expert trajectories or low-level instructions.

연구 동기 및 목표

  • 전문가 트레이젝터리나 저수준 언어 지시에 의존하는 엔드 투 엔드, 암시학습 기반 방법의 한계를 해결하기 위해.
  • 공간 기억과 체계적인 상태 추적을 명시적으로 모델링하여 장기적인 탐색 및 작업 수행 능력을 향상시키기 위해.
  • 복잡한 다중모odal 지시 수행 작업에서 엔드 투 엔드 신경망보다 모듈러하고 체계적인 구성 요소가 더 나은 성능를 내는지 조사하기 위해.
  • 의미적 검색 정책이 큰 복잡한 환경에서 작은 또는 평평한 물체의 국소화를 향상시키는 데 얼마나 효과적인지 평가하기 위해.
  • 순차적 지시 없이도 높은 성능를 달성할 수 있음을 입증하여 데이터 및 지도 의존도를 줄이기 위해.

제안 방법

  • 언어 처리 모듈을 통해 자연어 지시를 구조화된 형태로 변환하여 작업에 관련된 하위목표와 동작을 추출한다.
  • 자기 중심 RGB-D 관측치를 기반으로 깊이 추정과 개체 세분화를 사용하여 의미적 거리 맵을 구성한다.
  • 의미적 맵을 기반으로 목표 위치를 샘플링하는 의미적 검색 정책을 활용하여, 관측되지 않은 하위목표 물체 쪽으로 탐색을 이끌어낸다.
  • 현재 상태와 목표를 기반으로 네비게이션 및 상호작용 동작을 생성하는 결정론적 정책 헤드를 사용하여 정밀한 제어를 가능하게 한다.
  • perception, 기억, 계획, 동작 생성을 분리하는 모듈러한 파이프라인을 통합하여 해석 가능성과 강건성을 확보한다.
  • 전문가 트레이젝터리나 저수준 언어 지시 없이도 고수준 언어 지시만을 기반으로 시스템을 엔드 투 엔드로 훈련시킨다.

실험 결과

연구 질문

  • RQ1전문가 지시 없이도 엔드 투 엔드 신경망보다 모듈러하고 체계적인 접근 방식이 임베디드 지시 수행에서 더 나은 성능를 내는가?
  • RQ2의미적 검색 정책은 큰 복잡한 환경에서 탐색과 하위목표 국소화를 얼마나 효과적으로 향상시키는가?
  • RQ3명시적인 공간 기억은 지시 수행 에이전트의 상태 추적과 장기적인 계획 수립에 얼마나 기여하는가?
  • RQ4저수준 언어 지시가 없는 것이 성능에 심각한 영향을 미치는가, 그리고 더 나은 인식과 계획으로 보완될 수 있는가?
  • RQ5이 방법은 다양한 작업 유형과 방 크기에서 어떻게 작동하는가, 특히 평평하거나 작은 물체와 같은 어려운 하위목표에 대해선 어떻게 되는가?

주요 결과

  • FILM은 ALFRED 벤치마크에서 24.46%의 새로운 SOTA 성공률을 달성하여 이전 SOTA 방법보다 8.17%p 높은 성능를 기록했다.
  • 의미적 검색 정책은 첫 번째 목표 물체 국소화 비율을 검증용 미사용 세트에서 76.12%에서 80.51%로 향상시켰다.
  • 큰 환경에서는 의미적 검색 정책이 성공률을 14.74%에서 15.17%로 끌어올리며 첫 번째 목표 물체 탐지 성능을 6.39%p 향상시켰다.
  • '정리하고 놓기' 작업에서는 하위목표가 평평하고 시각적으로 미묘한 경우(예: 세면대)에 의미적 정책을 사용할 경우 성공률이 14.16%에서 33.63%로 상승했다.
  • 저수준 언어 지시를 포함하면 성능가 26.49%로 향상되어, 체계적인 지도가 일반화 능력을 향상시킨다는 것을 시사한다.
  • 제거 실험 결과, 의미적 검색 정책이 큰 복잡한 환경과 감지가 어려운 물체에서 가장 유익하며 에이전트의 방향 감각 상실을 줄이는 데 기여한다는 것이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.