Skip to main content
QUICK REVIEW

[논문 리뷰] Prompter: Utilizing Large Language Model Prompting for a Data Efficient Embodied Instruction Following

Yuki Inoue, Hiroki Ohashi|arXiv (Cornell University)|2022. 11. 07.
Natural Language Processing Techniques인용 수 15
한 줄 요약

이 논문은 전통적인 데이터 집약적인 의미 검색 모듈 대신 대규모 언어 모델(Large Language Model, LLM) 프롬프팅을 사용하는 데이터 효율적인 접근법인 Prompter를 제안한다. 사전 훈련된 LLM을 활용해 추가 훈련 데이터 없이도 물체 간 공간 관계를 추론함으로써, Prompter는 단계별 지시어를 사용할 때 ALFRED에서 45.72%의 성공률을 기록하며, 이는 이전 최고 성능보다 10.31% 높은 성능을 달성한다. 이는 추가 애너테이션 또는 미세조정이 필요로 하지 않는다는 점에서 뛰어난 성능을 발휘한다.

ABSTRACT

Embodied Instruction Following (EIF) studies how autonomous mobile manipulation robots should be controlled to accomplish long-horizon tasks described by natural language instructions. While much research on EIF is conducted in simulators, the ultimate goal of the field is to deploy the agents in real life. This is one of the reasons why recent methods have moved away from training models end-to-end and take modular approaches, which do not need the costly expert operation data. However, as it is still in the early days of importing modular ideas to EIF, a search for modules effective in the EIF task is still far from a conclusion. In this paper, we propose to extend the modular design using knowledge obtained from two external sources. First, we show that embedding the physical constraints of the deployed robots into the module design is highly effective. Our design also allows the same modular system to work across robots of different configurations with minimal modifications. Second, we show that the landmark-based object search, previously implemented by a trained model requiring a dedicated set of data, can be replaced by an implementation that prompts pretrained large language models for landmark-object relationships, eliminating the need for collecting dedicated training data. Our proposed Prompter achieves 41.53\% and 45.32\% on the ALFRED benchmark with high-level instructions only and step-by-step instructions, respectively, significantly outperforming the previous state of the art by 5.46\% and 9.91\%.

연구 동기 및 목표

  • 모듈 훈련을 위한 과도한 작업별 데이터셋 의존도를 줄임으로써 몸체 지시어 따르기(EIF)의 데이터 의존도를 감소시키는 것.
  • 시뮬레이션 환경과 실제 환경 간의 구현 격차를 해소하기 위해, 비용이 많이 드는 데이터 수집을 피하는 방법을 개발하는 것.
  • 새로운 학습 가능한 구성 요소를 도입하지 않고도 기존의 모듈러 EIF 프레임워크인 FILM보다 성능을 향상시키는 것.
  • 감독 학습 기반 의미 검색 모듈 대체로 LLM 프롬프팅의 효과성을 평가하는 것.
  • LLM 기반 추론이 편향된 시뮬레이터 분포에서 훈련된 데이터 기반 모델보다 실세계에서의 물체 간 공간 공존 관계를 더 견고하게 포착할 수 있는지 입증하는 것.

제안 방법

  • 모듈 재학습 없이 아키텍처 및 추론 시점의 수정을 통해 성능을 향상시키는 FILM++라는 FILM 프레임워크의 개선된 버전을 제안한다.
  • FILM++의 의미 검색 모듈을 사전 훈련된 대규모 언어 모델(LLM)을 사용한 제로샷 프롬프팅 메커니즘으로 대체한다.
  • 자연어 기반 기술과 관측된 시나리오 맥락을 기반으로 LLM이 물체의 가능성이 높은 위치를 예측하며, 공존 확률을 유사도 측정 기준으로 간주한다.
  • LLM이 공간적 추론을 유도하기 위해 프롬프트 템플릿을 적용하며, 예를 들어 다른 시야에 있는 물체들에 비해 목표 물체가 어디에 위치할 가능성이 높은지 예측한다.
  • 2차원 시각화 및 공간적 추론 분석을 위해 물체 공존의 음수 로그 확률을 유사도 지표로 사용한다.
  • 주행 안전성을 향상시키고 충돌을 줄이기 위해 장애물 확장 및 기타 환경 수정을 구현한다.

실험 결과

연구 질문

  • RQ1추가 훈련 데이터 없이 LLM 프롬프팅이 감독 기반 의미 검색 모듈을 대체할 수 있는가?
  • RQ2LLM 기반 의미 검색의 성능은 데이터 기반 대안 대비 성공률 및 일반화 능력 측면에서 어떻게 비교되는가?
  • RQ3LLM은 특히 미리 보지 않은 환경에서 실세계의 물체 간 공간 관계를 어느 정도 정확히 포착할 수 있는가?
  • RQ4제로샷 프롬프팅은 시뮬레이터에서 생성된 합성 데이터로 훈련된 모델 대비 분포 이탈에 대해 더 뛰어난 내성성을 보이는가?
  • RQ5LLM 기반 추론의 실패 유형은 기존의 모듈러 에이전트와 어떻게 다를까?

주요 결과

  • Prompter는 단계별 지시어를 사용할 때 ALFRED 벤치마크에서 45.72%의 성공률을 기록하며, 이는 이전 최고 성능보다 10.31% 높은 성능이다.
  • 고수준 지시어만을 사용할 경우, Prompter는 42.64%의 성공률을 기록하며, 이는 이전 최고 성능보다 6.57% 높은 성능이다.
  • LLM 프롬프팅 기반 의미 검색 모듈은 추가 훈련 데이터 없이도 랜덤 검색 및 CNN 기반 기준선보다 뛰어난 성능을 보였다.
  • 실패 분석 결과, Prompter의 오류 중 32.80%는 언어 처리 문제에서 기인하고, 28.80%는 목표 물체를 찾지 못한 데서 기인하여, 시각-언어 기반 정합 문제에 도전 과제가 있음을 시사한다.
  • 환경 시뮬레이션에서 장애물 확장을 통해 충돌 수를 FILM 대비 97.5% 감소시켰다.
  • 2차원 MDS 시각화에서의 물체 군집화 결과, LLM 기반 모듈이 주방 등 방 수준의 공간 공존 관계(예: 커피 머신 근처의 책장과 머그컵)를 효과적으로 포착하고 있음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.