Skip to main content
QUICK REVIEW

[논문 리뷰] Just Ask:An Interactive Learning Framework for Vision and Language Navigation

Ta-Chung Chi, Mihail Eric|arXiv (Cornell University)|2019. 12. 02.
Multimodal Machine Learning Applications참고 문헌 26인용 수 6
한 줄 요약

이 논문은 시각-언어 탐색에서 에이전트가 탐색 중 인간의 도움을 요청함으로써 모호함을 해결할 수 있도록 하는 상호작용 학습 프레임워크를 제안한다. 보상 형상 조정을 사용하는 강화학습 에이전트 또는 보다 단순한 혼란 기반 방법을 통해, 에이전트는 언제, 무엇을 질문할지를 학습하며, 평균적으로 한 번의 질문만으로도 성공률을 최소 15% 향상시키고, 노이즈가 있는 인간의 응답에 대해 강건성을 유지하며 인간 유도 지속 학습을 통해 자료 효율성을 확보한다.

ABSTRACT

In the vision and language navigation task, the agent may encounter ambiguous situations that are hard to interpret by just relying on visual information and natural language instructions. We propose an interactive learning framework to endow the agent with the ability to ask for users' help in such situations. As part of this framework, we investigate multiple learning approaches for the agent with different levels of complexity. The simplest model-confusion-based method lets the agent ask questions based on its confusion, relying on the predefined confidence threshold of a next action prediction model. To build on this confusion-based method, the agent is expected to demonstrate more sophisticated reasoning such that it discovers the timing and locations to interact with a human. We achieve this goal using reinforcement learning (RL) with a proposed reward shaping term, which enables the agent to ask questions only when necessary. The success rate can be boosted by at least 15% with only one question asked on average during the navigation. Furthermore, we show that the RL agent is capable of adjusting dynamically to noisy human responses. Finally, we design a continual learning strategy, which can be viewed as a data augmentation method, for the agent to improve further utilizing its interaction history with a human. We demonstrate the proposed strategy is substantially more realistic and data-efficient compared to previously proposed pre-exploration techniques.

연구 동기 및 목표

  • 자연어 지시어와 시각적 단서만으로는 의사결정을 내리기에 부족한 시각-언어 탐색에서의 모호함을 해결하기 위해.
  • 수동적 탐색이나 사전 수집된 데이터에 의존하지 않고, 실시간으로 인간의 도움을 요청할 수 있는 프로액티브 에이전트를 가능하게 하기 위해.
  • 인간 상호작용 이력을 활용하여 지속적인 향상이 가능한 자료 효율적이고 현실적인 학습 전략을 개발하기 위해.
  • 에이전트의 질문 시점, 유형, 형식을 최적화하여 의사소통 효율성과 작업 성공률을 높이기 위해.
  • 노이즈가 있는 인간의 응답에 대한 강건성 향상과 사전 탐색 데이터 수집에 대한 의존도 감소를 위해.

제안 방법

  • 행동 예측 신뢰도가 임계값 이하로 떨어지면 질문을 하는 혼란 기반 에이전트(MC)를 제안하며, 인간의 혼란을 모방한다.
  • 작업 성공률을 극대화하기 위해 질문 시점을 학습하는 보상 형상 조정 항목을 갖춘 강화학습 에이전트(ASA)를 도입한다.
  • 에이전트가 올바른 다음 행동을 요청하고 인간이 정답 행동을 제공하는 인간-중심 상호작용 설정을 사용한다.
  • 실제 사용자 상호작용 중 수집한 상호작용 이력을 활용해 에이전트를 미세조정하는 지속 학습 전략을 적용한다.
  • 두 단계의 미세조정 프로세스를 적용한다: 인간 유도 데이터 기반 지도 미세조정, 필요에 따라 RL과 병행하여 일반화 능력을 향상시킨다.
  • 실제 배포를 시뮬레이션하기 위해 미리 보지 않은 환경의 분리 및 무작위 분할을 사용하는 현실적인 평가 프로토콜을 설계한다.

실험 결과

연구 질문

  • RQ1시각-언어 탐색 중 인간의 도움을 요청할 최적의 시점은 언제인가?
  • RQ2필수적인 질문만 하면서도 높은 작업 성공률을 유지할 수 있도록 에이전트를 어떻게 훈련시킬 수 있는가?
  • RQ3상호작용 도중 인간의 응답이 노이즈가 있거나 일관되지 않을 경우 에이전트는 어떻게 적응할 수 있는가?
  • RQ4사전 탐색 데이터 증강 대비 인간 유도 탐색은 자료 효율성과 실제 적용 가능성 측면에서 어떻게 다른가?
  • RQ5상호작용 이력은 새로운 환경에서 에이전트의 성능 향상에 어떻게 활용될 수 있는가?

주요 결과

  • 강화학습 에이전트(ASA)는 평균적으로 한 번의 질문만으로도 성공률을 최소 15% 향상시킨다.
  • ASA 에이전트는 인간 응답의 노이즈에 동적으로 적응하여, 응답 품질이 떨어지는 상황에서도 높은 성공률을 유지한다. 이는 혼란 기반 모델과는 대조적으로 나타난다.
  • 분리된 테스트 분할에서 인간 유도 탐색은 사전 탐색 데이터 증강보다 5% 높은 성능(0.554 대 0.504)을 기록하여 자료 효율성이 뛰어나다는 것을 입증한다.
  • 강화학습 없이 지도 학습만으로도 미세조정된 경우, 인간 유도 방법은 기준 모델보다 3% 높은 성능(0.514 대 0.483)을 기록한다.
  • 사전 탐색 기법 대비 훨씬 적은 자료로도 뛰어난 성능을 달성하며, 자료 효율성 곡선을 통해 인간 유도 탐색이 훨씬 적은 궤적 수로 최고 성능에 도달함을 보여준다.
  • MC 에이전트는 다양한 설정에서 일관된 성능을 유지하지만, 종합적인 훈련 덕분에 ASA 에이전트는 더 높은 적응성과 탐색 행동을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.