Skip to main content
QUICK REVIEW

[논문 리뷰] March in Chat: Interactive Prompting for Remote Embodied Referring Expression

Yanyuan Qiao, Yuankai Qi|arXiv (Cornell University)|2023. 08. 20.
Multimodal Machine Learning ApplicationsComputer Science인용 수 3
한 줄 요약

이 논문은 대규모 3차원 환경에서 고수준의 희미한 자연어 지시만으로도 작동하는 시각-언어 탐색 에이전트가 대규모 언어 모델(Large Language Model, LLM)과 실시간 대화를 통해 동적으로 탐색 경로를 계획할 수 있도록 하는 새로운 상호작용 프롬프팅 프레임워크인 March-in-Chat (MiC)을 제안한다. 환경 인지 기반의 Room-and-Object Aware Scene Perceiver (ROASP)와 두 가지 계획 모듈인 Goal-Oriented Static Planning (GOSP) 및 Scene-Oriented Dynamic Planning (SODP)를 통합함으로써 MiC는 REVERIE 벤치마크에서 최신 기술 수준(SoTA) 성능을 달성하여 테스트 세트에서 41.97%의 SPL과 26.17%의 RGSPL을 기록하며 이전 방법들을 크게 능가한다.

ABSTRACT

Many Vision-and-Language Navigation (VLN) tasks have been proposed in recent years, from room-based to object-based and indoor to outdoor. The REVERIE (Remote Embodied Referring Expression) is interesting since it only provides high-level instructions to the agent, which are closer to human commands in practice. Nevertheless, this poses more challenges than other VLN tasks since it requires agents to infer a navigation plan only based on a short instruction. Large Language Models (LLMs) show great potential in robot action planning by providing proper prompts. Still, this strategy has not been explored under the REVERIE settings. There are several new challenges. For example, the LLM should be environment-aware so that the navigation plan can be adjusted based on the current visual observation. Moreover, the LLM planned actions should be adaptable to the much larger and more complex REVERIE environment. This paper proposes a March-in-Chat (MiC) model that can talk to the LLM on the fly and plan dynamically based on a newly proposed Room-and-Object Aware Scene Perceiver (ROASP). Our MiC model outperforms the previous state-of-the-art by large margins by SPL and RGSPL metrics on the REVERIE benchmark.

연구 동기 및 목표

  • REVERIE 벤치마크와 같이 고수준의 희미한 자연어 지시만을 제공하는 복잡하고 대규모의 3차원 환경에서 탐색하는 데 도전하는 것.
  • 에이전트와 LLM 간의 실시간 대화를 통해 LLM이 동적이고 환경 인지 기반의 계획자로 기능하도록 유도하는 것.
  • 실시간 환경 인식과 적응형 계획을 통합하여 원격 몸체 참조 표현 작업에서의 탐색 및 물체 기반 정확도를 향상시키는 것.
  • 세부 지침이 제공되는 시뮬레이션된 VLN 작업과 사용자가 고수준 명령어를 내리는 실제 응용 간 격차를 메우는 것.

제안 방법

  • MiC 프레임워크는 현재 시각적 관측치를 분석하고 프롬프팅에 사용할 수 있는 환경 인지 기반의 기술적 설명을 생성하기 위해 Room-and-Object Aware Scene Perceiver (ROASP) 모듈을 사용한다.
  • Goal-Oriented Static Planning (GOSP) 모듈은 LLM을 통해 목표 물체를 식별하고 LLM 내부의 세계 지식을 활용해 그 위치를 추론한다.
  • Scene-Oriented Dynamic Planning (SODP) 모듈은 에이전트가 새로운 방에 진입할 때마다 ROASP의 실시간 피드백을 통합하여 단계별로 탐색 지시를 동적으로 생성한다.
  • 시스템은 반복적인 프롬프팅을 통해 LLM에 원래 지시, 이전 행동, 현재 환경 기술 등을 포함한 업데이트된 맥락을 지속적으로 제공하여 적응형 탐색 계획을 생성한다.
  • LLM은 고수준의 REVERIE 지시, 예시, ROASP가 생성한 환경 기술을 통합한 구조화된 지시 템플릿을 통해 세밀한 계획을 유도하도록 프롬프팅된다.
  • 에이전트는 LLM이 생성한 계획에 따라 행동을 수행하며, 방 전환을 감지할 경우 다시 LLM과 상호작용하여 환경 변화에 지속적으로 적응한다.

실험 결과

연구 질문

  • RQ1고수준 지시만 제공되는 REVERIE 벤치마크에서 대규모 언어 모델(LLM)과의 상호작용 프롬프팅이 탐색 계획 성능을 향상시킬 수 있는가?
  • RQ2Room-and-Object Aware Scene Perceiver (ROASP)를 통한 환경 인지 기반의 인식이 LLM이 생성한 탐색 계획의 품질과 적응 가능성에 어떻게 기여하는가?
  • RQ3장거리, 대규모 탐색 작업에서 정적 또는 고정된 프롬프팅 전략에 비해 동적이고 환경 기반의 프롬프팅 전략이 어떤 기여를 하는가?
  • RQ4LLM과의 실시간 대화가 기준 또는 정적 프롬프팅 방법에 비해 탐색 성공률과 기반 정확도 향상에 얼마나 기여하는가?

주요 결과

  • MiC는 REVERIE 테스트 세트의 미사용 데이터에서 SPL 지표로 41.97%의 최신 기술 수준 성능을 달성하였고, RGSPL 지표로는 26.17%를 기록하여 이전 최신 기술 수준 방법들보다 각각 최소 3.09%와 3.49% 이상 뛰어나다.
  • 제거 실험 결과, ROASP를 통합한 동적 계획 모듈이 정적 프롬프팅에 비해 성능 향상이 뚜렷하게 나타나 SPL에서 1.2%p의 절대적 향상과 RGSPL에서 0.8%p의 향상을 보였다.
  • 사람 평가 결과, SODP 모듈이 더 관련성 있고 이성적인 탐색 지시를 생성하는 것으로 확인되었으며, 관련성 점수는 2.06, 이성성 점수는 1.93(0–3 척도 기준)이었다.
  • 동적 예시를 제거하면 관련성 점수는 31.55% 감소하고 이성성 점수는 36.27% 감소하여 맥락 인지 기반의 진화하는 프롬프팅의 핵심적 역할을 확인할 수 있었다.
  • ROASP 모듈은 성능 향상에 기여하는 바가 크며, 이를 제거할 경우 관련성 점수는 1.64, 이성성 점수는 1.55로 하락하여 환경 이해에 있어 그 가치를 입증하였다.
  • 정성적 분석 결과, 시스템은 방 전환에 대응하여 적응하고 논리적 일관성을 유지하는 일관되고 맥락 기반의 탐색 계획을 생성하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.