[논문 리뷰] VELMA: Verbalization Embodiment of LLM Agents for Vision and Language Navigation in Street View
VELMA는 스트리트 뷰에서 시각-언어 탐색을 위한 새로운 LLM 기반 에이전트로, 행동 예측을 위한 맥락으로 구어화된 시각적 관찰과 궤적 역사를 사용한다. 지시문에서 랜드마크를 추출하고 CLIP를 사용해 그 가시성을 검증함으로써, 두 데이터셋에서 미세조정을 거친 후 작업 완료율이 25% 향상되어 최신 기술 수준에 도달한다.
Incremental decision making in real-world environments is one of the most challenging tasks in embodied artificial intelligence. One particularly demanding scenario is Vision and Language Navigation~(VLN) which requires visual and natural language understanding as well as spatial and temporal reasoning capabilities. The embodied agent needs to ground its understanding of navigation instructions in observations of a real-world environment like Street View. Despite the impressive results of LLMs in other research areas, it is an ongoing problem of how to best connect them with an interactive visual environment. In this work, we propose VELMA, an embodied LLM agent that uses a verbalization of the trajectory and of visual environment observations as contextual prompt for the next action. Visual information is verbalized by a pipeline that extracts landmarks from the human written navigation instructions and uses CLIP to determine their visibility in the current panorama view. We show that VELMA is able to successfully follow navigation instructions in Street View with only two in-context examples. We further finetune the LLM agent on a few thousand examples and achieve 25%-30% relative improvement in task completion over the previous state-of-the-art for two datasets.
연구 동기 및 목표
- 대규모 도시 환경인 스트리트 뷰와 같은 실제 환경에서 대규모 언어 모델(LLMs)이 점진적인 결정을 내릴 수 있도록 하는 것.
- 동적인 실제 시각적 관찰에 자연어 탐색 지시문을 정착시키는 도전 과제를 해결하는 것.
- 언어화된 환경 상태와 궤적 맥락을 활용해 소수의 예제 및 미세조정 성능을 향상시키는 것.
- 터치다운 환경의 한계를 해결하는 것, 예를 들어 교차로에서 잘못된 행동 정렬과 TURN_AROUND과 같은 직관적인 동작의 부재.
- 종료 훈련 없이도 언어화 기반의 몸체화된 LLM이 복잡한 실제 환경의 VLN 작업에서 뛰어난 성능을 낼 수 있음을 보여주는 것.
제안 방법
- VELMA는 작업 설명, 탐색 지시문, 과거 행동, 언어화된 시각적 관찰을 포함한 자연어 시퀀스를 LLM에 프롬프팅하는 언어화 기반 프롬프팅 전략을 사용한다.
- 시각적 관찰은 지침에서 랜드마크를 추출하고, CLIP를 사용해 랜드마크와 현재 풍경을 비교해 가시성 점수를 계산하는 파이프라인을 통해 언어화된다.
- 에이전트는 각 단계에서 전체 맥락 프롬프트를 기반으로 다음 행동(예: FORWARD, TURN_LEFT, TURN_AROUND)을 예측함으로써 점진적인 결정을 내린다.
- 정책 학습과 일반화를 향상시키기 위해 교사 강제와 학생 강제를 혼합 비율 λ=0.5로 조합한 새로운 훈련 절차인 응답 기반 학습(RBL)을 도입한다.
- 에이전트가 목표에 도달하지 못할 경우 오라클이 최적의 반사적 행동 시퀀스를 계산해 수정 지도를 제공한다.
- 환경 수정을 포함한다: 교차로의 잘못된 정렬을 수정하고, 탐색의 현실성과 성능 향상을 위해 TURN_AROUND 동작을 추가한다.
실험 결과
연구 질문
- RQ1LLM을 종료 훈련 없이도 스트리트 뷰와 같은 실제 대규모 도시 환경에서 언어화된 맥락을 사용해 효과적으로 몸체화할 수 있는가?
- RQ2랜드마크 검출과 CLIP 기반 가시성 점수를 통한 시각적 관찰 언어화가 LLM 기반 탐색 성능 향상에 얼마나 효과적인가?
- RQ3단 두 개의 예제만을 사용한 소수의 예제 내재 학습이 도시 VLN에서 경쟁 가능한 성능을 낼 수 있는가? 그리고 미세조정은 이를 어떻게 향상시키는가?
- RQ4TURN_AROUND 추가 및 교차로 문제 수정과 같은 환경 수준의 수정이 에이전트 성능과 훈련 안정성에 어떤 영향을 미치는가?
- RQ5비전 인코더 선택(예: CLIP 대비 OpenCLIP)이 랜드마크 검출과 전체 작업 성공률에 어떤 영향을 미치는가?
주요 결과
- VELMA는 Map2seq 데이터셋에서 소수의 예제 내재 학습으로 23%의 작업 완료율을 기록했고, 터치다운에서는 10%를 기록하여 단 두 개의 소수의 예제만으로도 뛰어난 소수의 예제 일반화 성능를 입증했다.
- 전체 훈련 세트에서의 미세조정 후 VELMA는 터치다운에서 26%의 작업 완료율, Map2seq에서는 47%의 작업 완료율을 기록하여 이전 최신 기술 대비 25% 상대적 향상을 달성했다.
- OpenCLIP를 사용한 랜드마크 점수 계산이 원래 CLIP 모델보다 성능이 뛰어나, 향상된 비전 인코더가 직접적으로 에이전트 성능 향상에 기여함을 시사한다.
- 프롬프트에서 랜드마크 정보를 제거하면 성능이 크게 떨어지며, 특히 터치다운에서 두드러진다. 이는 맥락 내에서 시각적 정착의 중요성을 확인한다.
- TURN_AROUND 동작 추가 및 환경 내 교차로 오류 수정이 복잡한 정지 조건을 처리하는 데에 에이전트의 능력을 크게 향상시켰다.
- 불확실한 랜드마크를 지나치고 가시성이 확인되면 다시 돌아오는 방식으로, "Y 앞에서 멈춰" 또는 "X에서 멈추되 Y를 넘지 말 것"과 같은 모호한 정지 지시어를 효과적으로 처리하는 공간 추론 능력을 습득했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.