[논문 리뷰] One Step at a Time: Long-Horizon Vision-and-Language Navigation with Milestones
이 논문은 장기 시점 시각-언어 탐색(VLN)에서 하위작업 진행 상황을 명시적으로 모니터링함으로써 성공률을 향상시키는 모델에 종속되지 않는 마일스톤 기반 작업 트래커인 M-Track을 제안한다. 지시문에서 탐색 및 상호작용 마일스톤을 추출하기 위해 BERT-CRF 마일스톤 빌더를 사용하고, 시각적 기반을 통해 진행 상황을 검증하기 위한 마일스톤 체크어를 활용하여, ALFRED에서 강력한 기준 모델 대비 상대적 성공률 향상 폭이 각각 33% 및 52%에 이를 수 있다.
We study the problem of developing autonomous agents that can follow human instructions to infer and perform a sequence of actions to complete the underlying task. Significant progress has been made in recent years, especially for tasks with short horizons. However, when it comes to long-horizon tasks with extended sequences of actions, an agent can easily ignore some instructions or get stuck in the middle of the long instructions and eventually fail the task. To address this challenge, we propose a model-agnostic milestone-based task tracker (M-TRACK) to guide the agent and monitor its progress. Specifically, we propose a milestone builder that tags the instructions with navigation and interaction milestones which the agent needs to complete step by step, and a milestone checker that systemically checks the agent's progress in its current milestone and determines when to proceed to the next. On the challenging ALFRED dataset, our M-TRACK leads to a notable 33% and 52% relative improvement in unseen success rate over two competitive base models.
연구 동기 및 목표
- 에이전트가 하위작업을 건너뛰거나 정지하는 등의 진행 상황 인식 부족으로 인해 발생하는 장기 시점 시각-언어 탐색 문제를 해결하기 위해.
- 다단계의 가정 내 작업에 대해 명시적인 마일스톤 기반 진행 상황 추적을 도입함으로써 에이전트 성능을 향상시키기 위해.
- 모든 VLN 에이전트에 최소한의 아키텍처 변경으로 통합할 수 있는 모델에 종속되지 않는 프레임워크를 개발하기 위해.
- 마일스톤 검증을 기반으로 한 사전 동작 거부 메커니즘을 통해 잘못된 동작을 실행하기 전에 사전에 차단하여 하위작업 실패를 줄이기 위해.
- 명시적인 진행 상황 모니터링이 장기 시점 작업에서 암시적 모니터링보다 훨씬 뛰어나다는 것을 입증하기 위해.
제안 방법
- 마일스톤 빌더는 하위작업 지시문에서 대상 물체와 동작 유형(탐색 또는 상호작용)을 추출하기 위해 BERT-CRF 시퀀스 태깅 모델을 사용한다.
- 마일스톤 체크어는 물체 검출 모델을 사용해 추출된 대상을 시각 환경에 기반하여 기반시키고, 접근성 또는 상호작용 동작을 확인하여 마일스톤 완료를 검증한다.
- 트래커는 에이전트 입력에 대해 현재 하위작업의 지시문만 동적으로 선택하여 활성 마일스톤에 주의를 집중시킨다.
- 사전 동작 거부 메커니즘은 마일스톤 제약을 위반하는 동작(예: 잘못된 물체와 상호작용)을 차단하여 하위작업 실패를 방지한다.
- 시스템은 내부 에이전트 아키텍처에 영향을 주지 않고 언어 지시문, 시각적 관찰, 에이전트 동작만을 기반으로 작동한다.
- 이 방법은 평균적으로 각 작업당 50개의 동작을 포함하는 장기 시점 작업을 특징으로 하는 ALFRED 벤치마크에서 평가된다.
![Figure 1 : Illustration of our M-Track approach . We show an ALFRED task [ 46 ] , which consists of an overall goal (text on the top) and six subtasks (text below each image). The blue / red text box within each image is our extracted navigation / interaction milestones from the subtask instructions](https://ar5iv.labs.arxiv.org/html/2202.07028/assets/x1.png)
실험 결과
연구 질문
- RQ1명시적인 마일스톤 기반 진행 상황 추적은 장기 시점 시각-언어 탐색에서 성공률 향상에 기여하는가?
- RQ2복잡한 다단계 작업에서 마일스톤 기반 모니터링은 암시적 진행 상황 모니터링보다 어떻게 다를까?
- RQ3마일스톤 검증 기반의 사전 동작 거부는 하위작업 실패를 어느 정도 줄이는가?
- RQ4마일스톤 빌더는 자연어 지시문에서 의미 있는 탐색 및 상호작용 마일스톤을 얼마나 정확하게 추출하는가?
- RQ5M-Track 프레임워크는 아키텍처 수정 없이 다양한 VLN 에이전트 아키텍처에 효과적으로 통합될 수 있는가?
주요 결과
- M-Track는 ALFRED 벤치마크에서 VLN∘BERT-L에 비해 미사용 성공률에서 33% 상대적 향상을 달성한다.
- M-Track는 ALFRED 벤치마크에서 VLN∘BERT-L에 비해 미사용 성공률에서 52% 상대적 향상을 달성한다.
- 마일스톤 체크어는 마일스톤 완료 검출을 위한 이진 분류기 베이스라인보다 성능이 뛰어나, 명시적이고 환경 기반 검증의 이점을 보여준다.
- 정답 마일스톤을 사용한 상한선 성능은 M-Track의 예측 마일스톤 성능에 비해 미미한 향상만을 보이며, 마일스톤 빌더의 높은 정확도를 시사한다.
- 사례 연구를 통해 M-Track가 하위작업 생략 및 잘못된 물체 상호작용을 방지하여 기존 모델이 실패하는 상황에서도 전체 작업 완료를 가능하게 한다.
- 모델에 종속되지 않는 설계 덕분에 기존 VLN 에이전트에 쉽게 통합되며, 에이전트의 입력 또는 동작 파이프라인에 최소한의 변경만 필요하다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.