Skip to main content
QUICK REVIEW

[논문 리뷰] SOON: Scenario Oriented Object Navigation with Graph-based Exploration

Fengda Zhu, Xiwen Liang|arXiv (Cornell University)|2021. 03. 31.
Multimodal Machine Learning Applications참고 문헌 51인용 수 5
한 줄 요약

이 논문은 3D 환경에서 임의의 출발 지점에서 시작하여 장면에 대한 자연어 기술만을 사용해 목표 물체로 이동해야 하는 새로운 작업인 시나리오 중심 물체 탐색(SOON)을 소개한다. 저자는 환경를 동적 그래프로 모델링하여 학습 안정성과 일반화 능력을 향상시키는 그래프 기반 탐색(GBE)을 제안하였으며, FAO 및 R2R 벤치마크에서 기존 방법 대비 5.4% 향상된 SOTA 성능을 달성하였다.

ABSTRACT

The ability to navigate like a human towards a language-guided target from anywhere in a 3D embodied environment is one of the 'holy grail' goals of intelligent robots. Most visual navigation benchmarks, however, focus on navigating toward a target from a fixed starting point, guided by an elaborate set of instructions that depicts step-by-step. This approach deviates from real-world problems in which human-only describes what the object and its surrounding look like and asks the robot to start navigation from anywhere. Accordingly, in this paper, we introduce a Scenario Oriented Object Navigation (SOON) task. In this task, an agent is required to navigate from an arbitrary position in a 3D embodied environment to localize a target following a scene description. To give a promising direction to solve this task, we propose a novel graph-based exploration (GBE) method, which models the navigation state as a graph and introduces a novel graph-based exploration approach to learn knowledge from the graph and stabilize training by learning sub-optimal trajectories. We also propose a new large-scale benchmark named From Anywhere to Object (FAO) dataset. To avoid target ambiguity, the descriptions in FAO provide rich semantic scene information includes: object attribute, object relationship, region description, and nearby region description. Our experiments reveal that the proposed GBE outperforms various state-of-the-arts on both FAO and R2R datasets. And the ablation studies on FAO validates the quality of the dataset.

연구 동기 및 목표

  • 실세계 탐색의 격차를 보완하기 위해, 에이전트가 장면 기술만을 사용해 임의의 출발 위치에서 목표 물체를 찾아야 하는 작업을 제안한다.
  • 물체의 특성, 관계, 공간적 영역을 기술하는 3,000개의 다양한, 모호하지 않은 자연어 지시어를 포함한 벤치마크 FAO를 설계한다.
  • 복잡하고 개방형 탐색 환경에서 학습 안정성과 정책 일반화 능력을 향상시키기 위해 그래프 기반 탐색 방법(GBE)을 개발한다.
  • 제거 분석과 성능 비교를 통해 FAO 데이터셋의 유일성과 품질을 검증한다.
  • 그래프 기반 추론을 통한 임의의 학습과 강화 학습의 융합이 SOON 및 R2R에서 뛰어난 성능을 낼 수 있음을 보여준다.

제안 방법

  • GBE는 에이전트의 탐색 상태를 동적 그래프로 모델링하며, 노드는 시각적 및 언어적 관측을 나타내고, 간선은 공간적 및 의미적 관계를 표현한다.
  • 다양한 이산 동작을 하나의 단계 결정으로 통합하는 그래프 행동 공간을 사용하여 예측 복잡도를 감소시키고 학습 안정성을 향상시킨다.
  • 하나의 하위 최적 경로를 활용하여 타깃 학습 안정성 향상과 과적합 방지를 위해 임의의 학습과 강화 학습을 통합한다.
  • 에이전트가 탐색을 진행함에 따라 그래프가 점진적으로 갱신되어 다양한 환경에서 장기 기억과 맥락 기반 추론이 가능해진다.
  • 모델은 변화하는 그래프 구조를 기반으로 특징을 집계하고 탐색 동작을 예측하기 위해 그래프 신경망(GNN)을 활용한다.
  • 특징 표현 학습을 향상시켜 미지의 환경에서의 일반화 능력을 향상시키기 위해 새로운 보조 과제를 도입한다.
Figure 1 : An example of the navigation process in SOON. An agent receives a complex natural language instruction consisting of multiple kinds of descriptions (left-hand side). During the agent navigates among different rooms, it searches a larger-scale area first, then gradually narrows down the se
Figure 1 : An example of the navigation process in SOON. An agent receives a complex natural language instruction consisting of multiple kinds of descriptions (left-hand side). During the agent navigates among different rooms, it searches a larger-scale area first, then gradually narrows down the se

실험 결과

연구 질문

  • RQ1자연어 장면 기술만으로 3D 환경의 임의의 위치에서 출발하는 탐색 에이전트가 강력하고 일반화 가능한 성능을 달성할 수 있는가?
  • RQ2환경를 그래프 기반으로 모델링할 경우 개방형 탐색 과제에서 학습 안정성과 정책 일반화 능력이 어떻게 향상되는가?
  • RQ3시각과 언어 모odalities는 SOON 과제 해결에 얼마나 기여하는가? 지시어의 세분성은 성능에 어떤 영향을 미치는가?
  • RQ4그래프 기반 탐색을 통한 임의의 학습과 강화 학습의 융합은 각각의 방법보다 더 뛰어난 성능을 낼 수 있는가?
  • RQ5제안된 FAO 벤치마크는 현실성, 모호성, 일반화 능력 측면에서 기존 벤치마크와 비교해 어떻게 다른가?

주요 결과

  • 제안된 GBE 방법은 R2R 벤치마크에서 SOTA 모델 대비 5.4% 향상된 SPL 성능을 달성하여 뛰어난 일반화 능력과 강건성을 입증하였다.
  • FAO 벤치마크에서 GBE 모델은 비그래프 기반 변종 대비 오라클 성공률 0.7% 향상, 성공률 0.5% 향상, SPL 1.5% 향상, SFPL 0.6% 향상하여 우수한 성능을 보였다.
  • 인간의 성능은 모든 모델을 크게 앞서며, 새로운 과제의 난이도와 인간-기계 간 격차의 크기를 시사한다.
  • 제거 분석 결과, 시각과 언어 모달리티 모두 필수적이며, SOON 환경에서는 시각 정보가 언어 정보보다 더 유용한 것으로 확인되었다.
  • 물체 이름, 특성, 관계, 영역 기술을 포함한 전체 지시어 세분성으로 학습된 모델이 입력이 제한된 모델보다 성능이 뛰어나며, 재작성된 지시어로 학습된 모델가 가장 높은 성능을 보였다.
  • 물체 이름만 포함된 ObjectGoal 베이스라인으로 학습된 모델는 더 rich한 장면 기술을 포함한 모델보다 성능이 열 劣하므로, 물체의 모호성과 맥락의 부재가 탐색에 악영향을 준다는 점을 확인하였다.
Figure 2 : An example of annotating instructions in 6 steps.
Figure 2 : An example of annotating instructions in 6 steps.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.