Skip to main content
QUICK REVIEW

[논문 리뷰] The RobotSlang Benchmark: Dialog-guided Robot Localization and Navigation

Shurjo Banerjee, Jesse Thomason|arXiv (Cornell University)|2020. 10. 23.
Speech and dialogue systems인용 수 8
한 줄 요약

이 논문은 자연어를 사용한 물리적 로봇의 위치 지정과 주행을 다루는 169개의 인간-인간 대화 세션으로 구성된 Benchmark인 RobotSlang를 소개한다. 본 연구는 두 가지 과제인 대화 기록에서의 위치 지정(LDH)과 대화 기록에서의 주행(NDH)을 제안하며, 실제 세계의 대화와 시각 데이터로 훈련된 시퀀스-투-시퀀스 모델이 물리적 로봇을 성공적으로 안내할 수 있음을 입증한다. 이는 기존의 기준 모델들을 능가하며, 학생 강제 학습(teacher forcing) 기반으로도 안정성을 확보한다.

ABSTRACT

Autonomous robot systems for applications from search and rescue to assistive guidance should be able to engage in natural language dialog with people. To study such cooperative communication, we introduce Robot Simultaneous Localization and Mapping with Natural Language (RobotSlang), a benchmark of 169 natural language dialogs between a human Driver controlling a robot and a human Commander providing guidance towards navigation goals. In each trial, the pair first cooperates to localize the robot on a global map visible to the Commander, then the Driver follows Commander instructions to move the robot to a sequence of target objects. We introduce a Localization from Dialog History (LDH) and a Navigation from Dialog History (NDH) task where a learned agent is given dialog and visual observations from the robot platform as input and must localize in the global map or navigate towards the next target object, respectively. RobotSlang is comprised of nearly 5k utterances and over 1k minutes of robot camera and control streams. We present an initial model for the NDH task, and show that an agent trained in simulation can follow the RobotSlang dialog-based navigation instructions for controlling a physical robot platform. Code and data are available at https://umrobotslang.github.io/.

연구 동기 및 목표

  • 시뮬레이션 기반의 시각-언어 주행 벤치마크와 실제 로봇 배포 간 격차를 해소하기 위해 물리적 인간-로봇 상호작용에 기반한 데이터셋을 구축하기 위해.
  • 실제 환경에서 인간이 자연어를 통해 협동적으로 로봇의 위치를 파악하고 주행을 안내하는 방식을 연구하기 위해.
  • 물리적 로봇 플랫폼에서 수집한 실제 센서 및 대화 데이터를 활용해 대화 지도 주행을 위한 학습 기반 모델을 개발하고 평가하기 위해.
  • 물리적 시험에서 수집한 인간 생성 대화 데이터를 활용해 샘플 효율적이고 안정적인 실제 로봇 제어 훈련을 가능하게 하기 위해.
  • 시뮬레이션에서 실제 세계 배포로의 전이 학습을 지원하는 벤치마크를 제공하여 고비용의 실제 세계 데이터 수집에 대한 의존도를 줄이기 위해.

제안 방법

  • 한 명의 참가자(드라이버)가 라즈베리 파이와 HD 웹캠을 장착한 물리적 로봇을 제어하고, 다른 참가자(명령자)가 웹 기반 채팅 인터페이스를 통해 주행 지시를 제공하는 169개의 인간-인간 대화 세션을 수집한다.
  • 원시 대화, 로봇 카메라 스트림, 제어 명령어, 전역 지ap을 동기화하고 주석을 붙여 약 5,000개의 발화와 1,000분이 넘는 센서 데이터를 포함한 다중 모odal 데이터셋을 구축한다.
  • 두 가지 벤치마크 과제를 정의한다: 대화 기록에서의 위치 지정(LDH), 여기서는 대화와 시각 입력을 바탕으로 로봇을 전역 지도상에서 위치 파악해야 한다. 그리고 대화 기록에서의 주행(NDH), 여기서는 대화 기록을 바탕으로 목표 물체로 주행해야 한다.
  • 실제 시각 관측값(RGB 카메라 피드)과 대화 기록을 입력으로 사용하여 NDH 과제를 위한 시퀀스-투-시퀀스 모델을 훈련하며, 정답 주행 경로를 supervision으로 활용한다.
  • 추론 시의 안정성을 향상시키기 위해 학습 중에 학생 강제 학습(teacher forcing)을 적용하고, 주로 Topological Distance(TD)를 성능 평가 지표로 사용한다.
  • 시각 또는 언어 모달리티를 제거하여 단모달 성능을 평가하고, 잠재적인 모달리티 편향을 규명하기 위해 분석 실험을 수행한다.

실험 결과

연구 질문

  • RQ1실제 물리적 로봇 플랫폼의 대화 기록과 시각 관측값만을 사용하여 학습된 에이전트가 전역 지도상에서 로봇의 위치를 정확하게 지정할 수 있는가?
  • RQ2인간이 생성한 대화와 실제 세계 센서 데이터로 훈련된 모델이 자연어 지시를 통해 실제 물리적 로봇을 목표 물체로 주행시킬 수 있는가?
  • RQ3시각과 언어 모달리티를 모두 포함했을 때, 단일 모달리티 기반의 기준 모델 대비 대화 지도 주행 성능에 어떤 영향을 미치는가?
  • RQ4학생 강제 학습을 통해 훈련한 경우, 교사 강제 학습 대비 일반화 능력과 실제 주행 과제에서의 안정성 향상이 이루어지는가?
  • RQ5시뮬레이션 데이터로 훈련된 모델가 실제 인간-로봇 대화 데이터로 미세 조정된 후, 실제 세계 로봇 제어에 얼마나 잘 일반화되는가?

주요 결과

  • NDH 모델은 무작위 동작 및 즉각 멈춤 기준 모델을 능가하며, 학생 강제 학습 조건에서 평균 Topological Distance(TD)가 3.27 ± 1.21 미터를 기록하여 무작위 기준 모델(4.31 ± 1.28 미터)보다 유의미하게 높은 성능을 보였다.
  • 시각과 언어 입력을 모두 포함한 전체 모델은 단모달리티 분석 결과보다 유의미하게 높은 성능을 보였으며, 특히 시각+언어 대비 시각 전용 비교에서 p-value < 0.05를 기록하여 두 모달리티가 상호 보완적으로 작용함을 시사했다.
  • 학습 중에 학생 강제 학습을 적용한 결과, 추론 시 성능이 더 안정적이었으며, 전체 모델은 학생 강제 학습 조건에서 TD 3.27 ± 1.28 미터를 기록했고, 교사 강제 학습 조건에서는 3.42 ± 1.06 미터를 기록했다.
  • 시각 전용 모델의 성능은 전체 모델과 유의미하게 떨어지지 않았으며, 이는 시각 정보 자체가 주행에 중요한 단서를 제공함을 시사한다. 다만 언어 정보는 해석의 모호함을 제거하는 데 핵심적이다.
  • 시각과 언어 입력을 모두 접근 가능한 모델은 단일 모달리티 모델보다 통계적으로 유의미하게 높은 성능을 보였으며, 시각+언어 조합에서는 TD 3.68 ± 1.28 미터, 언어 전용은 3.76 ± 1.61 미터, 시각 전용은 3.67 ± 1.56 미터를 기록했다.
  • 오라클 정지 기준 모델(가장 우수한 중간 경로 점을 선택하는 모델)은 TD 3.16 ± 1.50 미터를 기록하여, 모델의 성능가 여전히 이론적 최적 경로보다 낮다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.