Skip to main content
QUICK REVIEW

[논문 리뷰] Imitation Learning with Human Eye Gaze via Multi-Objective Prediction

Ravi Kumar Thakur, MD-Nazmus Samin Sunbeam|arXiv (Cornell University)|2021. 02. 25.
Gaze Tracking and Assistive Technology인용 수 4
한 줄 요약

이 논문은 시각적 암시 학습에서 샘플 효율성과 일반화 능력을 향상시키기 위해 인간의 행동과 시선을 동시에 예측하는 다목적 딥러닝 프레임워크인 Gaze-Regularized Imitation Learning (GRIL)을 제안한다. GRIL은 실사적인 다로터 항공기 항로 탐색 작업에서 최신 기술들을 능가하며, 예측되지 않은 시나리오로의 일반화와 인간의 시각적 주의 패턴을 정확하게 예측한다.

ABSTRACT

Approaches for teaching learning agents via human demonstrations have been widely studied and successfully applied to multiple domains. However, the majority of imitation learning work utilizes only behavioral information from the demonstrator, i.e. which actions were taken, and ignores other useful information. In particular, eye gaze information can give valuable insight towards where the demonstrator is allocating visual attention, and holds the potential to improve agent performance and generalization. In this work, we propose Gaze Regularized Imitation Learning (GRIL), a novel context-aware, imitation learning architecture that learns concurrently from both human demonstrations and eye gaze to solve tasks where visual attention provides important context. We apply GRIL to a visual navigation task, in which an unmanned quadrotor is trained to search for and navigate to a target vehicle in a photorealistic simulated environment. We show that GRIL outperforms several state-of-the-art gaze-based imitation learning algorithms, simultaneously learns to predict human visual attention, and generalizes to scenarios not present in the training data. Supplemental videos and code can be found at https://sites.google.com/view/gaze-regularized-il/.

연구 동기 및 목표

  • 인간의 시선을 맥락 신호로 통합하여 암시 학습의 샘플 효율성과 일반화 능력을 향상시키기 위해.
  • 인간의 행동과 시선 데이터를 동시에 학습할 수 있는 맥락 인식형, 종단 간 아키텍처를 개발하기 위해.
  • 자율 다로터 항공기 항로 탐색과 같은 복잡한 고차원 제어 작업에서 시선 정규화의 효과를 입증하기 위해.
  • 훈련 중에 볼 수 없었던 새로운 시나리오, 예를 들어 이동하는 목표물이나 새로운 환경으로의 일반화를 가능하게 하기 위해.
  • 기존의 시선 보강 암시 학습 방법들보다 더 단순하고 파라미터 효율적인 대안을 제공하기 위해.

제안 방법

  • GRIL은 공유 인코더와 두 개의 병렬 헤드를 가진 다목적 학습 아키텍처를 사용한다. 하나는 제어 행동을 예측하고, 다른 하나는 시선 좌표를 예측한다.
  • 모델은 인간의 시연 데이터를 사용해 지도 학습 방식으로 훈련되며, 각 타임스텝에서 RGB 이미지, 제어 명령어, 시선 좌표가 포함된다.
  • 행동 예측과 시선 예측에 대한 평균 제곱오차(MSE) 손실을 조합한 다중 작업 손실 함수를 사용하여 공동 최적화를 가능하게 한다.
  • 시선 예측 헤드는 정규화 역할을 하여 정책가가 작업에 관련된 주목적 시각적 특징에 집중하도록 유도한다.
  • 모델은 단일 공유 백본 네트워크를 사용해 시각적 특징을 추출하여 파라미터 수를 줄이고 훈련 효율성을 향상시킨다.
  • 이 방법은 자율 다로터 항공기 항로 탐색을 위한 실사적 AirSim 시뮬레이터에서 평가된다.

실험 결과

연구 질문

  • RQ1복잡한 시각적 제어 작업을 위한 암시 학습에서 인간의 행동과 시선을 동시에 예측하는 것이 샘플 효율성을 향상시킬 수 있는가?
  • RQ2시선 정규화는 이동하는 목표물이나 새로운 환경과 같은 예측되지 않은 시나리오로의 정책 일반화를 어떻게 향상시키는가?
  • RQ3직접 시선 좌표를 예측하는 다목적 아키텍처는 시선 히트맵이나 별도의 시선 네트워크가 필요한 기존 방법보다 성능이 뛰어나지 않는가?
  • RQ4GRIL은 항로 탐색 중 인간과 유사한 시각적 주의 패턴, 예를 들어 목표물 집중 또는 장애물 사카다를 재현할 수 있는가?
  • RQ5시선 예측 손실은 고차원이고 연속적인 제어 환경에서 모델의 강인성과 일반화에 어떤 영향을 미치는가?

주요 결과

  • GRIL은 다로터 항공기 항로 탐색 작업에서 표준 행동 클로닝 및 최신 기술인 AGIL과 CGL보다 뚜렷이 뛰어난 성능을 보였다.
  • GRIL은 새로운 과제, 즉 이동하는 목표물이 포함된 과제로도 효과적으로 일반화되어 훈련 분포를 초월한 강인성을 입증했다.
  • 모델은 인간 시연에서 관찰된 바와 같이 목표물 집중, 사카다, 장애물 집중과 같은 인간의 시각적 주의 패턴을 성공적으로 학습했다.
  • CGL가 시선 히트맵과 KL 발산에 의존하는 데 비해, GRIL은 더 적은 파라미터와 단순한 손실 함수로도 더 뛰어난 성능을 달성했다.
  • 시선 예측 헤드는 효과적인 정규화 요소로 작용하여 과적합과 Rademacher 복잡도를 감소시켜 일반화 능력을 향상시켰다.
  • GRIL의 공동 최적화 프레임워크는 공유 표현 학습을 통해 정책가가 작업에 관련된 시각적 특징에 집중하도록 하여 더 효율적인 학습을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.