Skip to main content
QUICK REVIEW

[논문 리뷰] Do Pedestrians Pay Attention? Eye Contact Detection in the Wild

Younes Belkada, Lorenzo Bertoni|arXiv (Cornell University)|2021. 12. 08.
Gaze Tracking and Assistive Technology인용 수 8
한 줄 요약

이 논문은 실제 자율주행 차량 환경에서 눈맞춤 탐지를 위한 키포인트 기반 딥러닝 모델을 제안하며, 원시 이미지 대신 의미론적 신체 키포인트를 활용하여 일반화 능력을 향상시킨다. 이는 JAAD 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하며, 다양한 환경에서의 실제 적용을 위한 대규모이고 다양한 시나리오를 포함하는 LOOK이라는 새로운 벤치마크를 도입한다.

ABSTRACT

In urban or crowded environments, humans rely on eye contact for fast and efficient communication with nearby people. Autonomous agents also need to detect eye contact to interact with pedestrians and safely navigate around them. In this paper, we focus on eye contact detection in the wild, i.e., real-world scenarios for autonomous vehicles with no control over the environment or the distance of pedestrians. We introduce a model that leverages semantic keypoints to detect eye contact and show that this high-level representation (i) achieves state-of-the-art results on the publicly-available dataset JAAD, and (ii) conveys better generalization properties than leveraging raw images in an end-to-end network. To study domain adaptation, we create LOOK: a large-scale dataset for eye contact detection in the wild, which focuses on diverse and unconstrained scenarios for real-world generalization. The source code and the LOOK dataset are publicly shared towards an open science mission.

연구 동기 및 목표

  • 조명, 거리, 가림 등 다양한 요인으로 인해 성능이 저하되는 비구속적인 실생활 환경에서 눈맞춤을 탐지하는 도전 과제를 해결하기 위해.
  • 원시 이미지 특징 대신 고수준의 의미론적 키포인트를 사용하여 다양한 시나리오 간 모델의 일반화 능력을 향상시키기 위해.
  • 다양한 자율주행 데이터셋을 통합한 대규모이고 다양한 시나리오를 포함하는 눈맞춤 탐지 벤치마크 데이터셋(LOOK)을 구축하기 위해.
  • 실제 적용에 대한 내성적 저항성과 성능을 평가하기 위해 교차 데이터셋 일반화 성능을 분석하기 위해.
  • 키포인트 기반 모델이 도메인 간 일반화 능력과 정확도 측면에서 이미지 기반 기준 모델보다 뛰어나다는 것을 입증하기 위해.

제안 방법

  • 입력 이미지에서 17개의 의미론적 키포인트를 추출하기 위해 표준 포즈 추정 기법(OpenPifPaf)을 사용한다.
  • 이러한 2차원 키포인트 좌표와 신뢰도 점수를 처리하기 위해 경량의 전용 신경망을 활용하여 눈맞춤 분류를 수행한다.
  • 눈맞춤 예측과 함께 키포인트 특징을 정밀하게 보정하는 다중 작업 학습 아키텍처를 설계하여 모델의 강건성을 향상시킨다.
  • 기울기 기반 중요도 분석을 통해 모델의 결정 기준을 해석하고 키포인트의 중요성을 검증한다.
  • KITTI, nuScenes, JRDB 데이터셋 간의 교차 데이터셋 일반화를 기반으로 한 새로운 평가 프로토콜을 도입하여 실제 환경에서의 전이 능력을 평가한다.
  • 세 가지 주요 자율주행 데이터셋에 걸쳐 애너테이션된 LOOK 데이터셋을 공개하며, 다양성과 도메인 이동을 중심으로 구성된다.

실험 결과

연구 질문

  • RQ1실생활의 다양한 변동성 조건에서 원시 이미지 특징 대비 의미론적 키포인트 표현이 눈맞춤 탐지 성능을 향상시킬 수 있는가?
  • RQ2KITTI, nuScenes, JRDB와 같은 다양한 비구속적 데이터셋 간에 키포인트 기반 모델이 얼마나 잘 일반화되는가?
  • RQ3고수준 특징을 사용할 경우 조명, 거리 등의 환경적 노이즈에 대한 민감도가 감소하는가?
  • RQ4특정 키포인트(예: 눈, 귀)가 최종 눈맞춤 예측에 기여하는 정도는 어떠한가?
  • RQ5경량 키포인트 기반 모델이 낮은 추론 지연 시간을 유지하면서도 최신 기술 수준(SOTA) 성능을 달성할 수 있는가?

주요 결과

  • 키포인트 기반 모델은 여러 데이터셋에서 훈련된 결과, JAAD 테스트 세트에서 85.9% AP를 달성하며, 이미지 기반 SOTA 방법(71.0% AP)을 초월한다.
  • 이 모델은 데이터셋 간 일반화 능력이 뛰어나, KITTI, nuScenes, JRDB에서 훈련된 경우 JAAD에서 최고 성능을 기록한다. 반면 이미지 기반 기준 모델은 그렇지 못하다.
  • 카메라에 가까운 경우(작은 바운딩 박스)에도 키포인트 기반 탐지는 이미지 쿠파 기반 방법보다 더 효과적이며, 이는 가까운 거리에서 이미지 쿠파가 더 나을 것이라는 기존 가정을 도전한다.
  • 중요도 분석 결과 눈과 귀가 가장 영향력 있는 키포인트로 확인되었으며, 높은 기울기 크기를 보이며 모델이 관련 특징에 집중하고 있음을 검증한다.
  • 키포인트 특징을 사용할 경우 분류 단계는 1ms 이내로 실행되어 매우 효율적이며, ShuffleNetV2와 같은 경량 백본과 조합하면 더욱 유리하다.
  • LOOK 데이터셋은 세 가지 주요 자율주행 데이터셋에 걸쳐 다양한 실생활 시나리오를 포함하고 있어, 도메인 간 일반화 능력을 철저히 평가할 수 있도록 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.