Skip to main content
QUICK REVIEW

[논문 리뷰] A Real-time Vision Framework for Pedestrian Behavior Recognition and Intention Prediction at Intersections Using 3D Pose Estimation

Ue-Hwan Kim, Dongho Ka|arXiv (Cornell University)|2020. 09. 23.
Autonomous Vehicle Technology and Safety참고 문헌 41인용 수 4
한 줄 요약

이 논문은 3D 자세 추정을 활용한 실시간 시각 프레임워크를 제안하여 보행자 행동을 인식하고(100.53 FPS), 횡단 의도를 예측한다(35.76 FPS)며, TUD 데이터셋에서는 훈련 없이도 89.3%의 정확도를 달성하고, 자체 데이터셋에서는 91.28%의 정확도를 기록하여 현장 독립적 특징과 강력한 일반화 능력을 통해 새로운 최고 성능를 달성한다.

ABSTRACT

Minimizing traffic accidents between vehicles and pedestrians is one of the primary research goals in intelligent transportation systems. To achieve the goal, pedestrian behavior recognition and prediction of pedestrian's crossing or not-crossing intention play a central role. Contemporary approaches do not guarantee satisfactory performance due to lack of generalization, the requirement of manual data labeling, and high computational complexity. To overcome these limitations, we propose a real-time vision framework for two tasks: pedestrian behavior recognition (100.53 FPS) and intention prediction (35.76 FPS). Our framework obtains satisfying generalization over multiple sites because of the proposed site-independent features. At the center of the feature extraction lies 3D pose estimation. The 3D pose analysis enables robust and accurate recognition of pedestrian behaviors and prediction of intentions over multiple sites. The proposed vision framework realizes 89.3% accuracy in the behavior recognition task on the TUD dataset without any training process and 91.28% accuracy in intention prediction on our dataset achieving new state-of-the-art performance. To contribute to the corresponding research community, we make our source codes public which are available at this https URL

연구 동기 및 목표

  • 기존 방법의 한계, 즉 낮은 일반화 능력, 수동 레이블링 의존, 높은 계산 비용을 해결하기 위해.
  • 도심 교차로에서 보행자 행동을 정확하게 인식하고 횡단 의도를 예측할 수 있는 실시간 시스템을 개발하기 위해.
  • 3D 자세 추정에서 유도된 일반화 가능한 시각적 특징을 설계하여 현장 독립적 성능를 가능하게 하기 위해.
  • 새로운 장소에 대해 광범위한 훈련 데이터나 재학습 없이도 행동 인식 및 의도 예측에서 높은 정확도를 달성하기 위해.

제안 방법

  • 단일 RGB 영상 스트림에서 강력하고 현장 독립적인 시각적 특징을 추출하기 위해 3D 자세 추정을 핵심 구성 요소로 활용한다.
  • 경량 파이프라인을 적용하여 행동 인식에 대해 100.53 FPS, 의도 예측에 대해 35.76 FPS의 실시간 추론 성능를 달성한다.
  • 3D 자세 시퀀스에서 학습된 현장 독립적 특징 표현을 사용하여 다양한 교차로 환경 간의 모델 일반화 능력을 향상시킨다.
  • 3D 자세 특징 위에 분류 헤드를 적용하여 보행자 행동(예: 걷기, 정지)과 횡단 의도를 예측한다.
  • 자체 구축한 데이터셋에서 의도 예측 모델을 훈련하여 도메인 특화 미세조정 없이도 높은 정확도를 달성한다.
  • 소스 코드를 공개하여 복제 가능성과 지능형 교통 시스템 분야의 공동 연구 발전을 지원한다.

실험 결과

연구 질문

  • RQ13D 자세 추정을 활용한 비전 기반 프레임워크가 도심 교차로에서 보행자 행동 인식 및 의도 예측에 실시간 성능를 달성할 수 있는가?
  • RQ2현장 독립적 특징은 재학습 없이도 다양한 교차로 환경 간의 일반화 능력을 얼마나 향상시킬 수 있는가?
  • RQ3기존 방법과 비교해 3D 자세 기반 특징을 사용할 경우 보행자 의도 예측에서 달성할 수 있는 정확도 수준은 무엇인가?
  • RQ4모델을 훈련 없이 기준 데이터셋에서 평가했을 때의 성능는 특징의 강건성에 대해 어떤 시사점을 제공하는가?
  • RQ5최소한의 적응만으로도 다양한 실제 현장 환경에서 높은 성능를 유지할 수 있는가?

주요 결과

  • TUD 데이터셋에서 훈련 없이도 보행자 행동 인식에 89.3%의 정확도를 달성하여 학습된 3D 자세 특징의 강력한 일반화 능력을 입증한다.
  • 자체 구축한 데이터셋에서 의도 예측 정확도는 91.28%에 달하여 새로운 최고 성능를 기록한다.
  • 시스템은 실시간으로 작동하여 행동 인식에 대해 100.53 FPS, 의도 예측에 대해 35.76 FPS로 처리되며, 동적인 교통 환경에의 구현에 적합하다.
  • 3D 자세 추정을 활용함으로써 재학습 없이도 다양한 교차로 현장에서 잘 일반화되는 강력한 특징 추출이 가능하다.
  • 제안된 현장 독립적 특징은 새로운 환경에서 데이터 재수집과 수동 레이블링의 필요성을 크게 감소시킨다.
  • 소스 코드의 공개는 복제 가능성 향상과 비전 기반 보행자 행동 이해 분야의 향후 연구를 가속화한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.