Skip to main content
QUICK REVIEW

[논문 리뷰] Pedestrian Intention Prediction: A Multi-task Perspective

Smail Ait Bouhsain, Saeed Saadatnejad|arXiv (Cornell University)|2020. 10. 20.
Autonomous Vehicle Technology and Safety참고 문헌 28인용 수 5
한 줄 요약

이 논문은 자동차 카메라 시각 시퀀스에서 보행자 의도와 경계 상자 상태(위치, 너비, 높이)를 동시에 예측하기 위해 순환 신경망을 사용하는 다중 작업 학습 접근법을 제안한다. 의도 및 시각적 상태 헤드 간에 특징을 공유함으로써, 의도 예측에서 최신 기술 수준의 성능을 달성하고, 경계 상자 예측에서도 경쟁력 있는 결과를 얻었으며, 이전 방법보다 두 배 이상 빠른 추론 속도를 확보하였다.

ABSTRACT

In order to be globally deployed, autonomous cars must guarantee the safety of pedestrians. This is the reason why forecasting pedestrians' intentions sufficiently in advance is one of the most critical and challenging tasks for autonomous vehicles. This work tries to solve this problem by jointly predicting the intention and visual states of pedestrians. In terms of visual states, whereas previous work focused on x-y coordinates, we will also predict the size and indeed the whole bounding box of the pedestrian. The method is a recurrent neural network in a multi-task learning approach. It has one head that predicts the intention of the pedestrian for each one of its future position and another one predicting the visual states of the pedestrian. Experiments on the JAAD dataset show the superiority of the performance of our method compared to previous works for intention prediction. Also, although its simple architecture (more than 2 times faster), the performance of the bounding box prediction is comparable to the ones yielded by much more complex architectures. Our code is available online.

연구 동기 및 목표

  • 자율주행 차량의 안전성을 향상시키기 위해 보행자 의도를 조기에 정확하게 예측할 수 있도록 하는 것.
  • 이전 연구가 궤도 또는 의도 예측을 별개로 다루는 데서 비롯된 한계를 해결하는 것.
  • 의도 예측과 함께 경계 상자(x, y, w, h)를 함께 모델링하여 공유된 표현을 활용함으로써 시각적 상태 예측을 향상시키는 것.
  • 기존 방법보다 훨씬 빠른 추론 속도를 확보하면서도 높은 정확도를 달성하는 경량 아키텍처를 구현하는 것.
  • 공유된 특징 학습을 통한 다중 작업 학습의 이점이 의도 및 시각적 상태 예측 향상에 기여하는지를 검증하는 것.

제안 방법

  • 보행자 의도(횡단 여부 대비 비횡단) 예측용과 경계 상자 예측용(x, y, w, h)으로 나누어진 두 개의 별도 출력 헤드를 가진 단일 순환 신경망(RNN)을 사용한다.
  • 학습 중에 의도 및 경계 상자 예측 손실의 가중 합을 역전파하여 다중 작업 학습을 구현한다.
  • 차량에 장착된 카메라 시각에서 얻은 보행자 경계 상자 시퀀스를 처리하여 운동 역학과 공간적 맥락을 포착한다.
  • 각 미래 시간 단계에서 의도를 예측함으로써 단일 스텝 분류가 아닌 장기 예측이 가능한 장기 예측 가능성을 확보한다.
  • 경계 상자 예측을 중심 좌표 및 치수에 대한 회귀 문제로 간주하고, 평가에 IOU 기반 지표(AIOU, FIOU)를 사용한다.
  • 정확도와 추론 속도를 동시에 최적화하여, 최신 기술 수준의 기준보다 파rameter 수가 적고 추론 속도가 더 빠른 모델을 도출한다.

실험 결과

연구 질문

  • RQ1의도 및 전체 경계 상자 상태를 동시에 예측하는 것이 단일 작업 접근법에 비해 예측 정확도를 향상시키는가?
  • RQ2공유된 표현을 활용한 다중 작업 학습이 의도 및 시각적 상태 예측 성능을 향상시키는가?
  • RQ3보다 단순하고 빠른 아키텍처가 복잡한 모델에 비해 보행자 상태 예측에서 경쟁력 있거나 더 뛰어난 성능을 낼 수 있는가?
  • RQ4특히 장기 예측에서 관측 및 예측 수평이 다양할 경우 모델의 성능은 어떻게 되는가?
  • RQ5경계 상자의 속도 및 운동 역학을 모델링함으로써 의도 예측 성능 향상에 어느 정도 기여하는가?

주요 결과

  • 제안된 다중 작업 모델은 JAAD 데이터셋에서 최신 기술 수준의 성능를 달성하여 이전 방법들보다 보행자 의도 예측에서 뛰어난 성능를 보였다.
  • 단기 예측(0.3초 입력, 0.6초 출력)에서 ADE는 10.22 픽셀, AIOU는 73.2%를 기록하여 경계 상자 예측의 높은 정확도를 입증하였다.
  • 1920×1080 해상도에서 ADE가 9 픽셀로 감소하여 1% 미만의 오차를 나타내어 중심 위치 예측 정확도가 뛰어나다는 것을 보여주었다.
  • 단기 시퀀스에서 FIOU 점수가 62.8%를 기록하여 중심 좌표 및 치수 예측의 정밀도가 매우 우수하다는 것을 확인하였다.
  • 단순한 아키텍처임에도 불구하고 이전 방법보다 두 배 이상 빠른 속도로 실행되면서도 성능 유지를 또는 향상시켰다.
  • 제거 실험 결과, 다중 작업 학습이 유용한 표현을 공유함으로써 특히 움직이는 차량과 정지한 보행자를 포함한 복잡한 상황에서 두 헤드 모두 성능 향상을 이룬다는 것이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.