Skip to main content
QUICK REVIEW

[논문 리뷰] Cognitive Accident Prediction in Driving Scenes: A Multimodality Benchmark

Jianwu Fang, Leilei Li|arXiv (Cornell University)|2022. 12. 19.
Sentiment Analysis and Opinion Mining인용 수 10
한 줄 요약

이 논문은 운전사의 주의 집중과 텍스트 기반 설명을 활용하여 주행 영상에서 사고 예측 성능을 향상시키는 시각-언어 다중모달 프레임워크인 인지적 사고 예측(CAP)을 제안한다. 주의 기반 텍스트-시각 이동 융합 및 장면 맥락 전이 기법을 통합함으로써, CAP는 새로운 대규모 벤치마크인 CAP-DATA에서 최신 기술 수준의 성능을 달성하였다. 이 벤치마크는 11,727개의 실제 주행 환경에서 촬영된 사고 영상과 사실-영향-원인-내省에 대한 상세한 주석을 포함하고 있다.

ABSTRACT

Traffic accident prediction in driving videos aims to provide an early warning of the accident occurrence, and supports the decision making of safe driving systems. Previous works usually concentrate on the spatial-temporal correlation of object-level context, while they do not fit the inherent long-tailed data distribution well and are vulnerable to severe environmental change. In this work, we propose a Cognitive Accident Prediction (CAP) method that explicitly leverages human-inspired cognition of text description on the visual observation and the driver attention to facilitate model training. In particular, the text description provides a dense semantic description guidance for the primary context of the traffic scene, while the driver attention provides a traction to focus on the critical region closely correlating with safe driving. CAP is formulated by an attentive text-to-vision shift fusion module, an attentive scene context transfer module, and the driver attention guided accident prediction module. We leverage the attention mechanism in these modules to explore the core semantic cues for accident prediction. In order to train CAP, we extend an existing self-collected DADA-2000 dataset (with annotated driver attention for each frame) with further factual text descriptions for the visual observations before the accidents. Besides, we construct a new large-scale benchmark consisting of 11,727 in-the-wild accident videos with over 2.19 million frames (named as CAP-DATA) together with labeled fact-effect-reason-introspection description and temporal accident frame label. Based on extensive experiments, the superiority of CAP is validated compared with state-of-the-art approaches. The code, CAP-DATA, and all results will be released in \url{https://github.com/JWFanggit/LOTVS-CAP}.

연구 동기 및 목표

  • 기존의 사고 예측 모델이 긴 꼬리 분포 데이터와 환경 변화에 대응하는 데에 한계를 보이고 있는 문제를 해결하기 위해.
  • 사람의 인지 신호인 텍스트 기반 설명과 운전사의 주의 집중을 영상 기반 사고 예측에 통합하여 모델의 강건성과 해석 가능성 향상.
  • 사고의 사실, 영향, 원인, 내성에 대한 상세 주석을 포함한 대규모이고 다양한 범주를 포함하는 벤치마크(CAP-DATA)를 구축하여 고도화된 인지적 사고 예측 연구를 지원하기 위해.
  • 어려운 시각 조건 하에서도 시각-언어 융합 및 주의 메커니즘의 효과를 입증하기 위해.
  • 추론 중 텍스트 모odal이 제거된 경우에도 모델이 뛰어난 성능을 유지함으로써 실제 운영 환경에 대한 강건한 적응 능력을 입증하기 위해.

제안 방법

  • 사고 관련 장면 요소에 주의를 집중시키기 위해 텍스트 기반 설명과 시각적 특징을 정렬하는 주의 기반 텍스트-시각 이동 융합 모듈을 제안한다.
  • 자기 주의 메커니즘을 활용하여 객체 간의 시공간적 의존성을 모델링함으로써 맥락 표현을 향상시키는 주의 기반 장면 맥락 전이 모듈을 도입한다.
  • 사고 발생 이전의 핵심 영역에 집중하기 위해 인간의 시선 지ap을 활용하는 운전사 주의 집중 기반 사고 예측 모듈을 구현한다.
  • 시각, 텍스트, 주의 모달 입력을 융합하기 위해 시각-언어 트랜스포머 기반 아키텍처를 활용하여 다중모달 추론을 수행한다.
  • 대조 학습과 교차 주의 메커니즘을 사용하여 모달 간의 의미적 신호를 정렬함으로써 모델을 종합적으로 훈련한다.
  • 실제 운영 환경을 시뮬레이션하기 위해 텍스트 입력이 없는 테스트 시나리오로 일반화할 수 있도록 도메인 적응 기법을 적용한다.

실험 결과

연구 질문

  • RQ1텍스트 기반 설명과 운전사의 주의 집중을 통합함으로써, 긴 꼬리 분포 및 악조건 환경에서의 사고 예측 모델의 성능과 강건성을 향상시킬 수 있는가?
  • RQ2제안된 주의 기반 텍스트-시각 이동 융합 기법이 의미적 신호를 시각적 특징과 정렬하여 조기 사고 탐지에 얼마나 효과적인가?
  • RQ3인지 신호(텍스트 및 주의)의 포함이 실제 주행 환경에서 모델의 해석 가능성과 일반화 능력을 얼마나 향상시키는가?
  • RQ4텍스트 입력이 없는 상황에서 테스트된 경우, 모델은 새로운 데이터셋에 대해 어떻게 성능을 발휘하는가?
  • RQ5각 모달(시각, 텍스트, 주의)이 최종 예측 성능에 기여하는 상대적 기여도는 어느 정도인가?

주요 결과

  • CAP는 CAP-DATA 벤치마크에서 최신 기술 수준의 성능을 달성하였으며, DRIVE 및 DSTA와 같은 이전 방법들보다 시간-사고 간격(TTA) 지표에서 뚜렷한 승리를 거두었다.
  • 추론 중 텍스트 모달이 제거되어도 모델이 강력한 성능을 유지함으로써, 주의 기반 이동 융합 모듈을 통한 효과적인 도메인 적응 능력이 입증되었다.
  • 텍스트 기반 설명의 추가로 정확도가 향상되었으며, 특히 장기 예측(5초 및 4초)에서 기준 모델 대비 성능 격차가 더욱 커졌다.
  • CCD 데이터셋에서의 교차 데이터셋 평가에서 CAP는 AP 점수 0.997을 기록하여, DRIVE(0.992) 및 XAI-ANT(0.940)를 모두 압도하였다.
  • mTTA 지표는 커브로드와 T자로드에서 장기 예측에서 최고의 성능을 보이며, 복잡한 도로 기하학적 구조에 대한 더 나은 적응 능력을 보여주었다.
  • 연구 결과에 따르면 AP와 mTTA 지표는 한계가 있다. AP는 부정적 샘플 비율에 민감하고, mTTA는 다양한 주행 환경 간의 분류 능력이 떨어진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.