[논문 리뷰] Towards explainable artificial intelligence (XAI) for early anticipation of traffic accidents
이 논문은 드래그카메라 영상 데이터를 사용하여 교통 사고를 평균 4.57초 전에 예측하는 Gated Recurrent Unit (GRU) 기반의 설명 가능한 인공지능 모델을 제안한다. 이 모델은 예측을 설명하기 위해 Grad-CAM을 활용하여 시각적 주목 지도를 생성한다. 모델은 평균 정밀도 94.02%를 달성하며, 사고 관련 영역을 식별하는 데 있어 인간 운전자를 능가한다.
Traffic accident anticipation is a vital function of Automated Driving Systems (ADSs) for providing a safety-guaranteed driving experience. An accident anticipation model aims to predict accidents promptly and accurately before they occur. Existing Artificial Intelligence (AI) models of accident anticipation lack a human-interpretable explanation of their decision-making. Although these models perform well, they remain a black-box to the ADS users, thus difficult to get their trust. To this end, this paper presents a Gated Recurrent Unit (GRU) network that learns spatio-temporal relational features for the early anticipation of traffic accidents from dashcam video data. A post-hoc attention mechanism named Grad-CAM is integrated into the network to generate saliency maps as the visual explanation of the accident anticipation decision. An eye tracker captures human eye fixation points for generating human attention maps. The explainability of network-generated saliency maps is evaluated in comparison to human attention maps. Qualitative and quantitative results on a public crash dataset confirm that the proposed explainable network can anticipate an accident on average 4.57 seconds before it occurs, with 94.02% average precision. In further, various post-hoc attention-based XAI methods are evaluated and compared. It confirms that the Grad-CAM chosen by this study can generate high-quality, human-interpretable saliency maps (with 1.23 Normalized Scanpath Saliency) for explaining the crash anticipation decision. Importantly, results confirm that the proposed AI model, with a human-inspired design, can outperform humans in the accident anticipation.
연구 동기 및 목표
- 자율주행 시스템에 대한 신뢰를 향상시키기 위해 사고 조기 예측을 위한 설명 가능한 인공지능 모델을 개발하는 것.
- Grad-CAM을 통한 사후 설명 기법을 통합하여 사고 예측 결정에 대한 인간이 이해할 수 있는 주목 지도를 생성하는 것.
- 모델이 생성한 설명과 인간의 눈동자 추적 데이터를 비교하여 XAI가 생성한 주목 지도의 품질을 평가하는 것.
- 인간이 드래그카메라 영상에서 사고 관련 시각적 단서를 식별하는 데 비해 AI가 더 뛰어난 성능을 보이는지 확인하는 것.
- 교통 사고 예측과 같은 고위험 기술적 응용 분야에서 딥러닝 모델의 신뢰성과 해석 가능성에 대한 평가를 수행하는 것.
제안 방법
- 시퀀스적 드래그카메라 프레임 간의 시공간적 관계를 학습하기 위해 Gated Recurrent Unit (GRU) 네트워크를 사용한다.
- 최근 다수의 프레임에서 추출한 은닉 표현을 통합하여 시간적 맥락 동역학을 모델링함으로써 사고 예측 성능을 향상시킨다.
- 예측에 영향을 주는 이미지 영역을 강조하기 위해 사후 설명 방법으로 Grad-CAM을 적용한다.
- 모델이 생성한 설명의 비교 평가를 위해 인간의 눈동자 추적 데이터를 수집하여 인간의 주목 지도를 생성한다.
- Grad-CAM 및 XGrad-CAM를 포함한 네 가지 XAI 방법을 평가하고 비교하며, 높은 품질의 인간과 일치하는 주목 지도를 생성하는 능력을 기준으로 한다.
- 모델은 성능을 평가하기 위해 공개된 Crash Classification Dataset (CCD)를 사용하여 훈련 및 평가되며, 평균 사고까지의 시간(mTTA)과 평균 정밀도(AP)를 측정한다.
실험 결과
연구 질문
- RQ1딥러닝 모델은 인간 운전자보다 더 이르고 정확하게 교통 사고를 예측할 수 있는가?
- RQ2XAI 방법이 생성한 사후 주목 지도가 사고 예측 과정에서 인간의 시각적 주목과 얼마나 잘 일치하는가?
- RQ3어느 XAI 방법이 드래그카메라 영상의 사고 예측에 가장 인간이 이해할 수 있고 신뢰할 수 있는 주목 지도를 생성하는가?
- RQ4설명 가능한 인공지능 모델이 사고 관련 시각적 단서를 식별하는 데 있어 인간의 인지 능력을 어느 정도 초월할 수 있는가?
- RQ5사고 예측 모델에 설명 가능성 기능을 통합함으로써 자율주행 시스템의 신뢰성과 신뢰도는 어떻게 향상되는가?
주요 결과
- 제안된 모델은 평균 사고까지의 시간(mTTA)이 4.57초로, 많은 기존 모델보다 훨씬 이르게 사고를 예측한다.
- 모델은 CCD 데이터셋에서 94.02%의 평균 정밀도를 달성하여 조기 사고 예측의 높은 정확도를 입증한다.
- Grad-CAM은 인간의 시선 패턴과 강한 일치를 보이는 표준화된 스캔패스 주목 지도 점수 1.23를 기록한다.
- 평가된 XAI 방법 중에서 Grad-CAM과 XGrad-CAM가 사고 예측 결정에 대해 가장 높은 품질의 해석 가능한 시각적 설명을 생성한다.
- AI 모델은 사고 예측에 관련된 주요 시각적 영역을 인간 운전자보다 더 잘 식별함으로써, 복잡한 환경에서 더 뛰어난 패턴 인식 능력을 보인다.
- Grad-CAM을 통한 설명 가능성 통합은 모델의 투명성을 향상시키며, 안전 중심의 AI 시스템에 대한 사용자 신뢰를 강화한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.