Skip to main content
QUICK REVIEW

[논문 리뷰] Matching Representations of Explainable Artificial Intelligence and Eye Gaze for Human-Machine Interaction

Tiffany Hwu, Mia Levy|arXiv (Cornell University)|2021. 01. 30.
Visual Attention and Saliency Detection참고 문헌 17인용 수 9
한 줄 요약

이 논문은 운전 환경에서 설명 가능한 인공지능(XAI)을 레이어별 기여도 분석(LRP)을 통해 인간의 눈동자 움직임과 정렬함으로써 비언어적 인간-기계 상호작용을 가능하게 한다. 실험 결과, 과제 특이성이 높아질수록 주행 예측 신경망의 LRP 히트맵이 인간의 눈동자 움직임과 점점 더 유사해지며, 명시적 객체 레이블링 없이도 공통된 주의력 표현을 드러낸다.

ABSTRACT

Rapid non-verbal communication of task-based stimuli is a challenge in human-machine teaming, particularly in closed-loop interactions such as driving. To achieve this, we must understand the representations of information for both the human and machine, and determine a basis for bridging these representations. Techniques of explainable artificial intelligence (XAI) such as layer-wise relevance propagation (LRP) provide visual heatmap explanations for high-dimensional machine learning techniques such as deep neural networks. On the side of human cognition, visual attention is driven by the bottom-up and top-down processing of sensory input related to the current task. Since both XAI and human cognition should focus on task-related stimuli, there may be overlaps between their representations of visual attention, potentially providing a means of nonverbal communication between the human and machine. In this work, we examine the correlations between LRP heatmap explanations of a neural network trained to predict driving behavior and eye gaze heatmaps of human drivers. The analysis is used to determine the feasibility of using such a technique for enhancing driving performance. We find that LRP heatmaps show increasing levels of similarity with eye gaze according to the task specificity of the neural network. We then propose how these findings may assist humans by visually directing attention towards relevant areas. To our knowledge, our work provides the first known analysis of LRP and eye gaze for driving tasks.

연구 동기 및 목표

  • 설명 가능한 인공지능(XAI) 표현, 특히 LRP 히트맵이 운전 중 인간의 시각적 주의와 얼마나 일치하는지 조사하기 위해.
  • 명시적 객체 검출 또는 세분화 없이도 LRP가 과제 관련 시각적 자극을 식별할 수 있는지 판단하기 위해.
  • LRP 기반 시각적 프롬프트를 활용해 인간-기계 협업 시스템에서 인간의 주의를 이끌 수 있는지 가능성 탐색하기 위해.
  • LRP와 눈동자 움직임을 조합하여 적응형 운전자 보조 시스템의 잠재력을 평가하기 위해.

제안 방법

  • 비디오 프레임에서 주행 행동을 예측하기 위해 DR(eye)VE 데이터셋을 기반으로 VGG16 기반의 깊은 신경망을 훈련시켰다.
  • 각 프레임에 대해 레이어별 기여도 분석(LRP)을 적용하여 예측에 기여도가 가장 높은 이미지 영역을 강조하는 중요도 히트맵을 생성했다.
  • 눈동자 추적 안경을 사용하여 자연주의적인 운전 과제를 수행하는 운전자로부터 눈동자 추적 데이터를 수집했다.
  • 운전자 눈동자 추적 데이터에서 눈동자 히트맵을 생성하고, 이를 LRP 히트맵과 공간적·통계적으로 비교했다.
  • 주행 전용 LRP 모델이 강조하는 특징과 ImageNet 미사전 훈련 모델이 강조하지 않는 특징을 분리하기 위해 감산 분석을 수행했다.
  • 과제 특이성 대비 일반 시각적 주목성과의 유사도를 평가하기 위해 상관관계 지표를 사용하여 LRP와 눈동자 히트맵 간의 유사도를 평가했다.

실험 결과

연구 질문

  • RQ1실생활 운전 중 주행 예측 신경망의 LRP 히트맵이 인간의 눈동자 움직임과 어느 정도 상관관계를 가지는가?
  • RQ2신경망 훈련 시 과제 특이성이 LRP 중요도와 인간의 시각적 주의 간 정렬에 어떤 영향을 미치는가?
  • RQ3명시적 객체 레이블링 없이도 LRP가 차선 표시, 교통 표지 등 과제 관련 시각적 특징을 식별할 수 있는가?
  • RQ4감산 분석을 통해 일반 목적의 ImageNet 모델과 과제 특화된 주행 모델 간의 중요도 패턴 차이점은 무엇인가?

주요 결과

  • 주행 전용 신경망에서 생성된 LRP 히트맵은 일반 ImageNet 모델의 결과보다 인간의 눈동자 움직임과 유의미하게 더 높은 공간적 상관관계를 보였다.
  • 과제 특이성이 높아질수록 LRP 중요도와 인간의 시각적 주의 간 일치도가 증가하여, 명시적 객체 수준의 감독 없이도 LRP가 과제 관련 특징을 포착함을 시사한다.
  • 감산 분석을 통해 주행 전용 LRP 모델이 ImageNet 모델이 강조하지 않는 차선 표시, 경계선, 도로 특징을 강조함을 확인하여, 과제 관련 자극의 잠재적 탐지가 가능함을 보여주었다.
  • LRP 히트맵은 훈련 데이터에 명시적으로 레이블링되지 않은 정지 신호등, 신호등, 보행자 등 주목할 만한 도로 요소를 성공적으로 강조하였다.
  • 이 방법은 관련이 없는 시각적 자극을 걸러내는 데 잠재력을 보이며, 운전자 보조 시스템에서 간섭이 적은 주의 유도 시각 프롬프트 설계에 기여할 수 있다.
  • 결과적으로 LRP는 안전이 중요한 분야인 주행과 같은 환경에서 인간-기계 상호작용의 피드백 루프에서 인간의 주의를 대체로 사용할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.