Skip to main content
QUICK REVIEW

[논문 리뷰] Textual Explanations for Self-Driving Vehicles

Jinkyu Kim, Anna Rohrbach|arXiv (Cornell University)|2018. 07. 30.
Explainable Artificial Intelligence (XAI)참고 문헌 22인용 수 13
한 줄 요약

이 논문은 자율주행 차량의 결정에 대해 시각적 주의를 제어기의 주의 맵과 연계시켜 기반화되고 내省적인 텍스트 설명을 생성하는 엔드 투 엔드 해석 가능한 주행 프레임워크를 제안한다. 이 방법은 제어 정확도를 향상시키고 인간이 이해할 수 있는 설명을 생성하며, 약한 주의 정렬(WAA) 버전이 인간 평가에서 베이스라인을 능가하여 설명 품질 정확도 93.5%를 달성한다.

ABSTRACT

Deep neural perception and control networks have become key components of self-driving vehicles. User acceptance is likely to benefit from easy-to-interpret textual explanations which allow end-users to understand what triggered a particular behavior. Explanations may be triggered by the neural controller, namely introspective explanations, or informed by the neural controller's output, namely rationalizations. We propose a new approach to introspective explanations which consists of two parts. First, we use a visual (spatial) attention model to train a convolutional network end-to-end from images to the vehicle control commands, i.e., acceleration and change of course. The controller's attention identifies image regions that potentially influence the network's output. Second, we use an attention-based video-to-text model to produce textual explanations of model actions. The attention maps of controller and explanation model are aligned so that explanations are grounded in the parts of the scene that mattered to the controller. We explore two approaches to attention alignment, strong- and weak-alignment. Finally, we explore a version of our model that generates rationalizations, and compare with introspective explanations on the same video segments. We evaluate these models on a novel driving dataset with ground-truth human explanations, the Berkeley DeepDrive eXplanation (BDD-X) dataset. Code is available at https://github.com/JinkyuKimUCB/explainable-deep-driving.

연구 동기 및 목표

  • 자율주행 차량의 사용자 신뢰도와 투명도를 향상시키기 위해 제어 결정에 대한 이해할 수 있고 자연어로 된 설명을 생성하는 것.
  • 후행적 합리화의 한계를 해결하기 위해 제어기의 내부 주의에 기반한 내성적인 설명을 개발하는 것.
  • 차량 제어 명령어 예측과 인간이 이해할 수 있는 텍스트 근거를 동시에 예측하는 통합된 엔드 투 엔드 프레임워크를 만드는 것.
  • 신규로 수집된 인간에 의해 주석이 달린 설명이 포함된 데이터셋(BDD-X)과 인간 선호도 연구를 통해 모델 성능을 평가하는 것.
  • 제어기의 주의 맵과 설명 생성 간의 주의 정렬 기술(강한 정렬 및 약한 정렬)을 탐색하는 것.

제안 방법

  • 원시 영상에서 차량 제어 명령어(가속도 및 조향)를 예측하기 위해 공간 주의를 갖춘 컨volution 신경망을 엔드 투 엔드로 훈련한다.
  • 별도의 비디오-텍스트 모델이 동일한 시각적 특징과 제어기의 주의 맵에 조건화되어 자연어 설명을 생성한다.
  • 강한 정렬(SAA)과 약한 정렬(WAA)이라는 두 가지 주의 정렬 전략을 도입하며, 이는 설명 모델이 제어기 관련 영역에 집중하도록 제약을 둔다.
  • WAA 방법은 주의 정렬과 설명 품질 간의 균형을 맞추기 위해 가속도 λₐ와 λc를 갖는 학습 가능한 주의 게이트를 사용한다.
  • 제어 예측, 설명 생성, 주의 정렬 목표를 통합한 다중 과제 손실을 사용하여 모델을 훈련한다.
  • 모델 훈련 및 평가를 위해 인간에 의해 주석이 달린 설명이 포함된 새로운 주행 데이터셋인 BDD-X를 수집하였다.

실험 결과

연구 질문

  • RQ1제어기의 내부 주의에 기반한 내성적인 텍스트 설명은 자율주행 시스템에서 사용자 신뢰도와 해석 가능성 향상에 기여하는가?
  • RQ2제어기와 설명 모델 간의 주의 정렬은 생성된 설명의 품질과 타당성에 어떤 영향을 미치는가?
  • RQ3인과적 주의 필터링을 통합하면 설명의 명확성이 향상되고 부적절한 주의 영역이 감소하는가?
  • RQ4인간이 주석을 달은 설명과 모델이 생성한 설명은 정확도와 구체성 측면에서 어떻게 비교되는가?
  • RQ5모델은 다양한 주행 행동(예: 정지, 전환, 가속)에 대해 다양하고 맥락에 적합한 설명을 생성할 수 있는가?

주요 결과

  • 약한 주의 정렬(WAA) 모델은 인간 평가에서 가장 높은 점수를 기록했으며, 설명 품질 정확도 93.5%를 달성하여 합리화 및 SAA 베이스라인을 모두 능가했다.
  • WAA 모델은 행동 기술 기술의 정확도를 66.0%로 확보하여 인간 주석 기반 행동과의 정렬이 향상됨을 보여주었다.
  • 인간 선호도 연구 결과, WAA가 생성한 설명은 SAA 모델의 설명보다 더 타당하고 구체적으로 평가되었다.
  • 모델은 빨간 신호등, 정지 표지판, 교통 정체 등 일반적인 주행 행동에 대해 다양하고 적절한 설명을 성공적으로 생성했다.
  • 주의 정렬 통합으로 설명의 기반화가 주목할 만한 시각적 영역에 잘 맞춰져, 부적절하거나 반사적일 수 있는 신호에 대한 의존도가 감소했다.
  • BDD-X 데이터셋은 인간 주석 기반 참조값을 사용하여 설명 가능한 주행 모델의 효과적인 훈련과 자동 평가를 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.