Skip to main content
QUICK REVIEW

[論文レビュー] Matching Representations of Explainable Artificial Intelligence and Eye Gaze for Human-Machine Interaction

Tiffany Hwu, Mia Levy|arXiv (Cornell University)|Jan 30, 2021
Visual Attention and Saliency Detection参考文献 17被引用数 9
ひとこと要約

本稿では、ドライブ状況における人間の視線と説明可能なAI(XAI)のレイヤーごとの関連性プロパゲーション(LRP)を統合することで、非言語的ヒューマンマシン通信を可能にする。実験により、タスクの特異性が高まるにつれて、ドライブ予測ニューラルネットワークのLRPヒートマップが人間の視線とより高い類似性を示すことが明らかになった。これは、明示的なオブジェクトラベルなしに、共有の注意表現が形成されることを示している。

ABSTRACT

Rapid non-verbal communication of task-based stimuli is a challenge in human-machine teaming, particularly in closed-loop interactions such as driving. To achieve this, we must understand the representations of information for both the human and machine, and determine a basis for bridging these representations. Techniques of explainable artificial intelligence (XAI) such as layer-wise relevance propagation (LRP) provide visual heatmap explanations for high-dimensional machine learning techniques such as deep neural networks. On the side of human cognition, visual attention is driven by the bottom-up and top-down processing of sensory input related to the current task. Since both XAI and human cognition should focus on task-related stimuli, there may be overlaps between their representations of visual attention, potentially providing a means of nonverbal communication between the human and machine. In this work, we examine the correlations between LRP heatmap explanations of a neural network trained to predict driving behavior and eye gaze heatmaps of human drivers. The analysis is used to determine the feasibility of using such a technique for enhancing driving performance. We find that LRP heatmaps show increasing levels of similarity with eye gaze according to the task specificity of the neural network. We then propose how these findings may assist humans by visually directing attention towards relevant areas. To our knowledge, our work provides the first known analysis of LRP and eye gaze for driving tasks.

研究の動機と目的

  • 説明可能なAI(XAI)表現、特にLRPヒートマップが、ドライブ中の人間の視覚的注意とどの程度一致するかを調査すること。
  • LRPが明示的なオブジェクト検出やセグメンテーションなしに、タスク関連の視覚的刺激を特定できるかどうかを特定すること。
  • LRPベースの視覚的プロンプトが、ヒューマンマシン連携システムにおける人間の注意を誘導できるかどうかの可能性を検討すること。
  • LRPと視線が、適応型ドライバー支援システムにおける補完的信号としての可能性を評価すること。

提案手法

  • ドライブ行動予測のための動画フレームからなるDR(eye)VEデータセットを用いて、VGG16ベースの深層ニューラルネットワークを訓練した。
  • 各フレームに対してレイヤーごとの関連性プロパゲーション(LRP)を適用し、予測に最も寄与する画像領域を強調したサリエンシー・ヒートマップを生成した。
  • 眼鏡型眼動追跡装置を用いて、自然なドライブタスクを実施するドライバーの眼動追跡データを収集した。
  • ドライバーの眼動追跡データから視線ヒートマップを算出し、空間的および統計的にLRPヒートマップと比較した。
  • ドライブ特化型のLRPモデルが強調する特徴と、ImageNetで事前学習されたモデルが強調しない特徴を特定するため、差分分析を実施した。
  • タスク特異的および一般視覚的サリエンシーの両方を対象に、相関係数を用いた類似度評価を実施した。

実験結果

リサーチクエスチョン

  • RQ1ドライブ状況下における実世界の運転行動において、ドライブ予測用ニューラルネットワークのLRPヒートマップと人間の視線との間には、どの程度の相関が認められるか?
  • RQ2ニューラルネットワークの訓練におけるタスク特異性が、LRPサリエンシーと人間の視覚的注意の一致度にどのように影響を与えるか?
  • RQ3明示的なオブジェクトアノテーションなしに、LRPがタスク関連の視覚的特徴(例:レーンマーク、交通標識)を特定できるか?
  • RQ4差分分析により、汎用的ImageNetモデルとタスク特化型ドライブモデルとの間で、サリエンシーのパターンにどのような差が生じるか?

主な発見

  • ドライブ特化型ニューラルネットワークのLRPヒートマップは、一般向けImageNetモデルのそれよりも、人間の視線と顕著に高い空間的相関を示した。
  • タスク特異性が高まるにつれて、LRPと視線の類似度が向上した。これは、明示的なオブジェクトレベルの監視なしに、LRPがタスク関連の特徴を捉えていることを示している。
  • 差分分析により、ドライブ特化型LRPモデルが、ImageNetモデルが強調しないレーンマーク、境界線、道路特徴を強調していることが判明した。これは、タスク関連の刺激が、自発的に発見されている可能性を示唆している。
  • LRPヒートマップは、トレーニングデータに明示的にラベル付けされていなくても、ストップサイン、信号機、歩行者といった顕著な道路要因を適切に強調した。
  • 本手法は、不要な視覚的刺激をフィルタリングする可能性を示し、ドライバー支援システムにおける、侵襲的でない注意誘導型の視覚的プロンプト設計を支援した。
  • 結果から、特にドライブのような安全が重要な分野において、LRPが閉ループ型ヒューマンマシンインタラクションにおける人間の注意の代理として機能できる可能性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。