Skip to main content
QUICK REVIEW

[論文レビュー] Do humans and Convolutional Neural Networks attend to similar areas during scene classification: Effects of task and image type

Romy Müller, Marcel Dürschmidt|arXiv (Cornell University)|Jul 25, 2023
Face Recognition and PerceptionNeuroscience参考文献 70被引用数 3
ひとこと要約

本研究は、タスクの種別と画像コンテンツに応じて、シーン分類における人間と畳み込みニューラルネットワーク(CNN)の注目度がどのように変化するかを調査する。物体、屋内シーン、風景の画像に対して、眼動-trackingと手動選択を用い、人間のタスク意図性がCNNとの注目度類似度に顕著に影響することを明らかにした。特に物体では、手動選択がCNNと最も一致するが、風景ではあらゆるタスクにおいて類似度が低く保たれる。

ABSTRACT

Deep Learning models like Convolutional Neural Networks (CNN) are powerful image classifiers, but what factors determine whether they attend to similar image areas as humans do? While previous studies have focused on technological factors, little is known about the role of factors that affect human attention. In the present study, we investigated how the tasks used to elicit human attention maps interact with image characteristics in modulating the similarity between humans and CNN. We varied the intentionality of human tasks, ranging from spontaneous gaze during categorization over intentional gaze-pointing up to manual area selection. Moreover, we varied the type of image to be categorized, using either singular, salient objects, indoor scenes consisting of object arrangements, or landscapes without distinct objects defining the category. The human attention maps generated in this way were compared to the CNN attention maps revealed by explainable artificial intelligence (Grad-CAM). The influence of human tasks strongly depended on image type: For objects, human manual selection produced maps that were most similar to CNN, while the specific eye movement task has little impact. For indoor scenes, spontaneous gaze produced the least similarity, while for landscapes, similarity was equally low across all human tasks. To better understand these results, we also compared the different human attention maps to each other. Our results highlight the importance of taking human factors into account when comparing the attention of humans and CNN.

研究の動機と目的

  • 異なる人間の注目タスク(自発的視線、視線指向、手動選択)が、CNNとの注目マップ類似度に与える影響を検討すること。
  • 画像タイプ(物体、屋内シーン、風景)が、人間とCNNの注目度一致度に与える影響を調査すること。
  • タスクの意図性と画像コンテンツが、人間とモデルの注目度メカニズムの類似度をどのように統合的に規定するかを評価すること。
  • 異なるタスクにおける人間の注目マップを比較し、人間の視覚的注目におけるタスク固有のバイアスを理解すること。
  • シーン分類の過程で、人間とCNNの注目度が最も類似する条件を実証的に明らかにすること。

提案手法

  • 画像分類タスク中に、自発的視線、意図的視線指向、手動領域選択という3つの異なるタスクを用いて、人間の注目マップを収集した。
  • 同じ画像分類タスクに対して、事前学習済みCNNのGrad-CAMを用いて説明可能な注目マップを生成した。
  • 異なる画像タイプにおいて、人間とCNNの注目マップを類似度指標(例:相関係数やオーバーラップ率)を用いて比較した。
  • 画像コンテンツを系統的に変化させた:顕著な単一物体、物体配置のある屋内シーン、物体のない風景。
  • 多次元比較を通じて、タスクタイプと画像タイプが注目度類似度に与える影響を分析した。
  • タスク間での人間同士の注目マップの一貫性を評価し、タスクの信頼性とバイアスを検証した。

実験結果

リサーチクエスチョン

  • RQ1人間の注目タスクの種別(自発的視線、視線指向、手動選択)が、人間とCNNの注目マップ類似度にどのように影響するか?
  • RQ2画像タイプ(物体、屋内シーン、風景)が、人間とCNNの注目度一致度にどのように影響するか?
  • RQ3異なる画像タイプとタスクモダリティにおいて、人間-CNN注目度類似度に一貫したパターンが存在するか?
  • RQ4異なるタスク間での人間の注目マップはどのように比較されるか? これにより注目度一致研究にどのような示唆が得られるか?
  • RQ5シーン分類タスクにおいて、人間の視覚的注目度がCNNの注目度と最も類似する条件は何か?

主な発見

  • 単一で顕著な物体を有する画像では、手動領域選択がCNNのGrad-CAMマップと最も類似する注目マップを生成し、タスク特有の一致が示された。
  • 屋内シーンでは、自発的視線がCNN注目度と最も類似度が低く、自然な視線パターンが複雑なシーンにおいてモデルの注目度と乖離していることを示唆した。
  • 明確な物体のない風景では、あらゆる人間タスクにおいて類似度が低く保たれ、物体欠如がタスクタイプにかかわらず一致度を低下させることを示した。
  • 人間タスクの意図性は強く、画像タイプに依存する効果を示した:物体および屋内シーンのカテゴリでのみ、類似度に顕著な影響を及ぼした。
  • 人間の注目マップはタスクによって顕著に異なり、手動選択が関連領域を的確に標的とし、最も高い一貫性と特異性を示した。
  • 結果は、タスク設計と画像コンテンツといった人間要因が、人間とCNNの注目度一致度を決定づける上で極めて重要であることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。