Skip to main content
QUICK REVIEW

[論文レビュー] Human Attention in Fine-grained Classification

Yao Rong, Wenjia Xu|arXiv (Cornell University)|Nov 2, 2021
Retinal Imaging and Analysis参考文献 54被引用数 14
ひとこと要約

本稿では、Gaze Augmentation Training (GAT) とKnowledge Fusion Network (KFN) を導入することで、人間の注視データを深層学習モデルに統合し、細分類画像分類に応用する手法を提案する。新たに作成した注視アノテーション付きデータセットCUB-GHAと、CXR-Eyeからの医用画像データを用いて、人間の注視が分類精度を最大で4.38%向上させることを示した。人間の注視が判別的な特徴を明らかにし、モデル性能と解釈可能性を向上させることを実証した。

ABSTRACT

The way humans attend to, process and classify a given image has the potential to vastly benefit the performance of deep learning models. Exploiting where humans are focusing can rectify models when they are deviating from essential features for correct decisions. To validate that human attention contains valuable information for decision-making processes such as fine-grained classification, we compare human attention and model explanations in discovering important features. Towards this goal, we collect human gaze data for the fine-grained classification dataset CUB and build a dataset named CUB-GHA (Gaze-based Human Attention). Furthermore, we propose the Gaze Augmentation Training (GAT) and Knowledge Fusion Network (KFN) to integrate human gaze knowledge into classification models. We implement our proposals in CUB-GHA and the recently released medical dataset CXR-Eye of chest X-ray images, which includes gaze data collected from a radiologist. Our result reveals that integrating human attention knowledge benefits classification effectively, e.g. improving the baseline by 4.38% on CXR. Hence, our work provides not only valuable insights into understanding human attention in fine-grained classification, but also contributes to future research in integrating human gaze with computer vision tasks. CUB-GHA and code are available at https://github.com/yaorong0921/CUB-GHA.

研究の動機と目的

  • 人間の注視が細分類に不可欠な判別的特徴に集中しているかどうかを調査すること。
  • 人間の注視データが画像分類タスクにおける深層学習モデルの性能向上に寄与するかどうかを検証すること。
  • ニューラルネットワークの学習および推論に、人間の注視知識を効果的に統合する手法を開発すること。
  • 細分類視覚認識を目的とした、注視アノテーションを付加した新しいベンチマークデータセットCUB-GHAを構築すること。
  • 医療診断など高リスク分野において、人間の注視がモデルの信頼性と人間の意思決定ととの整合性を向上させることの実用的価値を示すこと。

提案手法

  • CUBの細分類データセット上で人間の注視データを収集し、注視点から得られるサリエンシーマップを用いてCUB-GHAデータセットを構築する。
  • Gaze Augmentation Training (GAT) を提案。注視に基づく注視マップを用いて、人間の注視領域を強調するように学習データを拡張する。
  • Knowledge Fusion Network (KFN) を導入。推論時に画像特徴と注視由来の注視特徴を融合する二重ブランチアーキテクチャ。
  • Grad-CAM を用いて、KFNの画像ブランチと注視ブランチの注視マップを可視化・比較し、人間の注視と整合するようにする。
  • CUB-GHAおよびCXR-Eyeデータセットの両方で、公平な評価のための5分割交差検証を実施し、堅牢な性能比較を確保する。
  • 注視点に対してガウスフィルタを適用してサリエンシーマップを生成することで、注視データをモデル統合用の注視ヒートマップに変換する。

実験結果

リサーチクエスチョン

  • RQ1細分類画像分類を実行する際、人間は判別的特徴に集中しているか?
  • RQ2人間の注視データは、細分類タスクにおける深層学習モデルの性能向上に寄与できるか?
  • RQ3注視データの統合は、モデルの解釈可能性および人間の意思決定ととの整合性にどのように影響するか?
  • RQ4鳥の種別や胸部レントゲン画像といった異なる分野において、注視統合による性能向上は一貫しているか?
  • RQ5データ収集設定が異なる状況下で、注視知識の統合は、データ拡張か特徴融合のどちらがより効果的か?

主な発見

  • 細分類分類において、人間の注視は常に判別的でタスクに不可欠な領域(例:鳥の嘴、翼の模様)に集中しており、人間の注視が本質的特徴を的確に捉えていることが確認された。
  • Knowledge Fusion Network (KFN) は、CXR-Eyeデータセットにおいてベースライン比で3.45%の精度向上を達成し、特に広範な注視パターンを効果的に活用できるため、この設定ではGATを上回った。
  • GATとKFNを組み合わせた統合モデルは、EfficientNet-b5ベースラインに対してCXR-Eyeで4.38%の精度向上を達成し、75.35%の精度に到達した。
  • CUB-GHAデータセットでは、KFNがGATよりも性能向上を示しており、注視固定点が複数の領域に散らばる状況では、特徴統合がデータ拡張よりも効果的であることが示された。
  • KFNから得られるモデルの解釈は、ベースラインモデルと比較して人間の注視マップとより一致しており、医療診断分野におけるモデルの信頼性と解釈可能性が向上した。
  • CUB-GHAデータセットは、人間とAIの協働を要するタスクに向けた今後の研究にとって貴重なリソースを提供している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。