[論文レビュー] Harmonizing the object recognition strategies of deep neural networks with humans
この論文は、深層ニューラルネットワーク(DNN)の精度が向上する一方で、物体認識における人間の視覚戦略との間の整合性の欠如が拡大していることを特定している。DNNの精度向上に伴い、人間の注目領域と特徴統合パターンに一致するように訓練可能なモジュール「ニューラルハーモナイザー」を導入し、人間に類似した戦略への適合性と分類精度の両方を向上させている。特にビジョントランスフォーマーにおいて顕著な効果を示している。
The many successes of deep neural networks (DNNs) over the past decade have largely been driven by computational scale rather than insights from biological intelligence. Here, we explore if these trends have also carried concomitant improvements in explaining the visual strategies humans rely on for object recognition. We do this by comparing two related but distinct properties of visual strategies in humans and DNNs: where they believe important visual features are in images and how they use those features to categorize objects. Across 84 different DNNs trained on ImageNet and three independent datasets measuring the where and the how of human visual strategies for object recognition on those images, we find a systematic trade-off between DNN categorization accuracy and alignment with human visual strategies for object recognition. State-of-the-art DNNs are progressively becoming less aligned with humans as their accuracy improves. We rectify this growing issue with our neural harmonizer: a general-purpose training routine that both aligns DNN and human visual strategies and improves categorization accuracy. Our work represents the first demonstration that the scaling laws that are guiding the design of DNNs today have also produced worse models of human vision. We release our code and data at https://serre-lab.github.io/Harmonization to help the field build more human-like DNNs.
研究の動機と目的
- スケーリング則に従って訓練されたDNNの性能向上トレンドが、物体認識における人間の視覚戦略との整合性を改善しているかどうかを調査すること。
- DNNの精度と人間の注目パターンおよび特徴統合行動との間の体系的トレードオフを同定すること。
- 性能を損なわずにDNNの視覚戦略を人間のものに近づける汎用的な訓練手法を開発すること。
- さまざまなDNNアーキテクチャに適用可能なスケーラブルなソリューションを提供すること——ニューラルハーモナイザーを用いて、人間との整合性とタスク精度の両方を向上させること。
提案手法
- 著者らは、ImageNet画像における人間の注目領域を定義するために、ClickMeおよびClicktionaryデータセットからの人間がアノテートした特徴重要度マップを用いる。
- 人間が視覚的特徴をどのように統合して分類意思決定を下すかを測定するため、新たな心理物理学的データを収集し、人間の視覚戦略の「どのように」を捉える。
- ニューラルハーモナイザーは、分類精度と人間の注目および特徴統合パターンへの整合性の両方を最適化する、微分可能で差し替え可能なモジュールとして導入される。
- ハーモナイザーは二重損失目的関数を用いる:一つはDNNの特徴マップを人間がアノテートした重要度マップに一致させるもの、もう一つは人間と同様の特徴統合行動を維持するもの。
- この手法は、ViT、ResNet、および敵対的耐性を目的としたモデルを含む84種類の多様なDNNに適用されている。
- ニューラルハーモナイザーによる訓練は、エンドツーエンドのバックプロパゲーションにより実施され、あらゆる標準的なDNNアーキテクチャと互換性を持つ。
実験結果
リサーチクエスチョン
- RQ1スケーリング則に従って訓練されたDNNの精度向上は、物体認識における人間の視覚戦略との整合性を向上させるのか?
- RQ2DNNは、物体分類において、人間の注目パターン(どこ)と特徴統合行動(どのように)をどの程度再現しているのか?
- RQ3汎用的な訓練モジュールによって、DNNの精度と人間の視覚戦略への整合性を同時に向上させることができるか?
- RQ4ニューラルハーモナイザーは、インダクティブバイアスが低いモデル、例えばビジョントランスフォーマーにおいて、より大きな改善をもたらすのか?
- RQ5DNNと人間の間の整合性の欠如は、モデル最適化がデータセットバイアスを悪用しているためであり、人間と同様の表現を学習していないためなのか?
主な発見
- DNNの精度と人間の視覚戦略への整合性の間には体系的なトレードオフが存在する:DNNの精度が向上するにつれて、人間の注目パターンおよび特徴統合への整合性は低下する。
- このトレードオフは、ClickMe、Clicktionary、および著者ら自身の心理物理学実験の3つの独立したデータセットで一貫して観察された。
- ニューラルハーモナイザーは、人間の視覚戦略への整合性を顕著に向上させた——調和化されたDNNは、比較されたすべてのDNNよりも整合性指標で優れている。
- 調和化されたビジョントランスフォーマー(ViT)は、整合性向上において最大の改善を示し、この手法がインダクティブバイアスが低いモデルに対して特に効果的であることを示唆している。
- ニューラルハーモナイザーは、整合性の向上に加え、DNNの性能向上にも寄与しており、調和化されたモデルは、調和化されていない対照群よりも高い精度を達成している。
- 調和化されたViTは、未調和化モデルよりも視覚的特徴の統合をより効率的に行い、人間と同様の統合パターンに近づいている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。