Skip to main content
QUICK REVIEW

[論文レビュー] Peripheral Vision Transformer

Juhong Min, Yucheng Zhao|arXiv (Cornell University)|Jun 14, 2022
CCD and CMOS Imaging SensorsEngineering被引用数 18
ひとこと要約

本稿では、視線からの距離に基づいてトーラス型の領域にわたる注目をモデル化することで、新しいマルチヘッド周辺注目(MPA)メカニズムを介して周辺の誘導的バイアスを統合するビジョントランスフォーマー、PerViTを提案する。これにより、人間の周辺視力に類似した階層的な視覚認識を学習可能となる。複数のモデルサイズにおいてImageNet-1KでSOTAの精度を達成し、DeiTベースライン比で最大4.2%のトップ1精度向上を達成した。

ABSTRACT

Human vision possesses a special type of visual processing systems called peripheral vision. Partitioning the entire visual field into multiple contour regions based on the distance to the center of our gaze, the peripheral vision provides us the ability to perceive various visual features at different regions. In this work, we take a biologically inspired approach and explore to model peripheral vision in deep neural networks for visual recognition. We propose to incorporate peripheral position encoding to the multi-head self-attention layers to let the network learn to partition the visual field into diverse peripheral regions given training data. We evaluate the proposed network, dubbed PerViT, on ImageNet-1K and systematically investigate the inner workings of the model for machine perception, showing that the network learns to perceive visual data similarly to the way that human vision does. The performance improvements in image classification over the baselines across different model sizes demonstrate the efficacy of the proposed method.

研究の動機と目的

  • 人間の視覚と機械の視覚のギャップを埋めるために、深層ニューラルネットワークに生物学的周辺視覚の原則を組み込むこと。
  • 標準的な自己注意機構が空間階層をモデル化する際の限界を克服し、視線中心からの距離に基づく領域特化型の注目を導入すること。
  • 人間の視覚系が行うように、トランスフォーマーが微細な局所特徴と粗いグローバルコンテキストを同時に学習できるようにすることで、視覚認識性能を向上させること。
  • 明示的な教師信号を必要とせずに、提案されたメカニズムが人間の視覚処理に類似した注目パターンを生成することを検証すること。
  • 異なるモデルサイズおよび下流タスクにおいて、周辺の誘導的バイアスが有効に機能することを示すこと。

提案手法

  • 画像の中心からの距離に基づいて位置埋め込みを割り当てる周辺位置エンコーディング(Φp)を導入し、トーラス型の注目領域をモデル化する。
  • クエリとキーが、3×3の局所受容野を持つ学習可能なプロジェクションヘッドを介して周辺領域にマッピングされるマルチヘッド周辺注目(MPA)層を提案する。
  • 訓練の安定化と注目計算における空間的一致性を確保するため、正規化座標([-1,1])を用いる。
  • マルチスケール特徴を捉えるために、チャンネル次元と注目ヘッド数が段階的に増加する4段階のハイブリッドアーキテクチャを採用する。
  • 周辺プロジェクションヘッドの次元は4×N_hであり、周辺表現における局所空間的コンテキストを捉えるために近傍サイズK=3を用いる。
  • データオーグメンテーション、ラベルスムージング、mixupを含むDeiTのトレーニングレシピに従い、AdamW最適化法とコサインスケジューリングを用いる。

実験結果

リサーチクエスチョン

  • RQ1自己注意層に周辺の誘導的バイアスを統合することで、ビジョントランスフォーマーにおける視覚認識性能が向上するか?
  • RQ2提案されたPerViTモデルの注目マップは、中心領域が微細な詳細に注目し、周辺領域がグローバルコンテキストに注目するという階層的パターンを示すか?
  • RQ3標準的な学習可能な位置埋め込みと比較して、提案された周辺位置エンコーディングは精度と効率の面で優れているか?
  • RQ4CIFAR-100やiNaturalist-19のような転移学習タスクにおいて、モデルは良好に一般化するか?
  • RQ5アーキテクチャの大幅な見直しが不要な状態で、周辺注目メカニズムが異なるモデルサイズで有効に機能するか?

主な発見

  • PerViTはDeiTベースライン比でImageNet-1Kで最大4.2%のトップ1精度向上を達成し、特にTinyモデルで最大の向上が見られた。
  • 周辺位置エンコーディング(Φp)は、モデル全体の0.6%未満のサイズにとどまるが、全モデルサイズで1.4%〜4.2%の精度向上をもたらし、顕著な寄与を示した。
  • モデルは優れた一般化性能を示し、CIFAR-100およびiNaturalist-19ではDeiT-Bを約1%p上回り、CIFAR-10では同等の性能を達成した。
  • 注目マップの定性的分析から、初期層では微細な詳細を捉えるために中心領域に注目が向かっており、深層に進むにつれて周辺領域にグローバルに注目が向かうという、人間の視覚処理を模倣するパターンが観察された。
  • メカニズムは効率的で、周辺エンコーディングによる追加計算コストは最小限(PerViT-Mで0.31Mパラメータ)であり、FLOPsも低く維持された。
  • ランダムオーグメンテーションやmixupを含むさまざまなトレーニングレシピおよびデータオーグメンテーションに対して、モデルの性能は安定しており、強力な一般化能力を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。