Skip to main content
QUICK REVIEW

[論文レビュー] Vision Transformer with Convolutions Architecture Search

Haichao Zhang, Kuangrong Hao|arXiv (Cornell University)|Mar 20, 2022
CCD and CMOS Imaging Sensors被引用数 5
ひとこと要約

本稿では、特徴抽出を強化するため、畳み込みのインダクティブバイアスをビジョントランスフォーマーモデルに統合した、ビジョントランスフォーマーにおける畳み込みを組み込んだアーキテクチャ探索(VTCAS)を提案する。マルチヘッドアテンションと畳み込み演算を同時に最適化することで、ImageNet-1Kで82.0%のトップ1正解率、COCO2017で50.4%のmAPを達成するハイブリッドバックボーンを発見し、低照度や複雑な視覚タスクにおいて優れたロバストネスを示した。

ABSTRACT

Transformers exhibit great advantages in handling computer vision tasks. They model image classification tasks by utilizing a multi-head attention mechanism to process a series of patches consisting of split images. However, for complex tasks, Transformer in computer vision not only requires inheriting a bit of dynamic attention and global context, but also needs to introduce features concerning noise reduction, shifting, and scaling invariance of objects. Therefore, here we take a step forward to study the structural characteristics of Transformer and convolution and propose an architecture search method-Vision Transformer with Convolutions Architecture Search (VTCAS). The high-performance backbone network searched by VTCAS introduces the desirable features of convolutional neural networks into the Transformer architecture while maintaining the benefits of the multi-head attention mechanism. The searched block-based backbone network can extract feature maps at different scales. These features are compatible with a wider range of visual tasks, such as image classification (32 M parameters, 82.0% Top-1 accuracy on ImageNet-1K) and object detection (50.4% mAP on COCO2017). The proposed topology based on the multi-head attention mechanism and CNN adaptively associates relational features of pixels with multi-scale features of objects. It enhances the robustness of the neural network for object recognition, especially in the low illumination indoor scene.

研究の動機と目的

  • ノイズ、スケーリング、シフトに対して不変性を要する複雑な視覚タスクを処理する際の、純粋なビジョントランスフォーマーの限界を是正すること。
  • 畳み込みニューラルネットワーク(CNN)のインダクティブバイアスをトランスフォーマー構造に統合し、特徴表現を向上させること。
  • アテンションと畳み込み演算を統合的に最適化する、微分可能アーキテクチャ探索フレームワークの開発。
  • 画像分類やオブジェクト検出などの多様な視覚タスクに適合するマルチスケール特徴抽出バックボーンの設計。
  • 特に低照度の屋内環境において、モデルのロバストネスを向上させること。

提案手法

  • ブロックベースの探索パラダイム内で、マルチヘッド自己アテンションとディープワイド分離畳み込みを統合した微分可能アーキテクチャ探索空間を提案する。
  • アテンションと畳み込み演算のバランスを最適化するように学習する、探索コントローラーを導入する。
  • 探索されたブロックが異なる受容 field を持つ特徴を処理するマルチスケール特徴抽出戦略を採用する。
  • 探索中に候補アーキテクチャを効率的に評価するため、ImageNet-1K上でプロキシトレーニング戦略を用いる。
  • 離散的なアーキテクチャ選択を微分可能に緩和することで、エンドツーエンドのバックプロパゲーションを可能にする。
  • トランスフォーマーのグローバルモデリング能力を維持しつつ、CNNからの局所的インダクティブバイアスを組み込んだハイブリッドバックボーンを設計する。

実験結果

リサーチクエスチョン

  • RQ1畳み込みのインダクティブバイアスとマルチヘッドアテンション機構を組み合わせることで、複雑な視覚タスクにおける性能向上が達成できるか?
  • RQ2統一された探索空間内で、アテンションと畳み込み演算を効果的にバランスさせる神経アーキテクチャ探索フレームワークはどのように構築できるか?
  • RQ3低照度やごみだらけの屋内環境において、性能向上をもたらすアーキテクチャ的設計は何か?
  • RQ4探索されたハイブリッドアーキテクチャは、画像分類やオブジェクト検出のような多様な視覚タスクにどの程度一般化できるか?
  • RQ5マルチスケール特徴学習の統合は、ビジョントランスフォーマーにおける表現品質を向上させられるか?

主な発見

  • VTCASが同定したバックボーンは、パラメータ数がたった3200万個で、ImageNet-1Kで82.0%のトップ1正解率を達成し、多くの既存のビジョントランスフォーマーを上回った。
  • COCO2017オブジェクト検出ベンチマークでは、50.4%のmAPを達成し、密度予測タスクへの優れた一般化性能を示した。
  • ハイブリッドアーキテクチャは、低照度の屋内環境でも優れたロバストネスを示し、照明変動に対する不変性が向上した。
  • 畳み込み演算の統合により、スケーリングおよびトランスレーション不変性のための特徴学習が向上したが、グローバルコンテキストモデリングの損なわれることなく実現された。
  • 探索プロセスは、局所的およびグローバルな特徴抽出をバランスさせたブロックベースアーキテクチャを効果的に同定し、多様なタスクにおける性能向上を実現した。
  • 提案手法により、プロキシトレーニング戦略を用いることで、計算コストを低減しつつも高い精度を維持する、効率的なアーキテクチャ探索が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。