Skip to main content
QUICK REVIEW

[論文レビュー] Convolutional Xformers for Vision

Pranav Jeevan, Amit sethi|arXiv (Cornell University)|Jan 25, 2022
Advanced Neural Network Applications被引用数 4
ひとこと要約

本稿では、画像分類における最新の精度を維持しつつ、GPUメモリ使用量とデータ要件を削減するためのハイブリッドアーキテクチャである、視覚用の畳み込み型トランスフォーマー(CXV)を提案する。線形自己注意機構(例:Performer や Linear Transformer)を二次的自己注意に置き換えることで計算複雑度を低減し、畳み込みサブレイヤーを組み合わせることで誘導的バイアスを統合することで、クラストークンや位置埋め込みの必要性を排除する。その結果、ViT や ResNet、その他のビジョントランスフォーマーと比較して、低リソース環境下でも優れた性能を発揮する。

ABSTRACT

Vision transformers (ViTs) have found only limited practical use in processing images, in spite of their state-of-the-art accuracy on certain benchmarks. The reason for their limited use include their need for larger training datasets and more computational resources compared to convolutional neural networks (CNNs), owing to the quadratic complexity of their self-attention mechanism. We propose a linear attention-convolution hybrid architecture -- Convolutional X-formers for Vision (CXV) -- to overcome these limitations. We replace the quadratic attention with linear attention mechanisms, such as Performer, Nyströmformer, and Linear Transformer, to reduce its GPU usage. Inductive prior for image data is provided by convolutional sub-layers, thereby eliminating the need for class token and positional embeddings used by the ViTs. We also propose a new training method where we use two different optimizers during different phases of training and show that it improves the top-1 image classification accuracy across different architectures. CXV outperforms other architectures, token mixers (e.g. ConvMixer, FNet and MLP Mixer), transformer models (e.g. ViT, CCT, CvT and hybrid Xformers), and ResNets for image classification in scenarios with limited data and GPU resources (cores, RAM, power).

研究の動機と目的

  • ビジョントランスフォーマー(ViT)の高い計算コストとデータ要件が、強力な精度を示す一方で実用的利用を制限している問題に対処すること。
  • 二次的自己注意を線形自己注意機構に置き換えることで、画像分類におけるGPUメモリ消費量とトレーニングデータ要件を削減すること。
  • 畳み込みからの誘導的バイアスを統合することで、クラストークンや位置埋め込みへの依存を排除すること。
  • 異なるトレーニングフェーズで2種類の最適化手法を用いることで収束性と精度を向上させるトレーニング戦略の開発。
  • 限られたデータとGPUメモリという低リソース制約下でも一般化性能が高く、最新の性能に達するまたはそれを上回るモデルの構築。

提案手法

  • ビジョントランスフォーマー内の二次的自己注意機構を、Performer や Nyströmformer、Linear Transformer などの線形自己注意機構に置き換えることで、計算複雑度を低減する。
  • 各ブロック内に畳み込みサブレイヤーを統合し、画像データに適した誘導的バイアスを提供することで、シーケンスの展開なしに空間的特徴を学習可能にする。
  • 畳み込み操作によって2次元空間的構造をネットワーク全体に保持することで、クラストークンや位置埋め込みを排除する。
  • 事前正規化ではなく、各ブロックごとに1つの層正規化を用いることで、トレーニングの安定性と性能を向上させる。
  • 2段階のトレーニングフェーズで異なる最適化手法を用いる「デュアルオプティマイザー訓練(DualOpT)」を提案し、収束性と精度の向上を図る。
  • 階層的ダウンサンプリングやパッチ化を回避し、すべてのレイヤーで入力解像度と空間的構造を維持する。

実験結果

リサーチクエスチョン

  • RQ1線形自己注意と畳み込みを組み合わせたハイブリッドアーキテクチャは、顕著に少ないGPUメモリ使用量で、最新の画像分類精度を達成できるか?
  • RQ2クラストークンや位置埋め込みを畳み込みによる誘導的バイアスに置き換えることで、低データおよび低GPU環境下でのモデル性能が向上するか?
  • RQ3デュアルオプティマイザー訓練戦略は、ViT や ResNet、トークンミキサーなどの多様なアーキテクチャにおいて、収束速度と最終的な精度を向上させられるか?
  • RQ4データおよびリソース制約下での性能について、CXV は ViT、ResNet、FNet、MLP-Mixer、ConvMixer などの既存モデルと比較してどの程度優れているか?
  • RQ5正規化の配置や自己注意機構の選択といったアーキテクチャ的選択が、モデルの一般化性能および効率性にどの程度影響を与えるか?

主な発見

  • CXV は、低データおよび低GPU環境下で、ResNet-18、ResNet-34、ViT、CCT、CvT およびその他のビジョントランスフォーマーを上回る画像分類性能を発揮する。
  • RandAugment を適用した後、元のデータに対して微調整を施すことで、トップ1精度が最大3パーセンテージポイント向上する。
  • ハイブリッドビジョン線形トランスフォーマー(ViLT)のバリアントは、ViN や ViP などの他のハイブリッド ViX モデルと比較して、GPUメモリ使用量を半分に抑える。
  • DualOpT トレーニングを用いることで、ViT や ResNet、トークンミキサーなど複数のアーキテクチャで収束性と精度が向上した。
  • ConvMixer や WaveMix はトランスフォーマーと同等の性能を発揮するが、GPU使用量が著しく少ないことから、誘導的バイアスが効率性にとって極めて重要であることが示された。
  • CXV は、ResNet よりもパラメータ数とGPUメモリ使用量を桁違いに減らしながら、低リソース環境下でより高い精度を達成している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。