Skip to main content
QUICK REVIEW

[論文レビュー] CMT: Convolutional Neural Networks Meet Vision Transformers

Jianyuan Guo, Kai Han|arXiv (Cornell University)|Jul 13, 2021
Advanced Neural Network Applications参考文献 65被引用数 57
ひとこと要約

CMT は CNN の幹とトランスフォーマー風ブロックを組み合わせ、ImageNet と COCO で同等の CNN および ViT モデルを上回りつつ FLOPs を低く抑える階層的・マルチスケールのバックボーンを作成する。

ABSTRACT

Vision transformers have been successfully applied to image recognition tasks due to their ability to capture long-range dependencies within an image. However, there are still gaps in both performance and computational cost between transformers and existing convolutional neural networks (CNNs). In this paper, we aim to address this issue and develop a network that can outperform not only the canonical transformers, but also the high-performance convolutional models. We propose a new transformer based hybrid network by taking advantage of transformers to capture long-range dependencies, and of CNNs to model local features. Furthermore, we scale it to obtain a family of models, called CMTs, obtaining much better accuracy and efficiency than previous convolution and transformer based models. In particular, our CMT-S achieves 83.5% top-1 accuracy on ImageNet, while being 14x and 2x smaller on FLOPs than the existing DeiT and EfficientNet, respectively. The proposed CMT-S also generalizes well on CIFAR10 (99.2%), CIFAR100 (91.7%), Flowers (98.7%), and other challenging vision datasets such as COCO (44.3% mAP), with considerably less computational cost.

研究の動機と目的

  • CNN とビジョン・トランスフォーマの間の性能コストのギャップを動機づけ、解消する。
  • CNN を局所特徴抽出に、トランスフォーマを長距離依存に活用するハイブリッドアーキテクチャを提案する。
  • 段階的構造と効率性重視ブロックを備えた CMT モデルの拡張可能なファミリを設計する。

提案手法

  • CMT ブロックの前に微細特徴を抽出する畳み込み茎を導入する。
  • Local Perception Unit (LPU)、Lightweight Multi-head Self-Attention (LMHSA)、Inverted Residual Feed-Forward Network (IRFFN) を備えた CMT ブロックを開発する。
  • 計算量を削減するために深さ方向畳み込みと空間縮小付き軽量アテンションを使用する。
  • 密集タスクに適したマルチスケール特徴マップを生成するために階層的アーキテクチャを適用する。
  • モデル変種を生成するための複合スケーリング戦略を採用する(CMT-Ti、XS、S、B など)。
  • 分類には ViT のクラス・トークンをグローバル平均プーリングに置換する。

実験結果

リサーチクエスチョン

  • RQ1CNN 増強型トランスフォーマー・バックボーンは純粋な CNN および純粋なトランスフォーマー・モデルを ImageNet および COCO で精度と効率の点で凌駕できるか。
  • RQ2局所情報とグローバル情報はハイブリッド CMT ブロック内で表現学習をどのように改善するのか。
  • RQ3階層設計と提案されたスケーリング戦略がパフォーマンスと FLOPs にどのような影響を与えるのか。
  • RQ4CMT バックボーンは物体検出やインスタンスセグメンテーションへ良く転移できるのか。

主な発見

  • CMT-S は ImageNet で 83.5% トップ-1 精度を達成し、4.0B FLOPs、DeiT-S および CPVT を上回りつつ EfficientNet-B4 より少ない計算量を使用している。
  • CMT バリアントは CIFAR-10/100、Flowers、COCO などのデータセットで強力な性能を示し、精度と FLOPs のトレードオフが良好である。
  • 階層的アーキテクチャと LMHSA は、単一スケールの ViT バックボーンと比較して計算量を削減しつつ精度を維持または向上させる。
  • CMT ブロックの畳み込み茎、LPU、IRFFN、ショートカット接続は精度を大幅に向上させる(アブレーションで +0.9% 〜 +1.1%)。
  • COCO では CMT-S が RetinaNet と組み合わせて 44.3% mAP を達成し、同程度の FLOPs で多くの CNN/ViT ベースのバックボーンを上回る。
  • 事前学習を ImageNet で行った場合、CIFAR 及び細粒データセットでのファインチューニング転移学習実験は競争力のある性能を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。