Skip to main content
QUICK REVIEW

[論文レビュー] Revitalizing CNN Attentions via Transformers in Self-Supervised Visual Representation Learning

Chongjian Ge, Youwei Liang|arXiv (Cornell University)|Oct 11, 2021
Domain Adaptation and Few-Shot Learning参考文献 46被引用数 6
ひとこと要約

本論文では、自己教師あり視覚表現学習におけるCNNの注目メカニズムを活性化するため、並列に動作するトランスフォーマー・スティームによってCNNエンコーダーの学習をガイドする新しいフレームワークCAREを提案する。トランスフォーマーから抽出された視覚的注目度を用いてCNN特徴量を教師する手法により、下流タスクにおける計算コストの増加を最小限に抑えつつ、画像分類、物体検出、セマンティックセグメンテーションのベンチマークで最先端の性能を達成した。

ABSTRACT

Studies on self-supervised visual representation learning (SSL) improve encoder backbones to discriminate training samples without labels. While CNN encoders via SSL achieve comparable recognition performance to those via supervised learning, their network attention is under-explored for further improvement. Motivated by the transformers that explore visual attention effectively in recognition scenarios, we propose a CNN Attention REvitalization (CARE) framework to train attentive CNN encoders guided by transformers in SSL. The proposed CARE framework consists of a CNN stream (C-stream) and a transformer stream (T-stream), where each stream contains two branches. C-stream follows an existing SSL framework with two CNN encoders, two projectors, and a predictor. T-stream contains two transformers, two projectors, and a predictor. T-stream connects to CNN encoders and is in parallel to the remaining C-Stream. During training, we perform SSL in both streams simultaneously and use the T-stream output to supervise C-stream. The features from CNN encoders are modulated in T-stream for visual attention enhancement and become suitable for the SSL scenario. We use these modulated features to supervise C-stream for learning attentive CNN encoders. To this end, we revitalize CNN attention by using transformers as guidance. Experiments on several standard visual recognition benchmarks, including image classification, object detection, and semantic segmentation, show that the proposed CARE framework improves CNN encoder backbones to the state-of-the-art performance.

研究の動機と目的

  • 自己教師あり視覚表現学習におけるCNNエンコーダー内での未利用の視覚的注目度の活用を促進すること。
  • コアなSSLフレームワークを変更せずに、ビジョントランスフォーマーの注目メカニズムを活用してCNNエンコーダーの性能を向上させること。
  • トランスフォーマーと同等の注目特徴を学習できる訓練パラダイムを構築すること。同時に推論コストは低く保つこと。
  • トランスフォーマーによる注目度の教師付き学習が、下流の視覚認識タスクにおけるCNN特徴の質を向上させることを検証すること。

提案手法

  • CAREは二重スティームアーキテクチャを採用する:CNNスティーム(Cスティーム)と並列に動作するトランスフォーマー・スティーム(Tスティーム)で、両者ともエンコーダー、プロジェクター、予測器を備えた対照的SSLパイプラインに従う。
  • TスティームはCNNエンコーダーの出力を入力とし、マルチヘッド自己注意機構を適用して強化された注目特徴表現を生成する。
  • Tスティームの出力を、注目度に配慮した特徴量に対する対照的損失を用いてCスティームを教師する。これにより、CNNが同様の注目特徴を学習するよう促される。
  • ハイパーパrameter λ を用いた、元のSSL対照的損失と注目度教師損失の重み付き組み合わせを用いて、両スティームを同時に最適化する。
  • Tスティームでは、学習可能な相対的位置エンコーディングを用いることで、固定された正弦波エンコーディングや位置エンコーディングなしの手法を上回る性能を達成した。
  • フレームワークは並列学習設計を採用しており、両スティームを同時に更新することで、CNNエンコーダーへの効果的な注目度ガイドが保証される。

実験結果

リサーチクエスチョン

  • RQ1ビジョントランスフォーマーが学習した視覚的注目度は、自己教師あり学習におけるCNNエンコーダー特徴の向上に効果的に転送可能か?
  • RQ2CNNの学習を、並列に動作するトランスフォーマー・スティームで教師することで、標準的なSSL学習のみに比べて優れた特徴表現が得られるか?
  • RQ3位置エンコーディングの選択とトランスフォーマー・ブロック数の違いが、教師付きCNNエンコーダーの性能に与える影響は何か?
  • RQ4CAREフレームワークにおいて、対照的SSL損失と注目度教師損失の最適なバランスは何か?

主な発見

  • ResNet-50を用いて100エポックで学習した場合、ImageNetにおけるトップ1精度が72.06%に達し、標準的なSSL手法を上回った。
  • 注目度損失の重みλ = 100が最良の性能を示し、λ = 0(70.52%)と比較して1.54%の向上を達成した。
  • Tスティームに5つのトランスフォーマー・ブロック(n = 5)を用いることで最適な性能が得られ、6ブロックに増やすと損失の不均衡により性能が低下した。
  • Tスティームで学習可能な相対的位置エンコーディングを採用した場合、トップ1精度は72.06%に達し、固定正弦波エンコーディング(66.68%)や位置エンコーディングなし(69.49%)を大きく上回った。
  • Tスティームの並列設計は、逐次学習(72.02% 対 69.32%)を上回り、共同最適化が効果的な注目度ガイドに不可欠であることを示した。
  • 下流タスクにおいて、CAREはResNet-50の性能を、物体検出(COCO AP: 57.2)とセマンティックセグメンテーション(PASCAL VOC mIoU: 38.8)で最先端レベルまで向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。