Skip to main content
QUICK REVIEW

[論文レビュー] SoT: Delving Deeper into Classification Head for Transformer

Jiangtao Xie, Ruiren Zeng|arXiv (Cornell University)|Apr 22, 2021
Multimodal Machine Learning Applications被引用数 11
ひとこと要約

本論文は、特徴量の分類トークンとハイレベルな語トークンを、特異値パワー正規化を施したマルチヘッドグローバルクロス・コバリアンスプーリングを用いて同時に活用する、新しいTransformerベースのモデルSoTを提案する。この手法は、グローバルな文脈とローカルな特徴の区別能の両方から得られる補完的情報を活用することで、画像認識および自然言語処理の両タスクで顕著な性能向上を達成し、ImageNet、ImageNet-A、CoLA、RTEベンチマークで最先端の結果を記録した。

ABSTRACT

Transformer models are not only successful in natural language processing (NLP) but also demonstrate high potential in computer vision (CV). Despite great advance, most of works only focus on improvement of architectures but pay little attention to the classification head. For years transformer models base exclusively on classification token to construct the final classifier, without explicitly harnessing high-level word tokens. In this paper, we propose a novel transformer model called second-order transformer (SoT), exploiting simultaneously the classification token and word tokens for the classifier. Specifically, we empirically disclose that high-level word tokens contain rich information, which per se are very competent with the classifier and moreover, are complementary to the classification token. To effectively harness such rich information, we propose multi-headed global cross-covariance pooling with singular value power normalization, which shares similar philosophy and thus is compatible with the transformer block, better than commonly used pooling methods. Then, we study comprehensively how to explicitly combine word tokens with classification token for building the final classification head. For CV tasks, our SoT significantly improves state-of-the-art vision transformers on challenging benchmarks including ImageNet and ImageNet-A. For NLP tasks, through fine-tuning based on pretrained language transformers including GPT and BERT, our SoT greatly boosts the performance on widely used tasks such as CoLA and RTE. Code will be available at https://peihuali.org/SoT

研究の動機と目的

  • Transformerモデルが分類トークンにのみ依存するという限界を是正し、ハイレベルな語トークンに内蔵された豊富で補完的な情報を活用すること。
  • 語トークン単体が強力な分類器として機能可能かどうか、また、分類トークンと効果的に統合する方法を調査すること。
  • 語トークンから二階のクロス・コバリアンス表現を効果的に捉える新規な、Transformerアーキテクチャと互換性を持つプーリング機構を設計すること。
  • 分類トークンと語トークン表現を明示的に統合する複数のイ早融合戦略を構築・評価し、分類性能の向上を図ること。

提案手法

  • すべての語トークンを対象とした二階のクロス・コバリアンス表現を学習するマルチヘッドグローバルクロス・コバリアンスプーリング(MGCrP)を提案。これにより、豊富なハイレベルな意味的情報を捉える。
  • MGCrPによって生成される非対称行列に特化した新しい正規化手法、特異値パワー正規化(svPN)を導入。これにより、安定的かつ効果的な表現学習が可能になる。
  • 分類トークンとMGCrP処理済み語トークン表現を明示的に統合する3つのイ早融合方式(連結、和、要素ごとの乗算)を設計。
  • 完全な正規化の統計的性質を保持しつつ、計算効率を維持するため、svPNの高速近似アルゴリズムを採用。
  • シンプルさと効率性を考慮し、単一ヘッドのMGCrPを採用。表現サイズは微調整時に事前に定義された集合(例:4K, 6K)から選択。
  • 微調整段階でMGCrP層にドロップアウトを適用し、過学習を防ぎ、一般化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1ハイレベルな語トークン単体が、Transformerにおける標準的な分類トークンを上回るか、あるいは補完的に機能できるか。
  • RQ2Transformerアーキテクチャとの互換性を損なわずに、語トークンからの二階のクロス・コバリアンス表現を効果的かつ効率的に集約する方法は何か。
  • RQ3深層学習の文脈において、クロス・コバリアンスプーリングによって生成される非対称行列に適した正規化戦略は何か。
  • RQ4分類トークンと語トークン表現を統合する際、異なるイ早融合戦略(例:和、連結)の性能はどのように比較されるか。
  • RQ5提案されたSoTモデルは、標準的なTransformer分類器と比較して、多様なビジョンおよび言語ベンチマークでどの程度性能が向上するか。

主な発見

  • ImageNetでは、SoTはDeiT-Tinyを6.4%(78.6%)向上、T2T-14を2.8%(74.5%)向上させ、単一分類トークンベースラインを上回った。
  • ImageNet-Aでは、ClassTベースラインに対して10.2%の向上(17.5%)を達成し、前回のSoT最先端性能(27.1%)を3.2%上回った。
  • 自然言語処理分野では、CoLAにおいてBERT-baseの性能を3.2%(58.0% vs. 54.8%)向上、RTEでは2.1%(69.3% vs. 67.2%)の向上を記録した。
  • 分類トークンと語トークンの組み合わせ(ClassT+WordT)は、個々のコンponentsを上回り、強い補完性を示した。
  • Grad-CAMおよび注意マップの可視化により、ClassTがグローバルな文脈に注目する一方、WordTがローカルな区別能の高い領域に注目しており、その統合により両方の側面を効果的に捉えていることが確認された。
  • svPN正規化を施したMGCrPは、グローバル平均プーリングやグローバルコバリアンスプーリングよりも優れた性能を発揮し、特に複雑なハイレベル表現の捉え方において顕著な優位性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。