Skip to main content
QUICK REVIEW

[論文レビュー] TokenMixup: Efficient Attention-guided Token-level Data Augmentation for Transformers

Hyeong Kyu Choi, Joonmyung Choi|arXiv (Cornell University)|Oct 14, 2022
Advanced Neural Network Applications被引用数 14
ひとこと要約

TokenMixupは、計算コストの高い勾配ベースのサリエンシー検出の代わりに自己注意マップを用いることで、効率的で注意誘導型のトークンレベルのデータ拡張手法を提案する。これにより、×15の高速化を達成するとともに性能向上を実現する。ScoreNetを用いたカリキュラム学習と、マルチスケール変種であるVertical TokenMixupを導入し、事前学習なしで訓練されたモデルにおいてCIFAR-100で最先端の精度を達成した。

ABSTRACT

Mixup is a commonly adopted data augmentation technique for image classification. Recent advances in mixup methods primarily focus on mixing based on saliency. However, many saliency detectors require intense computation and are especially burdensome for parameter-heavy transformer models. To this end, we propose TokenMixup, an efficient attention-guided token-level data augmentation method that aims to maximize the saliency of a mixed set of tokens. TokenMixup provides x15 faster saliency-aware data augmentation compared to gradient-based methods. Moreover, we introduce a variant of TokenMixup which mixes tokens within a single instance, thereby enabling multi-scale feature augmentation. Experiments show that our methods significantly improve the baseline models' performance on CIFAR and ImageNet-1K, while being more efficient than previous methods. We also reach state-of-the-art performance on CIFAR-100 among from-scratch transformer models. Code is available at https://github.com/mlvlab/TokenMixup.

研究の動機と目的

  • パrameterが多めのVision Transformerにおける、勾配ベースのサリエンシー検出の高い計算コストを軽減すること。
  • 自己注意マップを用いて、効率的で内在的なサリエンシー検出器として、トークンレベルのデータ拡張に活用すること。
  • ScoreNetを介してサンプルの難易度を推定し、難易度に応じて混合を適応的に適用するカリキュラム学習のアプローチを導入すること。
  • 1つのサンプル内でTransformerの各層から抽出したトークンを縦方向に混合することで、マルチスケール特徴の学習を可能にすること。
  • 事前学習なしで訓練されたモデルにおいて、CIFAR-100で最先端の性能を達成するとともに、CIFAR-10およびImageNet-1Kにおける一般化性能を向上させること。

提案手法

  • TokenMixupは、勾配ベースのサリエンシー推定の代わりに、自己注意マップを高速で微分可能なプロキシとして用い、混合に適した重要なトークンを特定する。
  • バッチレベルのサリエンシーを最大化するように最適にペairを割り当てるために、ハンガリアンマッチングを用い、割り当て問題を正確に解く。
  • 軽量なScoreNetモジュールがサンプルの難易度を推定し、適応的混合の適用をガイドすることで、カリキュラム学習戦略を実装する。
  • Vertical TokenMixup (VTM) は、1つの入力から得た異なる層のトークンを組み合わせることで、インラインで混合を実行し、マルチスケール特徴の拡張を可能にする。
  • 入力混合やCutMixなどの他の混合手法と並列で適用可能であり、全体の性能を向上させる。
  • サリエンシーに基づくラベル再割り当ては、混合されたトークンの割合を計算することでソフトラベルを生成し、意味的整合性を保持する。

実験結果

リサーチクエスチョン

  • RQ1自己注意マップは、勾配ベースのサリエンシー検出を置き換えつつ、計算コストを削減するのに効果的か?
  • RQ2ScoreNetを用いたカリキュラム学習は、トレーニング中のトークンレベルの混合の有効性をどのように向上させるか?
  • RQ3Transformerの各層間でインラインで混合することで、マルチスケール特徴表現とモデルの一般化性能が向上するか?
  • RQ4既存の混合手法とTokenMixupを組み合わせた場合、画像分類ベンチマークにどのような影響を与えるか?
  • RQ5注意誘導型のトークン混合は、Manifold Mixupのようなソフト混合手法と比較して、より優れた性能とロバストネスをもたらすか?

主な発見

  • TokenMixupは、勾配ベースの手法と比較してサリエンシー検出を×15高速化し、CIFAR-100での精度も向上させた。
  • 本手法は、事前学習なしで訓練されたVision Transformerにおいて、CIFAR-100でトップ-1精度83.57%という最先端の性能を達成した。
  • TokenMixupを入力混合やCutMixと組み合わせることで、CIFAR-100で83.57%の精度を達成し、元のCCTベースラインから6ポイント以上優れた性能を示した。
  • Vertical TokenMixupは、効果的なマルチスケール特徴の学習を可能にし、他の混合手法と組み合わせた際の性能向上に寄与した。
  • アブレーションスタディの結果、最適な割り当て、サリエンシーに基づくラベル再割り当て、ScoreNetを用いたカリキュラム学習が、性能向上に顕著に寄与することが確認された。
  • Manifold Mixupは中間トークンに適用すると性能が低下する傾向にあり、これは自己注意機構において、ハードなトークン置換(TokenMixupの方式)がより適していることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。