Skip to main content
QUICK REVIEW

[論文レビュー] CaFT: Clustering and Filter on Tokens of Transformer for Weakly Supervised Object Localization

Ming Li|arXiv (Cornell University)|Jan 3, 2022
Advanced Neural Network Applications被引用数 8
ひとこと要約

CaFTは、クラスタリングと軽量なアテンションフィルタ(AtF)ヘッドを用いて、手動で設定されたしきい値を必要とせずに正確なオブジェクトマスクを生成する、ビジョントランスフォーマー(ViT)を用いた弱教師ありオブジェクト検出の新規手法を提案する。CUB-200とImageNet-1Kで、それぞれ97.55%および69.86%の検出精度を達成し、従来のCAMベースの手法よりも優れている。これは、特徴的な領域に依存するのではなく、完全なオブジェクトに焦点を当てるようになることで実現された。

ABSTRACT

Weakly supervised object localization (WSOL) is a challenging task to localize the object by only category labels. However, there is contradiction between classification and localization because accurate classification network tends to pay attention to discriminative region of objects rather than the entirety. We propose this discrimination is caused by handcraft threshold choosing in CAM-based methods. Therefore, we propose Clustering and Filter of Tokens (CaFT) with Vision Transformer (ViT) backbone to solve this problem in another way. CaFT first sends the patch tokens of the image split to ViT and cluster the output tokens to generate initial mask of the object. Secondly, CaFT considers the initial mask as pseudo labels to train a shallow convolution head (Attention Filter, AtF) following backbone to directly extract the mask from tokens. Then, CaFT splits the image into parts, outputs masks respectively and merges them into one refined mask. Finally, a new AtF is trained on the refined masks and used to predict the box of object. Experiments verify that CaFT outperforms previous work and achieves 97.55\% and 69.86\% localization accuracy with ground-truth class on CUB-200 and ImageNet-1K respectively. CaFT provides a fresh way to think about the WSOL task.

研究の動機と目的

  • 手動で設定されたしきい値に依存するため、CAMベースの手法が特徴的な領域にのみ注目するという限界を是正すること。
  • 活性マップに基づく検出における手動でのしきい値選択の必要性を排除すること。
  • ビジョントランスフォーマーのクラストークンを活用して、クラスタリングに基づくマスク生成により、検出精度を向上させること。
  • 初期のマスクをクラスタリングから得たもので精錬する、軽量で擬似教師付きのヘッド(AtF)を設計し、頑健なオブジェクト検出を実現すること。
  • クラスタリングとディープラーニングを組み合わせることで、WSOLのための新しいパラダイムを提供すること。

提案手法

  • ViTで処理されたパッチトークンに対してクラスタリングを適用し、特徴ベクトルをグループ化。クラストークンを含むクラスタを、前景オブジェクトのマスクとして選択する。
  • 初期のクラスターマスクを擬似ラベルとして用い、軽量なアテンションフィルタ(AtF)ヘッドを学習させ、ViTトークンからのオブジェクトマスクを精錬する。
  • 画像を複数の部分に分割し、それぞれを独立して処理して局所的マスクを生成。その後、それらを統合して精錬されたグローバルマスクを生成する。
  • 精錬されたマスクを用いて、2番目のAtFヘッドを学習させ、最終的なオブジェクトバウンディングボックスを予測する。
  • クラスタリングとAtFの前段階で、最後の3層のViTの特徴マップとその位置埋め込みを統合することで、表現品質を向上させる。
  • AtFモジュールは、1×1または3×3の畳み込み、バッチ正則化、活性化関数を用い、トークンレベルの特徴から前景・背景の区別を学習する。

実験結果

リサーチクエスチョン

  • RQ1クラストークンをガイドとしてViTパッチトークンのクラスタリングが、しきい値設定を必要とせずに初期オブジェクトマスクを効果的に生成できるか?
  • RQ2クラスタリングで生成された擬似マスクを学習データとして用いた軽量なアテンションフィルタ(AtF)ヘッドは、直接回帰や分類を学習する手法よりも検出精度を向上させるか?
  • RQ3複数の層からのViT特徴のマルチスケール統合は、クラスタリングとマスク生成の性能にどのように影響を与えるか?
  • RQ4過学習を回避しエッジ検出を向上させる観点から、AtFヘッドの最適なアーキテクチャ(カーネルサイズと深さ)は何か?
  • RQ5クラスタリングから得た擬似ラベルは、頑健な検出ヘッドの学習に効果的に利用できるか?また、バウンディングボックス回帰と比較してどうなるか?

主な発見

  • CaFTは、正解ラベルが与えられたCUB-200で97.55%の検出精度を達成し、従来のCAMベースの手法を大きく上回った。
  • ImageNet-1Kでは、正解ラベルが与えられた状態で69.86%の検出精度を達成し、大規模データセットにおける優れた一般化性能を示した。
  • クラスタリングで生成された擬似マスクを学習データとして用いたAtFヘッドは、同じ擬似ラベルを用いても、ボックス回帰ヘッドよりも優れた安定性とノイズフィルタリング性能を示し、性能が優れている。
  • 1×1畳み込みを用いたAtF(AtFS)が最も高い性能と一般化能力を示した。一方、3×3カーネルは過学習を引き起こし、エッジ検出性能を低下させた。
  • 最後の3層のViT特徴を統合することでマスク品質が向上し、位置埋め込みを追加することでさらに0.05%の性能向上が得られた。
  • 擬似マスク上で深層ネットワーク(ResNet50、VGG16)を直接学習させると、過学習が発生し、クラスタリング単体よりも性能が悪化した。これは、AtFのような軽量でタスク特化型のヘッドの必要性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。