Skip to main content
QUICK REVIEW

[論文レビュー] From Saliency to DINO: Saliency-guided Vision Transformer for Few-shot Keypoint Detection

Changsheng Lu, Hao Zhu|arXiv (Cornell University)|Apr 6, 2023
Advanced Neural Network Applications被引用数 4
ひとこと要約

本稿では、マスク付き自己注意機構と形状学習者を用いて前景領域に注目し、受容 field を動的に適応させることで、少サンプルキーポイント検出を向上させる、注目度誘導型ビジョントランスフォーマー、SalViT を提案する。本手法は、重度の隠蔽状態において最大10%高いPCKを達成し、DINOを軽量な注目度検出器として活用することで、標準モデルを上回る性能を発揮する。

ABSTRACT

Unlike current deep keypoint detectors that are trained to recognize limited number of body parts, few-shot keypoint detection (FSKD) attempts to localize any keypoints, including novel or base keypoints, depending on the reference samples. FSKD requires the semantically meaningful relations for keypoint similarity learning to overcome the ubiquitous noise and ambiguous local patterns. One rescue comes with vision transformer (ViT) as it captures long-range relations well. However, ViT may model irrelevant features outside of the region of interest due to the global attention matrix, thus degrading similarity learning between support and query features. In this paper, we present a novel saliency-guided vision transformer, dubbed SalViT, for few-shot keypoint detection. Our SalViT enjoys a uniquely designed masked self-attention and a morphology learner, where the former introduces saliency map as a soft mask to constrain the self-attention on foregrounds, while the latter leverages the so-called power normalization to adjust morphology of saliency map, realizing ``dynamically changing receptive field''. Moreover, as salinecy detectors add computations, we show that attentive masks of DINO transformer can replace saliency. On top of SalViT, we also investigate i) transductive FSKD that enhances keypoint representations with unlabelled data and ii) FSKD under occlusions. We show that our model performs well on five public datasets and achieves ~10% PCK higher than the normally trained model under severe occlusions.

研究の動機と目的

  • ドメインシフトや限られた教師信号のもとで、少サンプルキーポイント検出(FSKD)におけるノイズが多く曇った局所的パターンの課題に対処すること。
  • 注目度の高い前景領域内の長距離関係をモデル化することで、サポートとクエリの特徴間の類似性学習を向上させること。
  • DINOの注意マップが注目度マップと強く一致することを活かし、外部の注目度検出器の代わりに注意特徴を用いることで、計算コストを低減すること。
  • マスキングとアライメント(MAA)戦略を採用することで、部分的教師信号下でも一般化性能を向上させ、キーポイントの隠蔽に強い耐性を強化すること。

提案手法

  • 注目度マップをソフトマスクとして用いることで、自己注意計算を前景パッチに限定するマスク付き自己注意(M-SA)モジュールを導入する。
  • 注目度マップにパワー正規化を適用することで、キーポイント候補の周囲の関連するコンテキストをよりよく捉えるために、受容 field の動的調整を可能にする形状学習者(ML)を提案する。
  • 外部の注目度検出器の代わりに DINO の注意マップを用いることで、推論コストを削減しながらも性能を維持する。
  • 未ラベルデータを用いてサポートキーポイントプロトタイプを強化するトランスductive FSKDの変種を設計し、低ショット状況における表現品質を向上させる。
  • トレーニング段階で、RGB、注目度、CNN特徴のマスキングに加え、確率マップアライメントを組み合わせたマスキングとアライメント(MAA)戦略を適用し、隠蔽に対する耐性を向上させる。
  • 画像空間(SimMIM)、予測空間(非隠蔽損失)、特徴空間(ℓ1、ℓ2、MMD)の複数のアライメント戦略を適用することで、隠蔽状態下での一般化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1注目度誘導型注意により、自己注意を関連する前景領域に集中させ、背景ノイズを抑制することで、少サンプルキーポイント検出の性能が向上するか?
  • RQ2形状学習者が、少サンプルキーポイント検出における特徴表現を強化するために、受容 field の動的適応をどの程度効果的に可能にするか?
  • RQ3DINO の注意マップは、性能を損なわせることなく、外部の注目度検出器の代替として軽量かつ効果的であると見なせるか?
  • RQ4提案されたマスキングとアライメント(MAA)戦略は、少サンプル状況下でのキーポイント隠蔽に対する耐性をどの程度向上させるか?
  • RQ5未ラベルデータを用いたトランスductive FSKDによるプロトタイプの精錬は、低ショット状況下でのキーポイントプロトタイプ品質と一般化性能を向上させるか?

主な発見

  • SalViT モデルは、100%の隠蔽状態下で Animal Pose データセットにおいて、通常トレーニングされたモデルと比較してPCKが10%相対的に向上する。
  • 提案された M-SA と ML のコンポーネントを併用することで、1ショットのトランスductive FSKDにおいて、Animal Pose データセットでインダクティブベースラインと比較して調和スコアが3.23%絶対的に向上する。
  • DINO の注意マップを注目度プロキシとして用いることで、計算コストを削減しながらも性能を維持でき、外部の注目度モデルを用いた場合と比較して精度の低下は最小限に抑えられる。
  • MAA 戦略における確率マップアライメント戦略は、他のアライメント手法を上回り、100%の隠蔽状態下でマスキングのみの手法と比較してPCKが最大2%向上し、標準モデルと比較して10%向上する。
  • アブレーションスタディの結果、トレーニング段階でRGB、注目度、CNN特徴をマスキングすることで耐性が向上し、完全なMAA戦略(マスキング+確率マップアライメント)が重度の隠蔽状態下で最高の性能を達成する。
  • 未ラベルデータを用いたトランスductive FSKDによるプロトタイプの精錬は、Animal Pose で4.97%、AwA で4.91%の性能向上をもたらし、低ショット環境におけるデータ強化の有効性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。