Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Cluster Faces via Transformer

Jinxing Ye, Xiaojiang Peng|arXiv (Cornell University)|Apr 23, 2021
Face recognition and analysis参考文献 38被引用数 6
ひとこと要約

本論文は、二段階のトランスフォーマーに基づくアプローチを用いる、顔クラスタリングのための新規な教師ありフレームワークであるFace Transformer (FaceT) を提案する。関係エンコーダー (RE) は文脈的なノード強化を、リンク予測器 (LP) は正確なペアワイズクラスターリンク予測を実現する。局所的なトポロジーをモデル化し、エッジ表現を向上させることで、FaceTは最先端の性能を達成し、MS-Celeb-1Mで91.12%のペアワイズFスコア、90.54%のBcubed Fスコアを達成した。

ABSTRACT

Face clustering is a useful tool for applications like automatic face annotation and retrieval. The main challenge is that it is difficult to cluster images from the same identity with different face poses, occlusions, and image quality. Traditional clustering methods usually ignore the relationship between individual images and their neighbors which may contain useful context information. In this paper, we repurpose the well-known Transformer and introduce a Face Transformer for supervised face clustering. In Face Transformer, we decompose the face clustering into two steps: relation encoding and linkage predicting. Specifically, given a face image, a extbf{relation encoder} module aggregates local context information from its neighbors and a extbf{linkage predictor} module judges whether a pair of images belong to the same cluster or not. In the local linkage graph view, Face Transformer can generate more robust node and edge representations compared to existing methods. Experiments on both MS-Celeb-1M and DeepFashion show that our method achieves state-of-the-art performance, e.g., 91.12\% in pairwise F-score on MS-Celeb-1M.

研究の動機と目的

  • ポーズ、遮蔽、画像品質の極端な変動に起因する顔クラスタリングの課題に対処すること。
  • 顔画像とその近隣との間の文脈的関係をモデル化することで、クラスタリングのロバスト性を向上させること。
  • 凸または均一なクラスタ分布を仮定する従来のクラスタリング手法の限界を克服すること。
  • ノードおよびエッジ表現学習のためのアテンションメカニズムを活用する統合的でエンドツーエンドのフレームワークを構築すること。
  • 大規模顔クラスタリングベンチマークで最先端の性能を達成すること。

提案手法

  • FaceTは顔クラスタリングを二段階に分解する:関係符号化とリンク予測。
  • 関係エンコーダー (RE) は多頭部自己注意機構を用いて、近隣の顔画像からの局所的文脈を集約し、ノード埋め込みを強化する。
  • リンク予測器 (LP) はトランスフォーマーに基づくエッジ強化モジュールを採用し、エッジ表現を精緻化し、ペアの画像が同じクラスタに属するかどうかを分類する。
  • 本モデルは二段階の近隣サンプリング戦略を採用する:hop1はハードな正例・負例のマイニングに、hop2は局所的なトポロジーの一貫性に使用する。
  • ペアワイズリンク予測にコントラスト損失を適用することで、エンドツーエンドで訓練され、ノードおよびエッジ表現の共同最適化が可能になる。
  • エンコーダーの深さ、アテンションヘッド数、ドロップアウト率、近隣ホップ数などのハイパーパrameterは、ロバスト性とパフォーマンス向上を目的に調整された。

実験結果

リサーチクエスチョン

  • RQ1自己注意機構は、困難な条件下での顔クラスタリングを向上させるために、局所的なトポロジカルな文脈を効果的にモデル化できるか?
  • RQ2ノードおよびエッジ表現を同時に強化することは、従来のGCNベースやメトリクス学習手法と比較して、より優れたクラスタリング性能をもたらすか?
  • RQ3本手法FaceTは、アテンションヘッド数、ドロップアウト率、近隣ホップ数といったハイパーパrameterの選択にどれほど感受性を示すか?
  • RQ4本モデルは、異なる深層特徴抽出器や学習データセットに対しても一般化可能か?
  • RQ5文脈に配慮したエッジ表現の使用は、ハードな正例・負例ペアの誤分類を低減するか?

主な発見

  • FaceTはMS-Celeb-1Mベンチマークで91.12%のペアワイズFスコアを達成し、新たな最先端水準を樹立した。
  • FaceTはMS-Celeb-1MでBcubed Fスコア90.54%およびNMI 97.63%を達成し、優れたクラスタリングの純度と密着性を示した。
  • 関係エンコーダー単体でも、ユークリッド空間で測定可能な強固なノード表現を生成しており、効果的な文脈特徴学習が可能であることが示された。
  • ドロップアウト率を0.4から0.2に低下させると、テスト性能がわずかに向上した。これは、過剰な正則化が学習を妨げる可能性があることを示唆している。
  • アテンションヘッド数を4から8に増加させると、性能がわずかに向上し、ピークFスコアは91.34%に達した。
  • 本モデルはhop1およびhop2の近隣サンプリング戦略に最も感受性を示し、hop1を150、hop2を5に設定した際、最良の性能が得られた。これは、近隣選択戦略が一般化性能に顕著に影響を与えることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。