Skip to main content
QUICK REVIEW

[論文レビュー] Cluster and Aggregate: Face Recognition with Large Probe Set

Minchul Kim, Feng Liu|arXiv (Cornell University)|Oct 19, 2022
Face and Expression Recognition被引用数 11
ひとこと要約

本論文では、大規模な顔認識のための2段階型特徴統合フレームワーク「CAFce」を提案する。この手法は、事前に固定サイズのグローバルクラスタに大量のプローブ画像をクラスタリングし、それらを統合することで、非常に大きなプローブ集合(最大12,000フレーム)に対しても効率的かつ順序に依存しない推論を可能にする。線形クラスタリングとバッチ順序に依存しない集約を組み合わせることで、自己注意機構の2次関数的計算コストとRNNの順序に依存する性質を克服し、IJB-BおよびIJB-Sベンチマークで最先端の性能を達成する。

ABSTRACT

Feature fusion plays a crucial role in unconstrained face recognition where inputs (probes) comprise of a set of $N$ low quality images whose individual qualities vary. Advances in attention and recurrent modules have led to feature fusion that can model the relationship among the images in the input set. However, attention mechanisms cannot scale to large $N$ due to their quadratic complexity and recurrent modules suffer from input order sensitivity. We propose a two-stage feature fusion paradigm, Cluster and Aggregate, that can both scale to large $N$ and maintain the ability to perform sequential inference with order invariance. Specifically, Cluster stage is a linear assignment of $N$ inputs to $M$ global cluster centers, and Aggregation stage is a fusion over $M$ clustered features. The clustered features play an integral role when the inputs are sequential as they can serve as a summarization of past features. By leveraging the order-invariance of incremental averaging operation, we design an update rule that achieves batch-order invariance, which guarantees that the contributions of early image in the sequence do not diminish as time steps increase. Experiments on IJB-B and IJB-S benchmark datasets show the superiority of the proposed two-stage paradigm in unconstrained face recognition. Code and pretrained models are available in https://github.com/mk-minchul/caface

研究の動機と目的

  • プローブ集合に数万枚の低品質な画像が含まれる非制約的顔認識における特徴統合の課題に対処すること。
  • 大規模なプローブ集合(N > 1000)を扱う際の自己注意機構の2次関数的計算コストを克服すること。
  • 順序付き推論における順序に依存する問題を解消すること、特に再帰モデルでは初期フレームの影響が時間経過とともに弱まる問題を解消すること。
  • さまざまなプローブサイズにわたって高い性能を維持できるスケーラブルで順序に依存しない統合フレームワークを設計すること。
  • 固定クラスタ数Mを用いてクラスタリングと集約の段階を分離することで、大規模なプローブ集合における効率的な推論を可能にすること。

提案手法

  • 2段階型フレームワークを導入:クラスタリングネットワーク(CN)は、N個の入力特徴をM個の固定グローバルクラスタ中心にソフト代入することで、入力順序に依存しない性質を保証する。
  • クラスタ中心の更新に段階的平均化を用いることで、バッチ順序に依存せず、初期フレームの寄与が時間経過とともに減少することを防ぐ。
  • 入力に依存しない共有クラスタ中心を学習することで、異なるプローブ集合間で一貫したクラスタリングを実現する。
  • 集約ネットワーク(AGN)を用いて、M個のクラスタ特徴を、集合内関係モデリングにより統合し、計算量を低減した効果的な特徴統合を実現する。
  • 集約段階を計算的に効率的かつスケーラブルに設計し、入力を小さなバッチに分割して処理することで、大規模なNに対して順次推論を可能にする。
  • 微分可能クラスタリング機構を用いることで、CAFceパイプライン全体のエンド・ツー・エンド学習を可能にする。

実験結果

リサーチクエスチョン

  • RQ1非常に大きなプローブ集合(N > 10,000)を処理する際、特徴統合フレームワークが性能と順序不変性を維持できるか。
  • RQ22次関数的計算量を伴わずに、特徴間の集合内関係を効率的にモデル化できるか。
  • RQ3クラスタリングに基づく特徴要約は、スケーラビリティと順序に依存しない堅牢性を両立できるか。
  • RQ42段階のクラスタリングと集約アプローチは、大規模な非制約的顔認識において、注意機構や再帰的統合手法を上回る性能を発揮できるか。
  • RQ5長大な順次入力において、初期フレームの影響がどの程度低下するか。

主な発見

  • CAFceはIJB-SおよびIJB-Bベンチマークで最先端の性能を達成し、単純平均(Naïve)との相対的性能向上がプローブサイズに応じて増大する。
  • CAFceは最大12,000フレームの同時統合をサポートし、線形クラスタリング設計のおかげでRSA(最大384フレーム)を大きく上回る。
  • CAFceはN=256における相対的推論速度をバックボーンのFPSの64.4倍に保ち、速度とスケーラビリティの両面でRSA(3.1倍)とCFAN(664.2倍)を上回る。
  • 段階的平均化によりバッチ順序不変性を達成し、初期フレームの寄与が時間経過とともに減少しないことを保証する。
  • CAFceは優れたGPUメモリ効率を示し、注意機構に依存する手法とは異なり、大規模NのセットでもOOMエラーを発生させない。
  • 入力を小さなバッチに分割し、クラスタ中心を段階的に更新することで、大規模Nの順次推論を実現する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。