Skip to main content
QUICK REVIEW

[論文レビュー] Clustering Millions of Faces by Identity

Charles Otto, D. Wang|arXiv (Cornell University)|Apr 4, 2016
Face recognition and analysis参考文献 2被引用数 5
ひとこと要約

この論文は、深層顔認識埋め込みを用いて、数百万枚のラベルなし顔画像をアイデンティティごとにグループ化する近似ランク順クラスタリング手法を提案する。LFWではF-measure 0.87、123M枚の画像データセットでは0.27を達成し、高いスケーラビリティを実現した。本手法により、大規模な顔画像コレクションの効率的クラスタリングが可能となり、手動レビューのための高信頼度クラスタを優先する内部クラスタ品質指標を導入した。

ABSTRACT

In this work, we attempt to address the following problem: Given a large number of unlabeled face images, cluster them into the individual identities present in this data. We consider this a relevant problem in different application scenarios ranging from social media to law enforcement. In large-scale scenarios the number of faces in the collection can be of the order of hundreds of million, while the number of clusters can range from a few thousand to millions--leading to difficulties in terms of both run-time complexity and evaluating clustering and per-cluster quality. An efficient and effective Rank-Order clustering algorithm is developed to achieve the desired scalability, and better clustering accuracy than other well-known algorithms such as k-means and spectral clustering. We cluster up to 123 million face images into over 10 million clusters, and analyze the results in terms of both external cluster quality measures (known face labels) and internal cluster quality measures (unknown face labels) and run-time. Our algorithm achieves an F-measure of 0.87 on a benchmark unconstrained face dataset (LFW, consisting of 13K faces), and 0.27 on the largest dataset considered (13K images in LFW, plus 123M distractor images). Additionally, we present preliminary work on video frame clustering (achieving 0.71 F-measure when clustering all frames in the benchmark YouTube Faces dataset). A per-cluster quality measure is developed which can be used to rank individual clusters and to automatically identify a subset of good quality clusters for manual exploration.

研究の動機と目的

  • ソーシャルメディアや法執行警方のような大規模な状況において、未知のアイデンティティに分類されない数百万枚の顔画像をクラスタリングする課題に対処すること。
  • k-means やスペクトルクラスタリングなどの従来のクラスタリング手法が、大規模で制約のない顔画像データセットに適用された場合に直面するスケーラビリティと精度の制限を克服すること。
  • 低品質な画像、被験者頻度の不均衡、ノイズや欠損ラベルが存在する状況でも高い精度を維持できる、堅牢でスケーラブルなクラスタリングパイプラインの開発。
  • 外部ラベルに依存せずに、クラスタ内の密着性と分離性に基づく内部の各クラスタ品質指標を新たに導入し、高信頼度クラスタを優先して人為的検証や分析に回す仕組みを提供すること。
  • 1000万以上のクラスタにまで拡張可能な1億2300万枚の顔画像を、アイデンティティ構造を保持したままクラスタリングする可能性を実証すること。

提案手法

  • 最先端の顔認識モデルから得られる深層畳み込みニューラルネットワーク(CNN)埋め込みを活用し、高品質で識別性の高い顔表現を生成する。
  • Zhuら[7]が提唱したランク順クラスタリング手法を、共有最近傍(SNN)を用いて類似度を計算することで改善し、ノイズや低品質な顔画像に対しても耐性を高める。
  • FAISSなどと同様の近似最近傍(ANN)探索を導入し、SNN計算を1億枚以上の画像にスケーリングし、実行時間の複雑さを低減する。
  • 反復的リファインメント手順を避けることでクラスタリング手順を簡素化し、大規模データセットに適したワンパスでスケーラブルなアプローチを採用する。
  • 外部ラベルなしで計算可能な、クラスタ内での密着性とクラスタ間の分離性に基づく内部クラスタ品質スコアを設計する。
  • 品質指標を適用してクラスタをランク付けし、高信頼度クラスタを下流の人的検証や分析に優先的に回す仕組みを実現する。

実験結果

リサーチクエスチョン

  • RQ1深層特徴と近似最近傍探索を組み合わせたランク順クラスタリングアプローチは、1億枚以上の顔画像にスケーリング可能であり、高いクラスタリング精度を維持できるか?
  • RQ2大規模で制約のない顔画像データセットにおいて、提案手法の近似ランク順クラスタリングは、k-means やスペクトルクラスタリングと比較して、精度と効率性に優れているか?
  • RQ3外部ラベルに依存せず、内部クラスタ品質指標が高信頼度クラスタを効果的に同定できる程度はどの程度か?
  • RQ4データセットのサイズが増加し、画像品質のばらつきが大きくなる(特にWebから抽出された干渉画像を含む)状況下で、クラスタリング性能はどのように低下するか?
  • RQ5実世界の制約のないデータにおいて、同じアイデンティティの複数枚の画像を、近い同一画像やポーズ・照明の違いがある状況でも、本手法が正しくグループ化できるか?

主な発見

  • 提案された近似ランク順クラスタリングアルゴリズムは、ラベル付き顔画像の野生(LFW)ベンチマークデータセットでF-measure 0.87を達成し、標準的な顔クラスタリングタスクにおける優れた性能を示した。
  • 評価済みの最大データセット(13,233枚のラベル付きLFW画像に加え、1億2300万枚のラベルなしWeb画像)において、F-measure 0.27を達成し、現実世界の大規模な状況でも実用可能であることを示した。
  • 内部の各クラスタ品質指標により、上位にランク付けされたクラスタは、主に純粋(同一アイデンティティの画像のみを含む)であり、高い密着性と分離性を示した。
  • 上位クラスタにはしばしば近い同一画像やコマーシャルの顔画像も含まれていたが、品質指標は実際に同じアイデンティティの顔画像を含むクラスタを、ノイズの多い背景の中でも効果的に優先した。
  • 1億2300万枚の顔画像を1000万以上のクラスタに分割可能であり、近似最近傍探索により正確な手法と比較して実行時間の大幅な改善が達成された。
  • YouTube Facesデータセットの動画フレームクラスタリングではF-measure 0.71を達成し、本手法が順次的ビジュアルデータに一般化できることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。