Skip to main content
QUICK REVIEW

[論文レビュー] Dictionary Integration using 3D Morphable Face Models for Pose-invariant Collaborative-representation-based Classification

Xiaoning Song, Zhenhua Feng|arXiv (Cornell University)|Nov 1, 2016
Face recognition and analysis参考文献 29被引用数 6
ひとこと要約

本稿では、協調表現ベースの分類(CRC)の性能を向上させるために、3次元形状可塑的顔モデル(3DMM)を用いたポーズ不変型顔分類手法を提案する。2次元顔画像に3DMMをフィッティングすることで、任意のポーズ変化を持つ仮想トレーニングサンプルを生成し、それを拡張辞書に統合する。さらに、冗長性を低減し再構成スパarsityを向上させるためにオンライン除去戦略を適用する。本手法は、特に大規模なポーズ変化下でも最先端の性能を達成し、FERETデータセットでクラスあたり3サンプルのみを用いた場合に94.0%の正確度を達成した。

ABSTRACT

The paper presents a dictionary integration algorithm using 3D morphable face models (3DMM) for pose-invariant collaborative-representation-based face classification. To this end, we first fit a 3DMM to the 2D face images of a dictionary to reconstruct the 3D shape and texture of each image. The 3D faces are used to render a number of virtual 2D face images with arbitrary pose variations to augment the training data, by merging the original and rendered virtual samples to create an extended dictionary. Second, to reduce the information redundancy of the extended dictionary and improve the sparsity of reconstruction coefficient vectors using collaborative-representation-based classification (CRC), we exploit an on-line elimination scheme to optimise the extended dictionary by identifying the most representative training samples for a given query. The final goal is to perform pose-invariant face classification using the proposed dictionary integration method and the on-line pruning strategy under the CRC framework. Experimental results obtained for a set of well-known face datasets demonstrate the merits of the proposed method, especially its robustness to pose variations.

研究の動機と目的

  • 限られたトレーニングサンプルしかない状況下で、顔認識におけるポーズ変化の課題に対処すること。
  • 大規模なポーズ変化下でも協調表現ベースの分類(CRC)のロバスト性を向上させること。
  • データ拡張によって生成された拡張辞書内の情報の重複を低減すること。
  • 再構成スパarsityと分類正確度を向上させるオンライン除去戦略を開発すること。
  • 3次元形状可塑的顔モデル(3DMM)をCRCフレームワークに統合し、ポーズ変化にわたる一般化性能を向上させること。

提案手法

  • トレーニング辞書内の2次元顔画像に3次元形状可塑的顔モデル(3DMM)をフィッティングし、3次元形状とテクスチャを再構成する。
  • 再構成された3次元顔から、さまざまなポーズ角度で仮想2次元顔画像をレンダリングし、トレーニングセットを拡張する。
  • 元のサンプルとレンダリングされた仮想サンプルを統合して、トレーニング用の拡張辞書を構築する。
  • オンライン除去方式を適用し、クエリごとに最も代表的なサンプルのみを特定・保持することで冗長性を低減する。
  • 最適化された辞書をCRCフレームワークに統合し、ポーズ不変型顔分類を実行する。
  • 分類中にオンラインで辞書を最適化し、再構成誤差に基づいて代表的でないサンプルをプルーニングする。

実験結果

リサーチクエスチョン

  • RQ13DMMベースの仮想データ拡張は、大規模なポーズ変化下でCRCの性能を顕著に向上させるか?
  • RQ23DMMによって生成された仮想サンプルの統合は、CRCにおける再構成係数のスパarsityと正確度にどのように影響するか?
  • RQ3オンライン除去戦略は、分類正確度を保持したまま、拡張辞書内の冗長性をどの程度低減できるか?
  • RQ4限られたトレーニングサンプルとポーズ変化の下で、本手法はベースラインCRCおよびSRCと比較してどのように異なるか?
  • RQ5本手法は、外見の変動が著しいデータセットにおいて、既存のデータ拡張技術よりも一般化性能に優れているか?

主な発見

  • 提案手法の3DPD-CRCは、FERETデータセットでクラスあたり3つのランダム選択されたトレーニングサンプルを用いた場合に94.0%の顔認識正確度を達成し、ベースライン手法を著しく上回った。
  • PIEデータセットでは、4つのトレーニングサンプルを用いた場合に97.1%の正確度を達成し、ポーズ変化に対して強いロバスト性を示した。
  • FERETでクラスあたり2つのトレーニングサンプルを用いた場合、本手法は81.5%の正確度を達成したが、標準CRCでは55.6%、SRCでは68.7%であった。
  • オンライン除去戦略により冗長性が低減され、性能が向上した。除去割合が70%まで上昇するに従い、認識率は安定またはわずかに向上した。
  • FERETとPIEでは、ORLよりも外見の変動が著しいため、本手法は複雑で現実的状況に近い環境でも優れた性能を示した。
  • 結果から、3DMMベースの仮想サンプル生成が、従来のデータ拡張手法が捉えきれないクラス内ポーズ変化を効果的に捉えていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。