[論文レビュー] Robust LSTM-Autoencoders for Face De-Occlusion in the Wild
本稿では、現実世界の制約のない環境における顔の不完全被覆(de-occlusion)を目的として、ロバストLSTMオートエンコーダー(RLA)モデルを提案する。マルチスケール空間LSTMエンコーダーと、顔の再構成と被覆検出を段階的に共同で行う二重チャネルLSTMデコーダーを用いることで、アイデンティティを保持する adversarial 学習を介して、被覆された顔を効果的に回復させるとともに、アイデンティティを特徴付ける特徴を維持する。本モデルは、合成および現実世界の被覆データセットにおいて、顔の回復品質と認識精度の両面で最先端の性能を達成した。
Face recognition techniques have been developed significantly in recent years. However, recognizing faces with partial occlusion is still challenging for existing face recognizers which is heavily desired in real-world applications concerning surveillance and security. Although much research effort has been devoted to developing face de-occlusion methods, most of them can only work well under constrained conditions, such as all the faces are from a pre-defined closed set. In this paper, we propose a robust LSTM-Autoencoders (RLA) model to effectively restore partially occluded faces even in the wild. The RLA model consists of two LSTM components, which aims at occlusion-robust face encoding and recurrent occlusion removal respectively. The first one, named multi-scale spatial LSTM encoder, reads facial patches of various scales sequentially to output a latent representation, and occlusion-robustness is achieved owing to the fact that the influence of occlusion is only upon some of the patches. Receiving the representation learned by the encoder, the LSTM decoder with a dual channel architecture reconstructs the overall face and detects occlusion simultaneously, and by feat of LSTM, the decoder breaks down the task of face de-occlusion into restoring the occluded part step by step. Moreover, to minimize identify information loss and guarantee face recognition accuracy over recovered faces, we introduce an identity-preserving adversarial training scheme to further improve RLA. Extensive experiments on both synthetic and real datasets of faces with occlusion clearly demonstrate the effectiveness of our proposed RLA in removing different types of facial occlusion at various locations. The proposed method also provides significantly larger performance gain than other de-occlusion methods in promoting recognition performance over partially-occluded faces.
研究の動機と目的
- 訓練時に見られなかったオープンセットのテスト顔を含む、被覆の種類や位置が多様な制約のない現実世界のシナリオにおける顔の被覆除去の課題に対処すること。
- 閉じたセットの仮定に依存する既存の被覆除去手法や、サングラスやマスクのような空間的に連続する複雑な被覆に対して失敗する問題を克服すること。
- 再帰的モデリングと共同再構成・検出を用いて、粗い段階から細かい段階へと段階的に被覆領域を回復する、プログレッシブでエンドツーエンドで訓練可能なフレームワークを開発すること。
- 回復された顔における識別的アイデンティティ特徴を保持し、とくに重度の被覆下でも下流の顔認識性能を向上させること。
- アーティファクトを低減し、視覚的忠実度を向上させつつ認識精度を維持するアイデンティティ保持型 adversarial 学習スキームを導入すること。
提案手法
- 異なるサイズの顔パッチを逐次処理するマルチスケール空間LSTMエンコーダーを採用し、被覆領域の影響を最小限に抑えた、被覆に強い潜在表現を生成する。
- 二重チャネルLSTMデコーダーを実装し、顔再構成ネットワークと被覆検出ネットワークの二つのサブネットワークを、隠れ状態フィードバックを通じたクロスアテンションで連携させる。
- 再帰的デコーディングを用いて、粗い段階から細かい段階へと被覆された顔領域を段階的に回復させ、以前に回復された情報を次のステップのガイドとして活用する。
- 再構成された顔画像と真値画像の間の平均二乗誤差(MSE)損失を用いて、エンドツーエンドでオートエンコーダーを訓練し、ピxls単位の忠実度を確保する。
- 回復された顔と元の顔の特徴表現を一致させるために、識別的アイデンティティの保持を強制する教師ありCNNを統合する。
- 本物の被覆なし顔と回復された顔を区別するための adversarial ディスクラミネーターを適用し、アーティファクトを低減するとともに、認識精度を維持したまま視覚的質を向上させる。

実験結果
リサーチクエスチョン
- RQ1再帰的オートエンコーダー構造は、多様な被覆タイプを持つ制約のない現実世界の環境において、部分的に被覆された顔を効果的に回復できるか?
- RQ2LSTMベースのエンコーディングとデコーディングを用いたプログレッシブな段階的被覆除去は、単一ステップの被覆除去手法に比べ、視覚的品質および認識精度の面で優れているか?
- RQ3二重チャネルLSTMフレームワークにおける顔再構成と被覆検出の共同処理は、被覆された顔領域の局所化と回復を向上させられるか?
- RQ4アイデンティティ保持型 adversarial 学習は、下流の認識タスクにおける回復顔の識別的質をどの程度向上させるか?
- RQ5本稿で提案するRLAモデルは、訓練セットに含まれないテスト対象者が含まれるオープンセットのテストシナリオにおいて、どの程度一般化性能を発揮するか?
主な発見
- 提案されたRLAモデルは、被覆された顔を含むLFWデータセットにおいて、等確率誤差率(EER)10.0%を達成し、PCA、AE、SRC、SSDAなどのベースライン手法を著しく上回った。
- 50OccPeopleデータセットでは、平均EERが17.3%を記録し、現実世界の被覆データに対して優れた一般化性能を示し、比較されたすべての手法を上回った。
- アイデンティティ保持型のSupervisionを統合したIP-RLAバージョンは、標準オートエンコーダー(AE)に比べ12.4ポイント、PCAに比べ18.5ポイントEERを低減し、認識精度の顕著な向上を示した。
- 被覆検出機能を備えた二重チャネルLSTMデコーダーは、顔再構成のみの手法に比べ、誤差率を最大10.5ポイントまで低減し、被覆領域の局所化が特徴保持を強化することを実証した。
- Adversarial 学習は、視覚的アーティファクトを顕著に低減するとともに、認識精度を維持したまま、認識性能と視覚的質の両方を向上させたことが確認された。
- 顔の半分(左または右)が被覆された場合に最も高い性能を発揮したが、上部および下部顔領域の被覆に対しても依然として優れた性能を示し、効果的な領域間特徴転送が実現していることが示された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。