[論文レビュー] Local Deep Neural Networks for Age and Gender Classification
本稿では、顔全体をカバーする9つの重複する顔領域パッチを用いる、簡素化された局所的深層ニューラルネットワーク(LDNN)手法を提案する。従来の数百個のパッチに比べ、学習時間を著しく短縮できる一方で、性能の低下は最小限に抑えられる。この手法は、元のLDNNに比べ最大1%の精度低下を示すが、LFWでは他の非CNN手法を上回り、Adienceでは最先端の結果を達成する。特に、目の領域と口の領域が年齢および性別分類において最も判別能が高いことが特定された。
Local deep neural networks have been recently introduced for gender recognition. Although, they achieve very good performance they are very computationally expensive to train. In this work, we introduce a simplified version of local deep neural networks which significantly reduces the training time. Instead of using hundreds of patches per image, as suggested by the original method, we propose to use 9 overlapping patches per image which cover the entire face region. This results in a much reduced training time, since just 9 patches are extracted per image instead of hundreds, at the expense of a slightly reduced performance. We tested the proposed modified local deep neural networks approach on the LFW and Adience databases for the task of gender and age classification. For both tasks and both databases the performance is up to 1% lower compared to the original version of the algorithm. We have also investigated which patches are more discriminative for age and gender classification. It turns out that the mouth and eyes regions are useful for age classification, whereas just the eye region is useful for gender classification.
研究の動機と目的
- 局所的深層ニューラルネットワーク(LDNN)の学習にかかる計算コストを低減すること。
- 戦略的に配置された最小限のパッチ集合が、高い分類精度を維持できるかどうかを調査すること。
- 年齢および性別分類において最も判別能が高い顔領域を同定すること。
- 簡素化LDNNの性能を、元のLDNNおよび他の非CNN最先端手法と比較すること。
提案手法
- エッジ検出によって抽出される数百個のパッチの代わりに、1枚の画像あたり9つの重複するパッチを用いる。
- パッチは、目の領域、口の領域、鼻の領域を基準として配置され、空間的な重複により完全なカバーが確保される。
- 各パッチは個別の深層ニューラルネットワークで処理され、最終的な予測は全パッチの平均化によって得られる。
- ミラー画像によるデータ拡張を回避し、ドロップアウトを用いない単純な順方向ネットワークを採用する。
- 性別および年齢分類は2段階パイプラインで実行される:まず各パッチで性別を分類し、その後、性別に応じた年齢分類器にルーティングする。
- 3D版のLFWおよびAdienceデータベースを用いて評価を行い、データのバランスを改善するため年齢群を統合した。
実験結果
リサーチクエスチョン
- RQ1元のLDNNが数百個のパッチを用いるのに対し、9個のパッチに著しく削減された場合でも、年齢および性別分類の性能を高い水準で維持できるか?
- RQ2簡素化LDNNを用いた場合、年齢および性別分類において最も情報量が多い顔領域はどれか?
- RQ3簡素化LDNNは、ベンチマークデータセットにおいて、既存の非CNN手法と同等またはより優れた性能を達成できるか?
- RQ4パッチレベルでのルーティングによる性別と年齢分類の統合が、全体の精度にどのように影響するか?
- RQ5性別予測が誤分類された場合、その影響が下流の年齢分類性能に与える影響は何か?
主な発見
- 簡素化された9パッチLDNNは、元のLDNNに比べ学習時間を90%以上短縮し、精度は0.5%~1%の低下にとどまる。
- LFWデータベースでは、9パッチ手法で性別分類精度が78.63%、正確な年齢群分類精度が40.25%を達成した。
- 性別と年齢分類を統合した場合、Adienceでは正確な分類精度が41.82%、1つ違いの精度が77.98%に向上した。
- 目の領域が、性別および年齢分類の両方において最も判別能が高い。口の領域は年齢推定において顕著な寄与を示した。
- 女性の場合は、内眼角に位置するパッチ(第1および第3パッチ)が外側のパッチよりも年齢分類精度が2%高い結果となり、領域ごとの感度差が示された。
- 性別を誤って分類し、誤った年齢分類器にルーティングすると、男性が女性と誤分類された場合の精度は1つ違いで36.15%に低下するが、誤差伝搬に対しては耐性があることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。