Skip to main content
QUICK REVIEW

[論文レビュー] Optimizing Filter Size in Convolutional Neural Networks for Facial Action Unit Recognition

Shizhong Han, Zibo Meng|arXiv (Cornell University)|Jul 26, 2017
Speech and Audio Processing参考文献 13被引用数 4
ひとこと要約

本論文は、バックプロパゲーション中に微分可能最適化を用いて、畳み込みフィルターサイズと重みを同時に最適化する新しいCNNフレームワーク、最適化フィルターサイズCNN(OFS-CNN)を提案する。フィルターサイズを連続変数として扱い、上界・下界の整数サイズフィルターを用いた補間により、複数の固定フィルターサイズを用いるモデルよりも著しく高速な推論を実現しながら、顔の解像度に応じて適応可能であり、最先端のAU認識性能を達成する。

ABSTRACT

Recognizing facial action units (AUs) during spontaneous facial displays is a challenging problem. Most recently, Convolutional Neural Networks (CNNs) have shown promise for facial AU recognition, where predefined and fixed convolution filter sizes are employed. In order to achieve the best performance, the optimal filter size is often empirically found by conducting extensive experimental validation. Such a training process suffers from expensive training cost, especially as the network becomes deeper. This paper proposes a novel Optimized Filter Size CNN (OFS-CNN), where the filter sizes and weights of all convolutional layers are learned simultaneously from the training data along with learning convolution filters. Specifically, the filter size is defined as a continuous variable, which is optimized by minimizing the training loss. Experimental results on two AU-coded spontaneous databases have shown that the proposed OFS-CNN is capable of estimating optimal filter size for varying image resolution and outperforms traditional CNNs with the best filter size obtained by exhaustive search. The OFS-CNN also beats the CNN using multiple filter sizes and more importantly, is much more efficient during testing with the proposed forward-backward propagation algorithm.

研究の動機と目的

  • 従来のCNNにおける不適切な固定フィルターサイズの問題に取り組むこと。
  • 異なる画像解像度に対して最適なフィルターサイズを求めるための高コストな網羅的ハイパーパramータサーチの必要性を排除すること。
  • バックプロパゲーション中にフィルターサイズと畳み込み重みを同時に最適化できる微分可能でエンドツーエンドで学習可能な手法を開発すること。
  • 固定または複数のフィルターサイズを用いる従来のCNNと比較して、認識精度と推論効率を向上させること。

提案手法

  • フィルターサイズを離散的ハイパーパramータではなく、連続的で微分可能な変数として扱う。
  • 連続的なフィルターサイズを補間によって近似するために、上界および下界の整数サイズフィルターを用いる。
  • 前方伝播において、上界および下界フィルター出力の重み付き補間として活性化を計算する。
  • バックプロパゲーションを用いて、損失関数に対するフィルターサイズの勾配を導出し、確率的勾配降下法による繰り返し的最適化を可能にする。
  • 最適な連続的フィルターサイズが変化した際に、上界および下界フィルターのサイズを更新する変換操作を導入する。
  • フィルターサイズと重みの両方を同時に更新する、共同前方・後方伝播アルゴリズムを採用する。

実験結果

リサーチクエスチョン

  • RQ1顔のアクションユニット(AU)認識のためのエンドツーエンドCNNトレーニング中に、フィルターサイズを連続的で微分可能な変数として効果的に最適化できるか?
  • RQ2各層で最適なフィルターサイズを学習することで、固定または複数の固定フィルターサイズを用いる場合と比較して、AU認識性能が向上するか?
  • RQ3提案手法は、自発的AUデータベースにおいて最先端のCNNと比較して、より高い精度と推論速度を達成できるか?
  • RQ4異なる入力画像解像度において、OFS-CNNの汎用性はどの程度高いか?
  • RQ5モデルは、AU関連の顔の特徴の空間スケールの変化に自動的に適応できるか?

主な発見

  • 256×192解像度のBP4Dデータベースにおいて、OFS-CNNは、網羅的サーチで得られた最良の固定フィルターサイズを上回る6%高い平均F1スコアを達成した。
  • BP4Dデータベースにおいて、OFS-CNNは平均F1スコア53.7%を達成し、6.7倍の訓練イテレーションを要する100層のGoogLeNet(53.1%)を上回った。
  • 128×96画像ではGoogLeNetの8倍以上、256×192画像では6倍以上の高速推論を実現し、優れた効率性を示した。
  • DISFAデータベースでは、OFS-CNNは平均F1スコア55.3%を達成し、ベースラインCNN(51.5%)を上回り、最先端の手法と同等またはそれを上回った。
  • OFS-CNNは、再トレーニングなしに異なる入力スケールに適応するための適切なフィルターサイズを自動で学習し、解像度の変化に対して頑健であることが示された。
  • OFS-CNNは、BP4DおよびDISFAデータベースの両方で、PL-CNN や ML-CNN を含む従来のCNNベースの手法を上回る最先端の性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。