Skip to main content
QUICK REVIEW

[論文レビュー] A Scalable Approach for Facial Action Unit Classifier Training UsingNoisy Data for Pre-Training

Alberto Fung, Daniel McDuff|arXiv (Cornell University)|Nov 14, 2019
Emotion and Mood Recognition参考文献 47被引用数 7
ひとこと要約

本論文は、多様な被験者からの自動アノテート済みでノイジィな顔面画像162,070枚を用いてシンプルなCNNを事前学習し、その後クリーンなデータで微調整するスケーラブルでオープンソースの顔の行動単位(AU)分類器のトレーニング手法を提案する。このアプローチは、DISFAデータセットにおいてSOTAのF1スコア0.60を達成し、より複雑なアーキテクチャを上回り、ノイズが多いデータでの事前学習と高い被験者多様性が一般化性能を向上させることを示している。

ABSTRACT

Machine learning systems are being used to automate many types of laborious labeling tasks. Facial actioncoding is an example of such a labeling task that requires copious amounts of time and a beyond average level of human domain expertise. In recent years, the use of end-to-end deep neural networks has led to significant improvements in action unit recognition performance and many network architectures have been proposed. Do the more complex deep neural network(DNN) architectures perform sufficiently well to justify the additional complexity? We show that pre-training on a large diverse set of noisy data can result in even a simple CNN model improving over the current state-of-the-art DNN architectures.The average F1-score achieved with our proposed method on the DISFA dataset is 0.60, compared to a previous state-of-the-art of 0.57. Additionally, we show how the number of subjects and number of images used for pre-training impacts the model performance. The approach that we have outlined is open-source, highly scalable, and not dependent on the model architecture. We release the code and data: https://github.com/facialactionpretrain/facs.

研究の動機と目的

  • 手動によるFACSコーディングの高コストと専門知識の必要性を解消するため、自動化された大規模データを用いた事前学習を活用すること。
  • ラベルの不正確さがあるにもかかわらず、ノイズのある自動アノテート済みデータで事前学習することでAU分類器の性能が向上するかどうかを調査すること。
  • 事前学習データのサイズと被験者多様性が最終的なAU認識性能に与える影響を特定すること。
  • 学術的および商業的利用を目的として、バイオグラフィックメタデータを含む大規模なオープンデータセットを公開すること。
  • ノイズのあるデータで事前学習されたシンプルなCNNアーキテクチャが、複雑な最新のモデルを上回ることを示すこと。

提案手法

  • MS-Celeb-1Mデータセットから得た162,070枚の自動アノテート済み顔面画像を、OpenFace 2.0を用いてAUアノテーション付きで標準的な畳み込みニューラルネットワーク(CNN)で事前学習する。
  • Google Knowledge Graphのバイオグラフィックデータを活用して、事前学習セット内の各被験者について性別および国籍を抽出する。
  • クリーンで手動アノテート済みのDISFAデータセットを用いて、事前学習済みモデルをAU分類のための微調整に使用する。
  • 事前学習セットにおける画像数と固有の被験者数を系統立てて変化させ、性能への影響を評価する。
  • ノイズのある事前学習と、高品質データでの教師あり微調整の2段階パイプラインを採用する。
  • 事前学習データセット、コード、およびトレーニング済みモデルをオープンライセンスの下で公開し、再利用を可能にする。

実験結果

リサーチクエスチョン

  • RQ1ノイズのある顔面画像の大量で多様なセットで事前学習することで、最新の複雑なアーキテクチャと比較してAU分類器の性能が向上するか?
  • RQ2事前学習セットにおける固有の被験者数の増加が、最終的なAU認識精度に与える影響は?
  • RQ3ノイズのあるラベルがあるにもかかわらず、事前学習における画像総数の増加が性能向上に寄与するか?
  • RQ4大規模なノイズのあるデータで事前学習されたシンプルなCNNが、より複雑なモデルを上回る性能を示せるか?
  • RQ5ノイズのある事前学習による性能向上は、顔貌の多様性にわたる一般化の向上によるものか?

主な発見

  • 提案手法はDISFAデータセットでF1スコア0.60を達成し、以前のSOTAの0.57を上回った。
  • 性能は、事前学習セットにおける画像数と固有の被験者数の両方ともに単調に向上した。
  • 元のOpenFace 2.0検出器(ノイズのあるラベルを生成した)よりも性能が優れており、ノイズの一般化が効果的であることが示された。
  • 同じ被験者の画像を増やすよりも、事前学習における被験者多様性の向上が性能向上により強い正の影響を与えた。
  • この手法はアーキテクチャに依存せず、任意のCNNに適用可能であり、広範な適用可能性を示している。
  • 1,995名の被験者、性別、国籍メタデータを含むデータセットの公開により、今後の多様性と解釈可能性に優れたAU認識研究が可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。