Skip to main content
QUICK REVIEW

[論文レビュー] Automated Detection of Equine Facial Action Units

Zhenghong Li, Sofia Broomé|arXiv (Cornell University)|Feb 17, 2021
Human-Animal Interaction Studies参考文献 21被引用数 9
ひとこと要約

本論文は、領域ベースの物体検出と二値分類を用いた深層学習ベースの段階的フレームワークを提案し、馬の顔面行動単位(AUs)の自動検出を実現する。眼および下顔領域の9つのAUsにおいて、事前に定義された注目領域(ROIs)を用いることで、モデルの注目度と精度が向上し、EquiFACSによる手作業によるラベリング作業の自動化の可能性を示している。

ABSTRACT

The recently developed Equine Facial Action Coding System (EquiFACS) provides a precise and exhaustive, but laborious, manual labelling method of facial action units of the horse. To automate parts of this process, we propose a Deep Learning-based method to detect EquiFACS units automatically from images. We use a cascade framework; we firstly train several object detectors to detect the predefined Region-of-Interest (ROI), and secondly apply binary classifiers for each action unit in related regions. We experiment with both regular CNNs and a more tailored model transferred from human facial action unit recognition. Promising initial results are presented for nine action units in the eye and lower face regions. Code for the project is publicly available.

研究の動機と目的

  • 馬の顔面行動単位(AUs)の手作業によるラベリング作業を自動化すること。EquiFACSで定義されたものに基づく。
  • 人間のAUs認識で訓練された深層学習モデルが、解剖学的差異があるにもかかわらず馬に適用可能かどうかを調査すること。
  • 注目領域(ROI)のクロッピングと物体検出が、AUs分類精度に与える有効性を評価すること。
  • 静止画像ベースのAUs検出の限界、特に瞬きのような微細または時間的感度の高い行動(例:瞬き)についての評価。
  • フレームワークを動画に拡張し、瞬きや耳の動きのような動的AUsを検出する可能性を検討すること。

提案手法

  • 二段階の段階的フレームワーク:まず、物体検出器が馬の顔面における事前に定義された注目領域(ROIs)(例:目領域、下顔領域)を特定する。
  • 次に、クロップされたROIsに二値分類器を適用し、個々のAUsを検出する。標準的なCNN(例:AlexNet)と、人間のAUs認識から微調整されたモデルを用いる。
  • 事前学習済みの人間の顔面AUs認識モデルからの転移学習を採用し、馬のデータに対する性能を向上させる。
  • Grad-CAM可視化を用いてモデルの注目度を分析・検証し、分類器が関連のある顔面部分に注目していることを保証する。
  • 5分割交差検証を用いて、小規模で不均衡なデータセット上で性能を評価し、正解率とF1スコアなどの指標を用いる。
  • 全フレームでのエンドツーエンド学習とROIsでの学習を比較し、空間的監視の影響を評価する。

実験結果

リサーチクエスチョン

  • RQ1人間の顔面AUs認識で訓練された深層学習モデルが、解剖学的差異があるにもかかわらず、馬の顔面AUs検出に効果的に転送可能か?
  • RQ2事前に定義された注目領域(ROIs)を用いることで、馬におけるAUs分類器の性能と注目度の安定性が顕著に向上するか?
  • RQ3標準的なCNNと転移学習されたモデルは、静止画像における馬のAUs検出において、どのように比較されるか?
  • RQ4瞬き(AU47、AU145)のような時間的感度の高い行動に対して、静止画像ベースのAUs検出の限界は何か?
  • RQ5フレームワークを動画シーケンスからの耳行動記述子(EADs)や動的顔の表情検出に拡張可能か?

主な発見

  • フレームワークは、AU101を除く8つのAUsで安定した性能を示し、正解率は49.6%〜65.2%、F1スコアは47.9%〜64.0%の範囲であった。
  • AU101(内眉上昇)では、DRMLモデルを用いて65.2%の正解率と64.0%のF1スコアを達成し、ROIsを用いた場合にGrad-CAM可視化で正しい内眉領域に注目していることが確認された。
  • DRMLモデルは、AlexNetに比べて被験者フォールド全体でより安定した性能を示し、特に視覚的に類似するAU145(瞬き)とAU47(半瞬き)において顕著であった。
  • AU47は静止画像上での視覚的差が微細なため、モデルが困難を示した。信頼性のある検出には動画による時間的モデリングが必要であると考えられる。
  • 静止画像上では、AU145(瞬き)とAU143(目を閉じる)が同一の視覚的状態を示すため、モデルはそれらを区別できなかったが、AU143はサンプル数が少なかったため除外された。
  • Grad-CAM可視化により、ROIsで学習したモデルが関連する顔面部分(例:まぶた、鼻孔、口角)に注目していることが確認されたのに対し、全フレームで学習したモデルは重要な領域に注目できていなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。