Skip to main content
QUICK REVIEW

[論文レビュー] Learning Pain from Action Unit Combinations: A Weakly Supervised Approach via Multiple Instance Learning

Zhanli Chen, Rashid Ansari|arXiv (Cornell University)|Dec 5, 2017
Emotion and Mood Recognition参考文献 17被引用数 3
ひとこと要約

本論文は、複数のインスタンス学習(MIL)および複数のクラスタリングされたインスタンス学習(MCIL)を用いた、弱教師ありの2段階アプローチを提案する。この手法は、顔面の動作単位(AU)の組み合わせを用いて自動的疼痛検出を実現する。フレーム単位のAU検出と、疼痛をシーケンス単位のラベルとしてモデル化することで、UNBC-McMasterデータセットで87%の正確性と0.94のAUCを達成し、優れた性能と長時間の臨床動画への一般化能力を示している。

ABSTRACT

Patient pain can be detected highly reliably from facial expressions using a set of facial muscle-based action units (AUs) defined by the Facial Action Coding System (FACS). A key characteristic of facial expression of pain is the simultaneous occurrence of pain-related AU combinations, whose automated detection would be highly beneficial for efficient and practical pain monitoring. Existing general Automated Facial Expression Recognition (AFER) systems prove inadequate when applied specifically for detecting pain as they either focus on detecting individual pain-related AUs but not on combinations or they seek to bypass AU detection by training a binary pain classifier directly on pain intensity data but are limited by lack of enough labeled data for satisfactory training. In this paper, we propose a new approach that mimics the strategy of human coders of decoupling pain detection into two consecutive tasks: one performed at the individual video-frame level and the other at video-sequence level. Using state-of-the-art AFER tools to detect single AUs at the frame level, we propose two novel data structures to encode AU combinations from single AU scores. Two weakly supervised learning frameworks namely multiple instance learning (MIL) and multiple clustered instance learning (MCIL) are employed corresponding to each data structure to learn pain from video sequences. Experimental results show an 87% pain recognition accuracy with 0.94 AUC (Area Under Curve) on the UNBC-McMaster Shoulder Pain Expression dataset. Tests on long videos in a lung cancer patient video dataset demonstrates the potential value of the proposed system for pain monitoring in clinical settings.

研究の動機と目的

  • 臨床的顔面表情分析における限られたラベル付き疼痛データの課題に対処するため、弱教師あり学習を活用する。
  • 個々のAU検出に依存するのではなく、行動単位(AUs)の組み合わせとして疼痛をモデル化することで、疼痛検出の正確性を向上させる。
  • 人間のFACSコーディングを模倣する、分離型フレームワークを構築する:まずフレーム単位でAUsを検出し、その後でシーケンス単位で疼痛を推論する。
  • 標準データセットを超えた実際の患者データに適応することで、長時間の臨床動画における効果的な疼痛モニタリングを可能にする。
  • 肺がん患者の動画を用いたデータセット間評価を通じて、システムの一般化能力とロバスト性を示す。

提案手法

  • 動画シーケンスからのフレーム単位のAU検出に、最先端の自動顔面表情認識(AFER)ツールを用いる。
  • フレーム単位のAUスコアからAUの組み合わせを符号化する2つの新しいデータ構造—Compact-MILおよびClustered-MCIL—を構築する。
  • 複数のインスタンス学習(MIL)および複数のクラスタリングされたインスタンス学習(MCIL)を用い、ラベルがシーケンス単位に割り当てられる弱教師あり問題として疼痛検出をモデル化する。
  • MCILフレームワークでガウス・ミックス(GM)近似を採用し、特徴のスパarsityを向上させ、マージン分離を改善する。
  • フレーム単位のAUアノテーションとシーケンス単位の疼痛ラベルを用いて、UNBC-McMaster Shoulder Pain Expressionデータセットでシステムを学習する。
  • 肺がん患者データセットの長時間の動画サブシーケンスでシステムをテストし、AUの組み合わせに関する人間の専門家コンSENSUSと予測を比較する。

実験結果

リサーチクエスチョン

  • RQ1個々のAUベースのアプローチと比較して、疼痛を行動単位(AUs)の組み合わせとしてモデル化することで、検出正確性が向上するか?
  • RQ2シーケンス単位のラベルしか入手できない状況下で、MILおよびMCILによる弱教師あり学習は、疼痛検出においてどの程度効果的か?
  • RQ3提案された分離型フレームワーク(AU検出 → AUの組み合わせモデル化)は、エンドツーエンドのバイナリ疼痛分類器と比較して、より優れた性能を達成するか?
  • RQ4本システムは、長時間の臨床動画に一般化可能で、多様な患者集団において人間の専門家アノテーションと一貫性を保てるか?
  • RQ5クラスタリングされた表現による特徴のスパarsityは、モデルの性能向上および人間のコーディング意思決定との整合性向上にどの程度寄与するか?

主な発見

  • 提案されたシステムは、Compact-MILフレームワークを用いて、UNBC-McMaster Shoulder Pain Expressionデータセットで87%の疼痛認識正確性と0.94のAUCを達成した。
  • Clustered-MCILバージョンは、AUC(0.94 vs. 0.92)においてCompact-MILを上回り、特徴のスパarsityとマージン分離の向上が要因とされた。
  • 肺がん患者データセットの長時間の動画サブシーケンスでは、少なくとも3人の専門家のうち2人以上が疼痛を特定したケースに対して、人間のコーダーと82.9%の一貫性を示した。
  • 信頼性が低いケースでは1人のコーダーとの一致率が68.6%にとどまり、アノテーションの曖昧さにもかかわらず、システムのロバスト性が裏付けられた。
  • 全3名のコーダーに対して、否定的(疼痛なし)のケースで88.9%の一貫性を示し、未観測の臨床データへの一般化能力が強く示された。
  • AU検出と疼痛推論を分離する構造により、不確実性や潜在的疼痛表現の処理がより効果的になり、性能向上が達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。