[論文レビュー] Deception Detection in Videos
本論文は、視覚、音声、テキスト特徴を用いた、完全自動でマルチモーダルな隠れ偽善検出を行うシステムを提示する。動画の低レベル特徴(IDT)と高レベルの微表情予測、およびMFCC音声特徴を統合することで、未観測の被験者に対してAUC 0.877を達成し、最先端手法を5%上回り、真の微表情アノテーションを組み合わせるとAUC 0.922にまで向上する。
We present a system for covert automated deception detection in real-life courtroom trial videos. We study the importance of different modalities like vision, audio and text for this task. On the vision side, our system uses classifiers trained on low level video features which predict human micro-expressions. We show that predictions of high-level micro-expressions can be used as features for deception prediction. Surprisingly, IDT (Improved Dense Trajectory) features which have been widely used for action recognition, are also very good at predicting deception in videos. We fuse the score of classifiers trained on IDT features and high-level micro-expressions to improve performance. MFCC (Mel-frequency Cepstral Coefficients) features from the audio domain also provide a significant boost in performance, while information from transcripts is not very beneficial for our system. Using various classifiers, our automated system obtains an AUC of 0.877 (10-fold cross-validation) when evaluated on subjects which were not part of the training set. Even though state-of-the-art methods use human annotations of micro-expressions for deception detection, our fully automated approach outperforms them by 5%. When combined with human annotations of micro-expressions, our AUC improves to 0.922. We also present results of a user-study to analyze how well do average humans perform on this task, what modalities they use for deception detection and how they perform if only one modality is accessible. Our project page can be found at \url{https://doubaibai.github.io/DARE/}.
研究の動機と目的
- 人間のアノテーションに依存せずに、実際の裁判所動画における偽善を検出する完全自動で隠れ性のあるシステムの開発。
- 視覚、音声、テキストモダリティが偽善検出性能に与える相対的寄与度を調査すること。
- 異なるモダリティにおいて、人間と自動化システムの性能格差を評価すること。
- 人間が偽善判断を行う際に主にどのモダリティに依存しているか、および1つのモダリティのみが利用可能な場合の性能低下の程度を理解すること。
- 偽善検出の精度を向上させるためのハイブリッド人間-コンピュータシステムの可能性を調査すること。
提案手法
- システムは、動きのダイナミクスを捉え、微表情を検出するため、改善版密度トラジェクトリ(IDT)に基づく低レベルの動画特徴を用いる。
- 高レベルの微表情検出は、低レベル特徴を用いて分類器を学習し、その信頼度スコアを高レベル特徴として利用する。
- 音声特徴はメル周波数ケプストラム係数(MFCC)を用いて抽出され、偽善検出性能を顕著に向上させる。
- トランスクリプトベースの特徴(テキスト)は、音声認識によるテキスト変換から抽出されるが、システム全体の性能向上にほとんど寄与しない。
- 視覚、音声、テキスト分類器の予測を、最終的な偽善予測のために線形SVMを用いてラテナル融合で統合する。
- 人間の性能は、アマゾン・メカニカル・トル(AMT)を用いたユーザー調査により評価され、全モダリティ、視覚のみ、音声のみ、トランスクリプトのみの別々の試行が実施された。
実験結果
リサーチクエスチョン
- RQ1実際の裁判所動画における偽善検出に、動画と音声特徴のみを用いた完全自動システムはどの程度有効であるか?
- RQ2制約のない動画環境下で、視覚、音声、テキストモダリティが偽善検出性能に与える相対的寄与度は何か?
- RQ3異なるモダリティを用いた場合、平均的な人間の性能は自動化システムと比べてどの程度か?
- RQ4自動モデルが予測する高レベルの微表情スコアは、人間のアノテーションを上回る性能を示せるか?
- RQ5人間は偽善判断において主にどのモダリティに依存しているか?また、1つのモダリティのみが利用可能な場合、性能はどの程度低下するか?
主な発見
- 自動システムは、微表情のアノテーションなしに動画と音声特徴のみを用いてAUC 0.877を達成し、最先端手法を5%上回る。
- 真の微表情アノテーションを組み合わせると、AUC 0.922にまで向上し、過去の研究比で9%の改善を達成する。
- 人間の全モダリティタスクにおける性能はAUC 0.8102を示し、データセットが人間の判断にとって挑戦的ではあるが、非自明ではないことを示している。
- 人間は70.7%の割合でトランスクリプト(テキスト)に依存し、次に視覚(67.4%)、音声(61.3%)の順に依存しているが、音声が人間の偽善検出において最も効果的である。
- 視覚モダリティのみの場合、自動システムは人間を著しく上回る(AUC 0.877 対 約 0.65)ことから、システムが微表情を検出する能力に優れていることが示される。
- トランスクリプトは人間および自動システムの両方にとってほとんど利益をもたらさないが、音声特徴は人間の意思決定において顕著に効果的である。これは、人間の偽善検出においてプロソディック・キューブ(発音のリズムや抑揚)が極めて重要であることを示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。