Skip to main content
QUICK REVIEW

[논문 리뷰] Deception Detection in Videos

Zhe Wu, Bharat Singh|arXiv (Cornell University)|2017. 12. 12.
Deception detection and forensic psychology참고 문헌 18인용 수 8
한 줄 요약

이 논문은 영상, 음성, 텍스트 특징을 활용하여 법정 영상에서 은밀한 위선 탐지에 대한 완전 자동화된 다중모달 시스템을 제시한다. 영상에서 저수준의 IDT 특징과 고수준의 미세표정 예측을 조합하고, 음성 특징으로는 MFCC를 사용함으로써, 미리 보지 않은 피험자에 대해 AUC 0.877의 성능을 달성하였으며, 기존 최고 수준의 방법보다 5% 뛰어나고, 진단 기반의 미세표정 주석을 추가로 활용할 경우 AUC 0.922에 도달한다.

ABSTRACT

We present a system for covert automated deception detection in real-life courtroom trial videos. We study the importance of different modalities like vision, audio and text for this task. On the vision side, our system uses classifiers trained on low level video features which predict human micro-expressions. We show that predictions of high-level micro-expressions can be used as features for deception prediction. Surprisingly, IDT (Improved Dense Trajectory) features which have been widely used for action recognition, are also very good at predicting deception in videos. We fuse the score of classifiers trained on IDT features and high-level micro-expressions to improve performance. MFCC (Mel-frequency Cepstral Coefficients) features from the audio domain also provide a significant boost in performance, while information from transcripts is not very beneficial for our system. Using various classifiers, our automated system obtains an AUC of 0.877 (10-fold cross-validation) when evaluated on subjects which were not part of the training set. Even though state-of-the-art methods use human annotations of micro-expressions for deception detection, our fully automated approach outperforms them by 5%. When combined with human annotations of micro-expressions, our AUC improves to 0.922. We also present results of a user-study to analyze how well do average humans perform on this task, what modalities they use for deception detection and how they perform if only one modality is accessible. Our project page can be found at \url{https://doubaibai.github.io/DARE/}.

연구 동기 및 목표

  • 인간의 주석에 의존하지 않고 실제 법정 영상에서 위선을 탐지하기 위한 완전 자동화된 은밀한 시스템 개발.
  • 시각, 음성, 텍스트 모달리티가 위선 탐지 성능에 기여하는 상대적 기여도를 조사.
  • 다양한 모달리티에서 인간과 자동화된 시스템 간의 성능 격차 평가.
  • 인간이 위선 판단을 내릴 때 주로 어떤 모달리티에 의존하는지, 그리고 한 가지 모달리티만 이용할 경우 성능이 어떻게 변하는지 이해.
  • 위선 탐지 정확도 향상을 위한 하이브리드 인간-컴퓨터 시스템의 잠재력 탐색.

제안 방법

  • 시스템은 움직임의 동적 특징을 캡처하고 미세표정을 탐지하기 위해 개선된 밀도 궤적(IDT) 기반의 저수준 영상 특징을 사용한다.
  • 고수준의 미세표정 탐지는 저수준 특징을 기반으로 분류기를 훈련시켜 얻고, 그 신뢰도 점수를 고수준 특징으로 사용한다.
  • 음성 특징은 멜 주파수 푸리에 계수(MFCC)를 사용하여 추출되며, 이는 위선 탐지 성능을 크게 향상시킨다.
  • 대화록 기반 특징(텍스트)는 음성 인식 결과를 토대로 추출되지만, 시스템 성능 향상에 거의 기여하지 못한다.
  • 후기 융합 전략을 통해 시각, 음성, 텍스트 분류기의 예측을 선형 SVM를 사용해 융합하여 최종 위선 예측을 수행한다.
  • 인간 성능 평가는 아마존 메카니컬 터크(AMT) 사용자 연구를 통해 수행되었으며, 전체, 시각 전용, 음성 전용, 대화록 전용 모달리티별 별도 시험을 실시하였다.

실험 결과

연구 질문

  • RQ1실제 법정 영상에서 영상과 음성 특징만을 사용하는 완전 자동화 시스템의 위선 탐지 효과성은 어떠한가?
  • RQ2제약 없는 영상 환경에서 시각, 음성, 텍스트 모달리티가 위선 탐지 성능에 기여하는 상대적 기여도는 무엇인가?
  • RQ3다양한 모달리티를 사용할 때 인간의 평균 성능와 자동화된 시스템 간의 성능 비교는 어떻게 되는가?
  • RQ4자동화된 모델이 도출한 고수준의 미세표정 예측이 인간 주석보다 위선 탐지 과제에서 더 뛰어난 성능을 보일 수 있는가?
  • RQ5인간은 위선 판단 시 주로 어떤 모달리티에 의존하며, 한 가지 모달리티만 이용할 경우 성능은 어떻게 저하되는가?

주요 결과

  • 자동화된 시스템은 인간 주석 기반의 미세표정 정보 없이도 영상과 음성 특징만을 사용하여 AUC 0.877의 성능을 달성하였으며, 기존 최고 수준의 방법보다 5% 뛰어나다.
  • 지표 기반의 미세표정 주석을 추가로 활용할 경우 시스템의 성능은 AUC 0.922에 도달하여 이전 연구 대비 9% 향상되었다.
  • 인간이 전체 다중모달 과제를 수행할 때의 AUC는 0.8102로 나타나, 데이터셋이 인간 판단에 있어 도전적이지만 단순하지는 않음을 시사한다.
  • 인간은 대화록(70.7%)을 가장 많이 활용하며, 이는 시각(67.4%)과 음성(61.3%)을 이어받는다. 그러나 음성은 인간의 위선 탐지에서 가장 효과적인 요소이다.
  • 시각 모달리티만 제공될 경우 자동화된 시스템은 인간보다 유의미하게 뛰어난 성능(0.877 대 약 0.65)을 보이며, 이는 시스템이 미세표정을 더 잘 탐지할 수 있음을 시사한다.
  • 대화록은 인간과 자동화된 시스템 양쪽에 거의 기여하지 않으며, 음성 특징은 인간의 의사결정에 매우 효과적임을 시사한다. 이는 인간의 위선 탐지에 있어 프로소디적 신호가 핵심 요소임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.