[논문 리뷰] Deception Detection in Videos using the Facial Action Coding System
이 논문은 얼굴 동작 단위(AU)를 얼굴 동작 코딩 시스템(FACS)을 통해 추출하고 비디오 데이터에서 장기적 단기 기억(LSTM) 네트워크로 훈련시켜 위장 탐지 시스템을 제안한다. 모델은 얼굴 전용 위장 탐지에서 뛰어난 성능을 보이지만, 실제 생활 재판, 실레시아 위장, 백오브라이즈 데이터셋 간의 교차 데이터셋 훈련은 데이터셋 분포의 차이로 인해 정확도가 떨어진다.
Facts are important in decision making in every situation, which is why it is important to catch deceptive information before they are accepted as facts. Deception detection in videos has gained traction in recent times for its various real-life application. In our approach, we extract facial action units using the facial action coding system which we use as parameters for training a deep learning model. We specifically use long short-term memory (LSTM) which we trained using the real-life trial dataset and it provided one of the best facial only approaches to deception detection. We also tested cross-dataset validation using the Real-life trial dataset, the Silesian Deception Dataset, and the Bag-of-lies Deception Dataset which has not yet been attempted by anyone else for a deception detection system. We tested and compared all datasets amongst each other individually and collectively using the same deep learning training model. The results show that adding different datasets for training worsen the accuracy of the model. One of the primary reasons is that the nature of these datasets vastly differs from one another.
연구 동기 및 목표
- 얼굴 동작 단위(AU)를 얼굴 동작 코딩 시스템(FACS)에서 추출하여 얼굴 전용 위장 탐지 시스템을 개발하는 것.
- 실생활 위장 비디오 데이터에서 훈련된 LSTM 기반 딥러닝 모델의 성능을 평가하는 것.
- 실생활 재판, 실레시아 위장, 백오브라이즈 데이터셋을 통합하여 모델의 일반화 능력과 정확도에 미치는 영향을 조사하는 것.
- 자료 분포의 본질적 차이로 인해 교차 데이터셋 검증이 위장 탐지에서 어떤 도전 과제를 야기하는지 분석하는 것.
제안 방법
- 얼굴 동작 단위(AU)는 얼굴 동작 코딩 시스템(FACS)을 사용하여 비디오 프레임에서 추출되며, 이는 얼굴 근육 운동을 표준화된 방식으로 레이블링하는 방법이다.
- 장기적 단기 기억(LSTM) 순환 신경망은 위장 행동의 시간적 동역학을 모델링하기 위해 AU 시퀀스로 훈련된다.
- 모델은 자연스럽게 발생한 위장 및 진실된 비디오 기록을 포함하는 실생활 재판 데이터셋에서 훈련 및 검증된다.
- 교차 데이터셋 검증은 한 데이터셋에서 훈련하고 다른 데이터셋에서 테스트함으로써 수행되며, 이는 이전에 위장 탐지 시스템에서 결합된 바가 없는 실레시아 위장 및 백오브라이즈 데이터셋을 포함한다.
- 모든 데이터셋 간의 일관된 비교를 보장하기 위해 동일한 LSTM 아키텍처를 사용하며, 성능은 분류 정확도로 측정된다.
- 다양한 데이터셋 간 일관된 입력 표현을 확보하기 위해 데이터 증강 및 정규화 기법이 적용된다.
실험 결과
연구 질문
- RQ1실생활 재판 데이터셋에서 추출한 얼굴 동작 단위(AU)로 훈련된 LSTM 기반 모델이 위장 탐지에서 높은 정확도를 달성할 수 있는가?
- RQ2실생활 재판, 실레시아 위장, 백오브라이즈 데이터셋 간의 교차 데이터셋 훈련이 모델 성능에 어떤 영향을 미치는가?
- RQ3다양한 위장 데이터셋을 통합하여 훈련할 경우 성능 저하의 주요 원인은 무엇인가?
- RQ4위장 데이터셋 간의 분포 차이가 모델 일반화 능력을 얼마나 막는가?
주요 결과
- 실생활 재판 데이터셋에서 훈련된 LSTM 모델은 얼굴 전용 위장 탐지 접근 방식 중 뛰어난 성능 결과를 기록한다.
- 특히 실생활 재판, 실레시아 위장, 백오브라이즈 데이터셋을 통합한 교차 데이터셋 훈련은 모델 정확도에 심각한 하락을 초래한다.
- 성능 저하의 주요 원인은 주로 피험자 인구 통계, 기록 조건, 위장 유형의 차이로 인한 데이터셋 간의 상당한 분포 차이이다.
- 개별 데이터셋 평가에서는 일관된 성능가지만, 통합 훈련은 일반화에 실패하여 도메인 이동 문제를 시사한다.
- 본 연구는 위장 탐지에서 데이터셋 이질성의 과제를 부각시키며, 향후 연구는 도메인 적응 또는 데이터 정렬 기법에 초점을 맞춰야 한다고 제안한다.
- 이전 연구에서 이 세 데이터셋을 하나의 위장 탐지 프레임워크에서 결합한 바가 없어, 이는 교차 데이터셋 검증 분야에서의 새로운 기여이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.