Skip to main content
QUICK REVIEW

[논문 리뷰] Static and Dynamic Fusion for Multi-modal Cross-ethnicity Face Anti-spoofing

Ajian Liu, Zichang Tan|arXiv (Cornell University)|2019. 12. 05.
Biometric Identification and Security참고 문헌 36인용 수 10
한 줄 요약

이 논문은 정적-동적 융합 네트워크(SD-Net)와 부분 공유 다중모달 네트워크(PSMM-Net)를 제안하여 정적-동적 융합 및 다중모달 융합을 통해 강인성을 향상시키고, 순위 풀링을 이용해 생성된 동적 이미지를 활용하여 이질적 인종 간 얼굴 위조 방지 기술을 개선한다. 제안된 방법은 CASIA-SURF CeFA, OULU-NPU, SiW, CASIA-SURF 등 여러 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하였으며, 새로운 벤치마크 데이터셋에서 ACER가 최소 0.35%에 이를 정도로 뛰어난 성능을 보였다.

ABSTRACT

Regardless of the usage of deep learning and handcrafted methods, the dynamic information from videos and the effect of cross-ethnicity are rarely considered in face anti-spoofing. In this work, we propose a static-dynamic fusion mechanism for multi-modal face anti-spoofing. Inspired by motion divergences between real and fake faces, we incorporate the dynamic image calculated by rank pooling with static information into a conventional neural network (CNN) for each modality (i.e., RGB, Depth and infrared (IR)). Then, we develop a partially shared fusion method to learn complementary information from multiple modalities. Furthermore, in order to study the generalization capability of the proposal in terms of cross-ethnicity attacks and unknown spoofs, we introduce the largest public cross-ethnicity Face Anti-spoofing (CASIA-CeFA) dataset, covering 3 ethnicities, 3 modalities, 1607 subjects, and 2D plus 3D attack types. Experiments demonstrate that the proposed method achieves state-of-the-art results on CASIA-CeFA, CASIA-SURF, OULU-NPU and SiW.

연구 동기 및 목표

  • 기존 얼굴 위조 방지 기법들이 동적 시간 정보와 이질적 인종 일반화를 고려하지 않은 점을 보완한다.
  • 수작업 특징 추출 및 단일 모달리티 딥러닝 기법의 한계를 극복하기 위해 실제 얼굴과 위조 얼굴 간의 운동 이질성 정보를 통합한다.
  • RGB, 깊이, 적외선 모달리티 간 상보적인 특징을 효과적으로 학습하기 위해 부분 공유 다중모달 네트워크를 개발한다.
  • 세 가지 인종에 걸쳐 1607명의 주체를 포함하고 2D/3D 프린트, 재생, 실리카 젤 등 네 가지 공격 유형을 수용하는 가장 큰 공개 이질적 인종 간 얼굴 위조 방지 데이터셋인 CASIA-SURF CeFA를 도입한다.

제안 방법

  • 비디오 시퀀스에서 순위 풀링을 이용해 동적 이미지를 생성함으로써 각 모달리티(RGB, 깊이, 적외선)에 대해 정적 및 동적 특징을 동시에 학습하는 SD-Net을 제안한다.
  • 순위 풀링을 활용해 실제 얼굴과 위조 얼굴 간의 운동 이질성을 계산함으로써 인간이 지정한 운동 신호 없이도 시간적 동적 특징을 포착한다.
  • 모달리티별 특징 학습과 공유 특징 학습을 동시에 가능하게 하기 위해 부분 공유 브랜치를 설계하여 상보적이고 관련된 특징 추출을 향상시킨다.
  • 다양한 단계에서 모달리티 간 상호작용을 가능하게 하기 위해 PSMM-Net 내부에 초기 융합 및 후기 융합 전략을 구현함으로써 특징 표현을 향상시킨다.
  • 감독 학습과 전이 학습의 조합을 활용하여 모델을 훈련 및 평가하며, CASIA-SURF CeFA에서의 사전 훈련을 포함한다.
  • 교차 엔트로피 손실과 메트릭 학습을 활용한 다단계 훈련 파이프라인을 구현하여 실제 및 위조 샘플 간의 분류 성능 최적화를 도모한다.

실험 결과

연구 질문

  • RQ1순위 풀링을 통해 유도된 동적 이미지 특징이 실제 얼굴과 위조 얼굴 간의 운동 이질성을 포착함으로써 위조 방지 성능 향상에 기여하는가?
  • RQ2제안된 부분 공유 다중모달 네트워크(PSMM-Net)가 RGB, 깊이, 적외선 모달리티 간 상보적이고 관련된 특징을 얼마나 효과적으로 학습하는가?
  • RQ3기존 최신 기술 수준(SOTA) 기법들과 비교해 본다면, 제안된 방법이 다양한 인종과 예측되지 않은 공격 유형에 대해 얼마나 잘 일반화되는가?
  • RQ4다양한 모달리티와 공격 다양성을 지닌 다양한 데이터셋에서 제안된 방법의 성능는 어떻게 변화하는가?
  • RQ5신규 도입된 CASIA-SURF CeFA 데이터셋이 이질적 인종 일반화를 평가하는 데 신뢰할 수 있는 기준이 될 수 있는가?

주요 결과

  • 제안된 SD-Net은 CASIA-SURF CeFA 데이터셋에서 ACER가 0.35%를 기록하여, 동일한 사전 훈련 전략을 사용한 두 번째로 우수한 방법(STASN)보다 ACER에서 0.05% 우수한 성능을 보였다.
  • OULU-NPU 프로토콜 3(다른 기기 간 일반화)에서 SD-Net은 사전 훈련 없이도 ACER가 2.1%를 기록하여 STASN의 2.8%를 초월하였으며, 강력한 제로샷 일반화 성능을 입증하였다.
  • SiW 프로토콜 2 및 3에서 동일한 사전 훈련 조건 하에 각각 최고의 ACER 점수인 0.15%와 4.90%를 기록하여 다양한 환경에서의 강인성을 확인하였다.
  • 다중모달 융합을 통한 PSMM-Net은 모든 테스트 데이터셋에서 성능 향상을 크게 이룩하였으며, 특히 이질적 인종 및 이질적 공격 유형 일반화 시나리오에서 두드러진 성능 향상을 보였다.
  • 아프리카, 동아시아, 중앙아시아의 세 인종에 걸쳐 1607명의 주체를 포함하는 CASIA-SURF CeFA 데이터셋은 얼굴 위조 방지에서 이질적 인종 효과에 대한 첫 번째 종합적 연구를 가능하게 하였다.
  • 절단 실험 결과 동적 이미지 특징이 성능 향상에 기여하는 것으로 확인되었으며, 다양한 벤치마크에서 정적 특징 전용 기반 모델 대비 ACER가 1% 이상 향상된 성능을 기록하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.