Skip to main content
QUICK REVIEW

[논문 리뷰] Two-stream Convolutional Networks for Multi-frame Face Anti-spoofing

Zhuoyi Zhang, Cheng Jiang|arXiv (Cornell University)|2021. 08. 09.
Biometric Identification and Security참고 문헌 34인용 수 4
한 줄 요약

이 논문은 다중 프레임 RGB 입력과 RGB 차분 이미지를 활용하여 상보적인 공간-시간 특징을 캡처하는 경량화된 이중 스트림 컨volution 신경망을 제안한다. 기능 피라미드 모듈과 반대 방향 융합을 결합하고 피라미드 풀링 모듈을 적용함으로써, 파라미터 수가 현저히 적은데도 불구하고 다양한 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, 정확도와 효율성 면에서 기존 방법들을 능가한다.

ABSTRACT

Face anti-spoofing is an important task to protect the security of face recognition. Most of previous work either struggle to capture discriminative and generalizable feature or rely on auxiliary information which is unavailable for most of industrial product. Inspired by the video classification work, we propose an efficient two-stream model to capture the key differences between live and spoof faces, which takes multi-frames and RGB difference as input respectively. Feature pyramid modules with two opposite fusion directions and pyramid pooling modules are applied to enhance feature representation. We evaluate the proposed method on the datasets of Siw, Oulu-NPU, CASIA-MFSD and Replay-Attack. The results show that our model achieves the state-of-the-art results on most of datasets' protocol with much less parameter size.

연구 동기 및 목표

  • 실세계 얼굴 인식 시스템에서 생면과 위조 공격(예: 인쇄, 재생)을 구분하는 데 도전하는 것.
  • 산업 응용에서 흔히 이용 불가능한 깊이 또는 적외선과 같은 보조 데이터에 의존하지 않는 가벼운 효율적인 모델을 개발하는 것.
  • 다중 영상 프레임에서 미세한 운동 신호와 강력한 공간 패턴을 모두 캡처함으로써 특징 표현을 향상시키는 것.
  • RGB 이미지에서 반복적인 얼굴 외관 특징으로 인한 과적합을 줄이기 위해 RGB 차분 입력과 주의 메커니즘을 활용하는 것.

제안 방법

  • 모델는 이중 스트림 아키텍처를 사용한다: 한 스트림은 CNN-LSTM 기반 백본과 반대 방향 기능 피라미드 모듈(FPM) 및 피라미드 풀링 모듈(PPM)을 갖춘 다중 프레임 RGB 입력을 처리한다.
  • 다른 스트림은 연속 프레임 간의 픽셀 단위 차이로 계산된 RGB 차분 이미지를 스택하여 처리함으로써 운동과 시간적 동적 특징을 강조하면서도 얼굴 외관에 대한 과적합을 줄인다.
  • 반대 방향 융합을 가진 기능 피라미드 모듈은 다중 척도 특징 학습을 향상시켜 미세한 운동과 구조적 잡음 모두의 표현을 개선한다.
  • 피라미드 풀링 모듈은 공간 척도에 걸쳐 특징을 집계하여 얼굴 크기 및 자세 변화에 대한 강건성을 향상시킨다.
  • 브랜치 감독 전략은 RGB 차분 스트림에서 유도된 공간 주의 마스크를 다중 프레임 스트림의 특징 학습을 안내하는 데 사용하지만, 실험 결과 이 융합 방식은 제한적인 성능 향상을 가져오지 못했다.
  • 최종 예측은 두 스트림의 점수 출력을 연결하고 분류함으로써 상보적인 강점을 결합한다.

실험 결과

연구 질문

  • RQ1이중 스트림 CNN 아키텍처가 다중 프레임 RGB 및 RGB 차분 입력을 효과적으로 활용하여 얼굴 위조 방지 성능을 향상시킬 수 있는가?
  • RQ2반대 방향 융합을 가진 기능 피라미드 모듈이 자원이 제한된 환경에서 공간-시간 특징 학습을 어떻게 향상시킬 수 있는가?
  • RQ3RGB 차분 이미지를 사용함으로써 얼굴 외관에 대한 과적합은 어느 정도 감소하고, 위조 탐지에 유용한 운동 신호는 유지되는가?
  • RQ4피라미드 풀링과 기능 피라미드 모듈의 통합이 다양한 위조 방지 프로토콜 간 일반화 능력을 향상시키는가?
  • RQ5보조 데이터(예: 깊이 또는 적외선)에 의존하지 않고도 경량 모델이 최신 기술 수준 성능을 달성할 수 있는가?

주요 결과

  • 제안된 이중 스트림 모델은 SiW, Oulu-NPU, CASIA-MFSD, Replay-Attack 데이터셋의 대부분 프로토콜에서 최신 기술 수준 성능을 달성하였으며, SiW 데이터셋에서 교차 테스트 조건에서 ACER가 1.2%로 기록되었다.
  • SiW 데이터셋에서 모델의 HTER는 8.0%로 기준 단일 스트림 모델(HTER: 11.0%)과 다른 아블레이션 변형보다 뚜렷이 뛰어나 성능을 발휘했다.
  • RGB 차분 이미지를 한 스트림의 입력으로 사용함으로써 과적합이 효과적으로 감소하고 미세한 운동 아티팩트 탐지 능력이 향상되어 일반화 성능 향상에 기여하였다.
  • 아블레이션 연구에서 스타일 전이 및 노이즈 제거 방법은 교차 테스트 성능 향상을 이끌었지만, 파라미터 수가 증가하는 비용을 수반하여 정확도와 효율성 사이의 상충 관계를 보였다.
  • 브랜치 감독 전략은 교차 브랜치 주의를 통해 특징 학습을 향상시키기 위한 목적을 가졌지만 성능 향상이 없었으며, 이는 상보적 특징을 독립적으로 학습하는 것이 더 효과적임을 시사한다.
  • 모델의 컴act한 설계(수정된 MobileNetV3-Small 백본 사용) 덕분에 이전 최신 기술 수준 방법들보다 현저히 적은 파라미터로도 높은 정확도를 달성하여 산업적 구현에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.