[논문 리뷰] Surveillance Face Presentation Attack Detection Challenge
이 논문은 CVPR 2023에서 실시된 감시 영상 얼굴 스푸핑 공격 탐지 챌린지에 대해 기술하며, 실제 장거리 조건에서 7대의 감시 카메라로 101명의 피험자로부터 촬영한 10,195개의 영상으로 구성된 SuHiFiMask 데이터셋을 소개한다. 챌린지는 품질 변동에 대한 강건성에 대해 37개 팀을 평가하였으며, 최상위 모델은 최소 4.73%의 ACER를 기록하여 대규모 고해상도 감시 데이터의 효과를 입증하였다. 이는 실제 환경에서의 얼굴 반사도 방지 기술 발전에 기여한다.
Face Anti-spoofing (FAS) is essential to secure face recognition systems from various physical attacks. However, most of the studies lacked consideration of long-distance scenarios. Specifically, compared with FAS in traditional scenes such as phone unlocking, face payment, and self-service security inspection, FAS in long-distance such as station squares, parks, and self-service supermarkets are equally important, but it has not been sufficiently explored yet. In order to fill this gap in the FAS community, we collect a large-scale Surveillance High-Fidelity Mask (SuHiFiMask). SuHiFiMask contains $10,195$ videos from $101$ subjects of different age groups, which are collected by $7$ mainstream surveillance cameras. Based on this dataset and protocol-$3$ for evaluating the robustness of the algorithm under quality changes, we organized a face presentation attack detection challenge in surveillance scenarios. It attracted 180 teams for the development phase with a total of 37 teams qualifying for the final round. The organization team re-verified and re-ran the submitted code and used the results as the final ranking. In this paper, we present an overview of the challenge, including an introduction to the dataset used, the definition of the protocol, the evaluation metrics, and the announcement of the competition results. Finally, we present the top-ranked algorithms and the research ideas provided by the competition for attack detection in long-range surveillance scenarios.
연구 동기 및 목표
- 장거리 조건에서의 대규모, 현실적인 감시 기반 얼굴 반사도 방지 데이터셋의 부족을 보완한다.
- 이미지 품질, 신원, 공격 유형 등의 실제 환경 변동 조건에서 FAS 알고리즘 평가를 위한 표준화된 벤치마크 프로토콜을 개발한다.
- 엄격한 평가를 포함한 경쟁적 챌린지를 통해 원격 감시 환경에서의 얼굴 프레젠테이션 어택 탐지 기술의 연구 진전을 이끈다.
- 공공 감시 환경에서 흔히 발생하는 저해상도, 운동 왜곡, 가림 현상에 대응할 수 있는 강건한 모델 개발을 가능하게 한다.
제안 방법
- 다양한 조명, 날씨, 자세 조건에서 7대의 주요 감시 카메라를 활용해 101명의 피험자로부터 촬영한 10,195개의 영상으로 구성된 대규모 데이터셋인 SuHiFiMask를 수집하였다.
- 알고리즘 일반화 능력을 테스트하기 위해 ID 이동, 마스크 유형 이동, 이미지 품질 변동을 포함한 다중 프로토콜 평가 프레임워크를 설계하였다.
- 특징 구분을 위해 교차 엔트로피 손실 및 아 angular margin 손실(ArcFace)을 사용한 표준 딥러닝 학습을 수행하였으며, 백본 네트워크(예: Swin-Tiny, Swin-Base)를 활용하였다.
- 모델 일반화 능력 향상과 과적합 방지를 위해 데이터 증강 및 클래스 균형 기법을 적용하였다.
- AdamW 옵timizer를 사용하고 학습률 스케줄링에 코즈인 디케이를 적용하며 조기 정지 기법을 통해 수렴성 향상과 과적합 방지를 도모하였다.
- 최종 모델 평가는 CodaLab를 통해 보류된 테스트 세트에서 수행되었으며, 조직측의 재확인을 통해 공정한 순위 확보를 보장하였다.

실험 결과
연구 질문
- RQ1저해상도 및 열악한 이미지 품질 조건에서 장거리 감시 환경에서 최신 기술의 얼굴 반사도 방지 모델은 어떤 성능을 보이는가?
- RQ2감시 환경에서 ID 이동, 공격 유형 이동, 이미지 품질 변동 조건에서 모델 성능은 얼마나 저하되는가?
- RQ3SuHiFiMask와 같은 대규모 고해상도 데이터셋은 실제 배포 환경에서 FAS 모델의 강건성과 일반화 능력을 크게 향상시킬 수 있는가?
- RQ4제한된 이미지 품질을 가진 어려운 감시 환경에서 얼굴 반사도 방지에 가장 효과적인 아키텍처 및 학습 전략은 무엇인가?
- RQ5데이터 전처리 및 다중 브랜치 특징 학습은 감시 FAS 벤치마크에서 모델의 안정성과 성능 향상에 어떤 기여를 하는가?
주요 결과
- 최상위 성능을 기록한 팀(MateoH)은 ACER 4.73%를 기록하여 장거리 감시 환경에서의 스푸핑 공격에 대한 강건성과 일반화 능력이 뛰어나다는 것을 입증하였다.
- 상위 9개 팀 중 8개 팀이 산업계 소속이었으며, 이는 감시 기반 FAS가 상용 응용 분야에서 실질적인 중요성을 지닌다는 점을 시사한다.
- 상위 9개 팀의 ACER 점수 범위는 4.73%에서 12.00%까지 다양했으며, 이는 성능 격차가 뚜렷하고 챌린지의 난이도가 높다는 것을 확인시켰다.
- 대규모 백본 네트워크(Swin-Tiny, Swin-Base 등)가 소규모 모델보다 뛰어난 성능을 보여, 저품질 감시 데이터 처리에 있어 모델 규모가 핵심 요소임을 입증하였다.
- 다중 브랜치 특징 학습 및 데이터 증강 기법이 널리 채택되었으며, 이는 모델의 안정성과 성능 향상에 기여하였다.
- 본 챌린지는 현재 FAS 모델이 극심한 품질 저하 상황에서는 여전히 어려움을 겪고 있음을 보여주었으며, 향후 연구에서는 고급 슈퍼 리졸루션 및 특징 복구 기법의 필요성을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.