Skip to main content
QUICK REVIEW

[논문 리뷰] FAB: A Robust Facial Landmark Detection Framework for Motion-Blurred Videos

Keqiang Sun, Wayne Wu|arXiv (Cornell University)|2019. 10. 26.
Face recognition and analysis참고 문헌 42인용 수 11
한 줄 요약

이 논문은 움직임 흐림 영상에서 강건한 얼굴 랜드마크 검출 프레임워크인 FAB를 제안한다. 이 프레임워크는 시간적 구조 일관성을 활용하여 탈블러링과 랜드마크 검출을 반복적으로 향상시킨다. 과거 프레임의 구조 예측기를 통해 얼굴 윤곽을 추정함으로써, 탈블러링된 이미지가 더 나은 랜드마크를 생성하고, 그 결과로 향후 구조 예측이 향상되는 선순환을 가능하게 한다. 이로 인해 Blurred-300VW와 RWMB 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Recently, facial landmark detection algorithms have achieved remarkable performance on static images. However, these algorithms are neither accurate nor stable in motion-blurred videos. The missing of structure information makes it difficult for state-of-the-art facial landmark detection algorithms to yield good results. In this paper, we propose a framework named FAB that takes advantage of structure consistency in the temporal dimension for facial landmark detection in motion-blurred videos. A structure predictor is proposed to predict the missing face structural information temporally, which serves as a geometry prior. This allows our framework to work as a virtuous circle. On one hand, the geometry prior helps our structure-aware deblurring network generates high quality deblurred images which lead to better landmark detection results. On the other hand, better landmark detection results help structure predictor generate better geometry prior for the next frame. Moreover, it is a flexible video-based framework that can incorporate any static image-based methods to provide a performance boost on video datasets. Extensive experiments on Blurred-300VW, the proposed Real-world Motion Blur (RWMB) datasets and 300VW demonstrate the superior performance to the state-of-the-art methods. Datasets and models will be publicly available at https://keqiangsun.github.io/projects/FAB/FAB.html.

연구 동기 및 목표

  • 움직임 흐림 영상에서 구조적 세부 정보가 손실되어 기존 방법이 실패하는 상황에서 정확한 얼굴 랜드마크 검출에 도전한다.
  • 탈블러링과 랜드마크 검출 간의 '닭이 먼저인지 계란이 먼저인지' 문제를 얼굴 구조의 시간적 일관성을 활용해 해결한다.
  • 정적 이미지 랜드마크 검출기의 성능을 향상시키기 위해 탈블러링과 구조 예측 기능을 통합한 유연한 영상 기반 프레임워크를 개발한다.
  • 움직임 흐린 영상 데이터에서의 성능 평가를 위해 새로운 벤치마크 데이터셋 두 개—Blurred-300VW와 Real-world Motion Blur (RWMB)—을 제안한다.
  • 각 구성 요소 간의 상호의존성을 최적화하기 위해 교대 미세조정 전략을 활용한 엔드 투 엔드 학습을 가능하게 한다.

제안 방법

  • 이전 두 프레임의 경계 지도에서 옵티컬 플로우 외삽을 통해 현재 프레임의 얼굴 윤곽을 추정하는 구조 예측기를 제안한다.
  • 예측된 얼굴 윤곽과 입력 블러 프레임을 융합하는 경계 인식 탈블러링 네트워크를 사용하여 선명한 이미지를 생성한다.
  • 탈블러링 출력에 대해 작동하는 교체 가능한 얼굴 랜드마크 검출 네트워크를 통합하여 최신 기술 수준의 모델과 즉시 통합 가능한 플러그 앤 플레이 호환성을 확보한다.
  • 현재 프레임의 랜드마크 예측 결과를 바탕으로 다음 프레임의 구조 예측기를 향상시키는 피드백 루프를 수립한다.
  • 예측된 옵티컬 플로우를 사용해 이전 프레임을 정렬하는 워핑 블록을 도입하여 구조 예측의 시간적 일관성을 확보한다.
  • 개별 사전학습 후 교대 미세조정 전략을 적용하여 구조 예측기, 탈블러링 네트워크, 랜드마크 검출기의 세 구성 요소를 함께 최적화한다.

실험 결과

연구 질문

  • RQ1얼굴 구조의 시간적 일관성을 활용하여 움직임 흐린 영상에서의 랜드마크 검출 성능을 향상시킬 수 있는가?
  • RQ2이전 프레임의 옵티컬 플로우 외삽 기반 구조 예측기가 탈블러링에 기하학적 사전 지식을 제공하는 데 얼마나 효과적인가?
  • RQ3탈블러링과 랜드마크 검출 간 피드백 루프는 단독으로 작동하는 방법보다 성능 향상에 뚜렷한 기여를 하는가?
  • RQ4FAB 프레임워크는 정적 이미지 랜드마크 검출기의 성능을 영상 데이터에 적용했을 때 얼마나 향상시킬 수 있는가?
  • RQ5제안된 Blurred-300VW와 RWMB 데이터셋은 기존 벤치마크와 비교해 움직임 흐림에 대한 강건성 평가에 더 현실적이고 도전적인 기준을 제공하는가?

주요 결과

  • FAB 프레임워크는 Blurred-300VW의 도전적인 서브셋에서 정규화 평균 오차(NME) 7.54%를 달성하여 기준 방법(14.91%)과 최신 기술 수준의 탈블러링 + 검출 파이프라인을 크게 앞서나간다.
  • ResNet-18을 백본으로 사용할 때, 시간적 플로우 외삽 기반의 구조 예측기가 사전 학습된 랜드마크 검출기를 구조 소스로 사용하는 것보다 NME를 49.43% 감소시킨다.
  • 프레임워크는 다양한 최신 기술 수준의 랜드마크 검출기를 향상시킨다: FAN, SAN, RFLD, LAB 모두 NME에서 뚜렷한 개선을 보이며, RFLD의 경우 NME가 41.24%에서 20.07%로 향상된다.
  • 구조 인식 탈블러링 네트워크는 최신 기술 수준의 탈블러링 방법보다 더 높은 PSNR와 SSIM 성능을 기록하여 제안된 기하학적 사전 지식의 효과를 입증한다.
  • 교대 미세조정 전략은 일관된 성능 향상을 이끌어내어 세 구성 요소의 공동 최적화의 유용성을 확인한다.
  • 제안된 RWMB와 Blurred-300VW 데이터셋은 얼굴 랜드마크 검출에서의 움직임 흐림에 대한 강건성 평가에 더 현실적이고 도전적인 기준을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.