Skip to main content
QUICK REVIEW

[논문 리뷰] Face Parsing via Recurrent Propagation

Sifei Liu, Jianping Shi|arXiv (Cornell University)|2017. 08. 06.
Face recognition and analysis참고 문헌 25인용 수 8
한 줄 요약

이 논문은 효율적이고 정확한 픽셀 단위 분할을 위한 경량화된 얼굴 파싱 프레임워크를 제안한다. 얕은 CNN과 공간적으로 변형된 순환 신경망(RNN)을 조합하여, 의미적 에지 정보에 의해 안내되는 전역적인 레이블 전파를 가능하게 하였다. 이로 인해 단일 GPU에서 300 FPS의 실시간 성능을 달성하면서도, 특히 세분화된 얼굴 구성 요소를 다루는 데 있어 최신 기술들을 능가하는 정확도와 효율성을 확보하였다. 이는 이중 단계 접근 방식을 통해 달성되었다.

ABSTRACT

Face parsing is an important problem in computer vision that finds numerous applications including recognition and editing. Recently, deep convolutional neural networks (CNNs) have been applied to image parsing and segmentation with the state-of-the-art performance. In this paper, we propose a face parsing algorithm that combines hierarchical representations learned by a CNN, and accurate label propagations achieved by a spatially variant recurrent neural network (RNN). The RNN-based propagation approach enables efficient inference over a global space with the guidance of semantic edges generated by a local convolutional model. Since the convolutional architecture can be shallow and the spatial RNN can have few parameters, the framework is much faster and more light-weighted than the state-of-the-art CNNs for the same task. We apply the proposed model to coarse-grained and fine-grained face parsing. For fine-grained face parsing, we develop a two-stage approach by first identifying the main regions and then segmenting the detail components, which achieves better performance in terms of accuracy and efficiency. With a single GPU, the proposed algorithm parses face images accurately at 300 frames per second, which facilitates real-time applications.

연구 동기 및 목표

  • 딥 컨volution 신경망 기반 얼굴 파싱 방법의 높은 계산 비용과 메모리 요구량을 해결하기 위해.
  • 정확도를 희생시키지 않고도 얼굴 파싱에 대한 실시간 추론을 가능하게 하기 위해.
  • 기존 모델에서 잘 표현되지 않는 작은 세분화된 얼굴 구성 요소(예: 눈, 눈썹)에 대한 파싱 성능 향상을 위해.
  • 모델 복잡도와 파arameter 수를 줄이면서도 높은 분할 정확도를 유지하기 위해.
  • 세부 얼굴 부위에 대한 성능 향상을 위해 국소화되고 균형 잡힌 학습을 가능하게 하는 효율적인 이중 단계 프레임워크 개발하기 위해.

제안 방법

  • 지역적 특징을 추출하고 레이블 전파를 안내하기 위한 의미적 에지 맵을 생성하기 위해 얕은 CNN을 사용한다.
  • 공간적으로 변형된 RNN을 도입하여, 재귀 게이트가 국소 일관성에 기반해 전파 강도를 동적으로 제어함으로써 최소한의 파arameter로 전역 추론을 가능하게 한다.
  • RNN 모듈은 레이블 일관성이 있는 영역에서의 부족한 공간 정보를 활용하여 예측된 레이블을 이미지 전반에 걸쳐 전파한다.
  • 세분화된 파싱을 위해 이중 단계 접근 방식을 사용한다: 첫 번째 단계에서는 전체 네트워크를 사용해 주요 얼굴 영역을 분할하고, 두 번째 단계에서는 크롭된 얼굴 하위 영역을 경량 하위 네트워크로 처리하여 작은 구성 요소의 정확도를 향상시킨다.
  • 공간적으로 변형된 게이트는 얕은 CNN의 저수준 및 중수준 특징에 기반하여 엔드 투 엔드로 학습된다.
  • 전체 프레임워크는 엔드 투 엔드로 훈련되며, 11개 클래스의 파싱에 대해 단일 GPU에서 300 FPS로 추론가능하다.

실험 결과

연구 질문

  • RQ1계산 비용을 줄이고 정확도를 유지하면서도 실시간으로 작동하는 경량화된 얼굴 파싱 모델을 설계할 수 있는가?
  • RQ2표준 RNN이나 CRF 후처리 기법과 비교해 볼 때, 공간적으로 변형된 순환 전파 방식이 전역적인 레이블 일관성 향상에 얼마나 효과적인가?
  • RQ3이중 단계 네트워크 아키텍처가 단일 통합 모델에 비해 작은 세분화된 얼굴 구성 요소의 파싱 정확도를 크게 향상시킬 수 있는가?
  • RQ4두 번째 단계에서 크롭된 하위 영역을 사용할 경우, 세부 얼굴 부위에 대한 학습 효율성과 정확도 향상 정도는 어느 정도인가?
  • RQ5최신 기술 기반의 CNN 기반 얼굴 파싱 네트워크와 비교해 볼 때, 제안된 방법은 속도와 정확도 측면에서 어떤가?

주요 결과

  • 제안된 RNN-G 모델은 HELEN 데이터셋에서 전체 F-측정치 88.6%를 기록하여 이전 최고 기술 대비 오차율 20% 감소를 달성하였다.
  • 이중 단계 접근 방식은 세분화된 구성 요소의 성능을 향상시켰으며, 눈의 경우 F-측정치 86.8%를 기록했고 눈썹은 77.0%를 기록하여 단일 단계 모델(각각 63.3% 및 53.7%)을 크게 능가하였다.
  • 모델는 단일 GPU에서 11개 클래스의 파싱에 대해 300 FPS로 얼굴 이미지를 처리하여 실시간 응용이 가능하다.
  • 학습된 게이트를 갖춘 공간적으로 변형된 RNN은 표준 RNN 및 기준 CNN보다 성능이 뛰어나, 안내된 적응형 전파의 효과를 입증하였다.
  • 이중 단계 방법은 전체 네트워크 복잡도를 줄이고, 크롭된 영역에서의 픽셀 분포 균형을 통해 작은 얼굴 구성 요소의 성능 향상을 달성하였다.
  • 딥 컨volution 신경망 기반 얼굴 파싱 모델들과 비교해 볼 때, 제안된 프레임워크는 정확도는 유사하면서도 100~300배 빠르고 훨씬 작다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.