Skip to main content
QUICK REVIEW

[논문 리뷰] Facelet-Bank for Fast Portrait Manipulation

Ying-Cong Chen, Huaijia Lin|arXiv (Cornell University)|2018. 03. 15.
Face recognition and analysis참고 문헌 31인용 수 13
한 줄 요약

이 논문은 쌍체 학습 데이터가 필요 없이 일반적인 포트레이트 조작을 위한 빠르고 유연하며 종단 간 컨볼루션 네트워크 프레임워크인 Facelet-Bank을 제안한다. 이는 중간 컨볼루션 레이어의 학습 가능한 facelet-은행을 사용하여 표정, 메이크업, 악세서리와 같은 얼굴 특성의 빠르고 제어 가능한 편집을 가능하게 하며, 기존 방법인 DFI보다 최대 3,371배 빠른 속도로 고해상도의 고품질 결과를 달성한다.

ABSTRACT

Digital face manipulation has become a popular and fascinating way to touch images with the prevalence of smartphones and social networks. With a wide variety of user preferences, facial expressions, and accessories, a general and flexible model is necessary to accommodate different types of facial editing. In this paper, we propose a model to achieve this goal based on an end-to-end convolutional neural network that supports fast inference, edit-effect control, and quick partial-model update. In addition, this model learns from unpaired image sets with different attributes. Experimental results show that our framework can handle a wide range of expressions, accessories, and makeup effects. It produces high-resolution and high-quality results in fast speed.

연구 동기 및 목표

  • 쌍체 학습 데이터가 필요 없이 다양한 얼굴 특성 조작을 위한 일반 목적의 데이터 기반 프레임워크를 개발하는 것.
  • 실시간 포트레이트 편집 응용 프로그램을 위한 실시간 추론과 편집 강도의 상호작용 제어를 가능하게 하는 것.
  • 시스템의 확장성과 개발자 友보를 위해 서로 다른 얼굴 효과를 모듈형으로 분리하고 업데이트 가능한 컨볼루션 레이어로 분리하는 것.
  • 깊이 있는 특징 보간(DFI)을 통한 내재된 局소 유도적 편향을 활용하여 노이즈가 있거나 불완전한 감독 신호에 대응하는 도전 과제를 해결하는 것.
  • 전역 이미지 수준의 매핑이 아닌 국소적이고 의미 인식형 변환을 학습하여 관련된 특성(예: 수염과 성별)을 분리하는 것.

제안 방법

  • 특정 얼굴 효과를 모델링하는 중간 컨볼루션 레이어의 학습 가능한 facelet-은행(Con-v-ReLU-Con-v-ReLU-Con-v)을 갖춘 공유 인코더-디코더 아키텍처를 사용한다.
  • 쌍체가 아닌 학습 데이터를 위해 깊이 있는 특징 보간(DFI)을 활용하여 가짜 타겟 이미지를 생성함으로써 인간의 레이블링 쌍이 없는 약한 감독 학습을 가능하게 한다.
  • 잠재 공간 내에서 최소 거리 평균을 통한 최근접 이웃 평균 계산을 통해 학습된 속성 방향 이동 Δv 를 계산하여 편집 강도와 스타일 전이를 제어한다.
  • 다중 레이어 집계 전략을 적용하여 여러 facelet-은행 레이어(예: 레이어 3, 4, 5)를 조합함으로써 편집의 국소성과 완전성을 향상시킨다.
  • 비용이 많이 들는 작업(예: 얼굴 왜곡, 최근접 이웃 검색, 역방향 최적화)을 피하는 경량이고 종단 간 학습 파이프라인을 도입한다.
  • 잠재 코드와 Δv 를 한 번만 계산한 후 단순한 전방 전파를 통해 강도 λ 를 다양하게 조절함으로써 실시간 추론을 가능하게 한다: E(x) + λΔv → D.

실험 결과

연구 질문

  • RQ1하나의 딥 러닝 프레임워크가 표정, 메이크업, 악세서리 등 다양한 얼굴 특성 조작을 쌍체 학습 데이터 없이 일반화할 수 있는가?
  • RQ2딥 러닝 기반의 포트레이트 조작 시스템에서 편집 강도를 상호작용적이고 효율적으로 제어할 수 있는가?
  • RQ3학습 가능한 모듈형 facelet-은행 아키텍처가 DFI나 CycleGAN과 같은 기존의 set-to-set 이미지 번역 방법보다 품질과 속도 면에서 뛰어나게 성능을 낼 수 있는가?
  • RQ4쌍체가 아닌 데이터로 학습했을 때 관련된 특성(예: 수염과 성별)을 얼마나 효과적으로 분리할 수 있는가?
  • RQ5컨볼루션 레이어에서 유도되는 국소적 유도적 편향이 약한 감독 학습에서 노이즈가 있는 가짜 레이블에 대해 얼마나 강건한가?

주요 결과

  • 제안된 Facelet-Bank 프레임워크는 쌍체 학습 데이터 없이도 스마일, 얼굴 털, 노화와 같은 다양한 특성에 대해 고품질의 포트레이트 조작을 달성한다.
  • DFI 대비 3,371배 빠른 속도를 기록하며, 추론 시간은 단 0.0194초(DFI 대비 65.4초)에 불과하지만, 시각적 품질은 유지하거나 향상시킨다.
  • 편집 강도 조절을 위한 9ms의 추론 지연 시간을 통해 실시간 강도 제어가 가능하여 상호작용 편집을 지원한다.
  • 다중 레이어 집계(레이어 3, 4, 5)를 통해 점진적으로 얼굴 털을 제거하며, 모든 레이어를 사용할 때에만 완전한 제거가 이루어진다.
  • DFI와 CycleGAN보다 관련된 특성(예: 여성 얼굴에 수염을 추가할 때 성별 특징을 유지)을 더 효과적으로 분리한다.
  • DFI에서 유도된 가짜 레이블과 컨볼루션 레이어의 국소적 유도적 편향을 결합함으로써 노이즈가 있는 감독 신호에도 불구하고 강건한 학습이 가능해져 현실적이고 국소적인 편집 결과를 도출한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.