[논문 리뷰] General Facial Representation Learning in a Visual-Linguistic Manner
이 논문은 대규모 얼굴 전용 데이터셋(LAION-FACE)을 사용하여 고수준 의미에 대한 대비 손실과 저수준 세부 정보에 대한 마스킹된 이미지 모델링을 동시에 최적화하는 시각어휘적 프레임워크 FaRL을 제안한다. FaRL은 얼굴 파싱과 얼굴 정렬에서 최신 기술 수준(SOTA) 성능을 달성하며, 특히 데이터가 적은 환경에서 이전에 존재하던 사전 훈련된 모델들을 능가한다.
How to learn a universal facial representation that boosts all face analysis tasks? This paper takes one step toward this goal. In this paper, we study the transfer performance of pre-trained models on face analysis tasks and introduce a framework, called FaRL, for general Facial Representation Learning in a visual-linguistic manner. On one hand, the framework involves a contrastive loss to learn high-level semantic meaning from image-text pairs. On the other hand, we propose exploring low-level information simultaneously to further enhance the face representation, by adding a masked image modeling. We perform pre-training on LAION-FACE, a dataset containing large amount of face image-text pairs, and evaluate the representation capability on multiple downstream tasks. We show that FaRL achieves better transfer performance compared with previous pre-trained models. We also verify its superiority in the low-data regime. More importantly, our model surpasses the state-of-the-art methods on face analysis tasks including face parsing and face alignment.
연구 동기 및 목표
- 시각어휘적 사전 훈련된 모델의 다양한 얼굴 분석 작업으로의 전이 가능성에 대해 조사한다.
- 얼굴 분석에서 레이블이 부족한 문제를 해결하기 위해 통합된 얼굴 표현을 학습한다.
- 고수준 의미와 저수준 이미지 세부 정보를 동시에 모델링하여 얼굴 표현 학습을 향상시킨다.
- 하류 작업에 빠르게 적응할 수 있는 일반 목적의 얼굴 표현 프레임워크를 개발한다.
- 기존 사전 훈련된 모델들과 비교해 데이터가 적은 환경에서 뛰어난 성능을 보이는가를 입증한다.
제안 방법
- 모델은 쌍으로 구성된 얼굴 이미지와 자연어 설명을 대비 손실을 통해 고수준 의미 표현을 학습한다.
- BEiT와 유사한 마스킹된 이미지 모델링(MIM)을 도입하여 사전 훈련 중에 저수준 시각적 세부 정보를 포착한다.
- 사전 훈련은 LAION-400M에서 추출한 2000만 개의 얼굴 이미지-텍스트 쌍으로 구성된 정제된 데이터셋인 LAION-FACE에서 수행된다.
- 기본 모델은 비전 트랜스포머(ViT) 또는 DeiT이며, 전이 평가를 위해 특징는 동결된 채로 하류 작업에서 미세조정된다.
- 데이터 증강에는 무작위 회전, 크기 조정, 이동, 노이즈 추가 등이 포함되어 하류 훈련의 강건성을 높인다.
- 특징 추출을 동결한 상태에서 얼굴 파싱, 얼굴 정렬, 속성 예측 등에 대해 평가한다.

실험 결과
연구 질문
- RQ1대규모 오픈소스 이미지-텍스트 쌍에서의 시각어휘적 사전 훈련이 얼굴 분석 작업의 전이 성능을 향상시키는가?
- RQ2고수준 의미와 저수준 이미지 세부 정보를 동시에 모델링하는 것이 얼굴 표현 학습을 향상시키는가?
- RQ3FaRL은 기존 사전 훈련된 모델들과 비교해 데이터가 적은 환경에서 어떻게 성능을 내는가?
- RQ4FaRL은 얼굴 파싱과 얼굴 정렬과 같은 도전적인 얼굴 분석 벤치마크에서 최신 기술 수준의 방법들을 능가할 수 있는가?
- RQ5정제된 LAION-FACE 데이터셋은 일반적인 얼굴 표현을 학습하는 데 효과적인가?
주요 결과
- FaRL은 얼굴 파싱과 얼굴 정렬에서 최신 기술 수준의 성능을 달성하며, 두 벤치마크에서 기존 방법들을 능가한다.
- 강력한 표현 학습 덕분에 특히 데이터가 적은 환경에서 뛰어난 소수 샘플 전이 성능을 보인다.
- 대비 손실과 마스킹된 이미지 모델링을 동시에 최적화하면, 개별적으로 사용할 경우보다 더 나은 특징 표현을 얻을 수 있다.
- LAION-400M의 2000만 장의 이미지 서브셋인 LAION-FACE에서 사전 훈련하면, ImageNet이나 CLIP 사전 훈련보다 훨씬 뛰어난 하류 성능을 얻을 수 있다.
- 특징 추출을 동결한 상태에서 속성 예측 및 정렬과 같은 다양한 얼굴 분석 작업에 대해 뛰어난 일반화 성능를 보이며, 강력한 일반화 능력을 입증한다.
- FaRL은 CLIP, MoCo v3, BEiT와 같은 강력한 베이스라인을 여러 평가 환경에서 능가함으로써 그 효과성을 확인한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.