[논문 리뷰] EasyPortrait -- Face Parsing and Portrait Segmentation Dataset
이 논문은 20,000장의 실내 포트레이트 이미지로 구성된 대규모 고품질 데이터셋인 EasyPortrait을 소개한다. 이 데이터셋은 얼굴 분할 및 포트레이트 분할을 위한 세분화된 9개 클래스의 세그멘테이션 마스크를 포함하고 있으며, 피부에서 턱수염과 이가 제외된 방식으로 레이블링되어 있어 피부 개선 및 이가 밝아지는 등의 정밀한 응용이 가능하다. 또한 복잡한 데이터 증강이나 자기지도 학습 전훈 없이도 최소한의 훈련 노력으로도 여러 모델에서 최신 기술 수준의 mIoU 점수를 달성한다.
Recently, video conferencing apps have become functional by accomplishing such computer vision-based features as real-time background removal and face beautification. Limited variability in existing portrait segmentation and face parsing datasets, including head poses, ethnicity, scenes, and occlusions specific to video conferencing, motivated us to create a new dataset, EasyPortrait, for these tasks simultaneously. It contains 40,000 primarily indoor photos repeating video meeting scenarios with 13,705 unique users and fine-grained segmentation masks separated into 9 classes. Inappropriate annotation masks from other datasets caused a revision of annotator guidelines, resulting in EasyPortrait's ability to process cases, such as teeth whitening and skin smoothing. The pipeline for data mining and high-quality mask annotation via crowdsourcing is also proposed in this paper. In the ablation study experiments, we proved the importance of data quantity and diversity in head poses in our dataset for the effective learning of the model. The cross-dataset evaluation experiments confirmed the best domain generalization ability among portrait segmentation datasets. Moreover, we demonstrate the simplicity of training segmentation models on EasyPortrait without extra training tricks. The proposed dataset and trained models are publicly available.
연구 동기 및 목표
- 영상 통화 애플리케이션에서 경량 실시간 모델을 훈련하기 위한 다양한 고품질 실생활 포트레이트 데이터셋의 부족을 해결하기 위해.
- 기존 데이터셋에서 턱수염, 이, 안경 등이 피부 또는 입 마스크에 잘못 포함된 한계를 극복하기 위해.
- 수집된 데이터의 품질과 투명성을 보장하기 위해 크라우드소싱을 활용하고 전문가 검증을 거친 깔끔한 수동 레이블링 데이터셋을 제공하기 위해.
- 피부, 이, 눈 등 주요 얼굴 구성 요소를 별도의 클래스로 분리함으로써 정밀한 얼굴 개선 작업(예: 이가 밝아짐, 피부 보정, 빨간 눈 제거 등)을 가능하게 하기 위해.
- 복잡한 데이터 증강이나 자기지도 전훈 없이도 표준 아키텍처를 사용해 고성능을 달성할 수 있도록 빠른 모델 훈련을 가능하게 하기 위해.
제안 방법
- 스마트폰이나 랩탑을 사용해 주로 실내 환경(집, 사무실 등)에서 8,377명의 고유 사용자로부터 20,000장의 이미지를 두 개의 크라우드소싱 플랫폼을 통해 수집하였다.
- 배경, 인물, 얼굴 피부, 왼쪽/오른쪽 눈썹, 왼쪽/오른쪽 눈, 입술, 이가 포함된 9개 클래스의 세그멘테이션 마스크를 생성하였으며, 턱수염과 코구멍은 피부에서 제외하는 엄격한 레이블링 규칙을 적용하였다.
- 두 단계의 레이블링 파이프라인을 활용: 먼저 크라우드워커가 초기 레이블링을 수행한 후 전문가 검증을 통해 고품질이고 일관된 세그멘테이션 마스크를 확보하였다.
- 이미지 팯딩, 1024×1024로 리사이징, 광학적 왜곡(명도, 대비, 채도, hue) 및 정규화를 포함한 표준 데이터 증강 기법을 사용하였다.
- 고정된 초모수와 AdamW 옵timizer를 사용해 MMSegmentation 프레임워크를 기반으로 여러 최신 세그멘테이션 모델(예: SegFormer, FPN, BiSeNet-V2)을 데이터셋에 대해 훈련시켰다.
- 모델 평가 시 모든 클래스에 대해 평균 교차점의 면적(mIoU)을 사용하였으며, 데이터 특화의 미세조정이나 훈련 기법을 적용하지 않았다.

실험 결과
연구 질문
- RQ1합성 데이터나 자기지도 전훈 없이도 세분화된 전문가 검증 레이블링이 적용된 대규모 실생활 포트레이트 데이터셋이 얼굴 분할 및 포트레이트 분할 작업의 성능 향상에 기여할 수 있는가?
- RQ2피부 클래스에서 이와 턱수염을 제외함으로써 이가 밝아짐 및 피부 보정 등의 후행 작업 성능에 어떤 영향을 미치는가?
- RQ3복잡한 데이터 증강 없이 20,000장의 이미지로만 구성된 실생활 포트레이트 데이터셋에서 표준 딥러닝 모델이 얼마나 높은 mIoU 점수를 달성할 수 있는가?
- RQ4전문가 검증을 거친 크라우드소싱 파이프라인을 통해 충분한 품질과 다양성을 확보한 데이터셋이 실시간 영상 애플리케이션에서 강력한 일반화 성능을 보장할 수 있는가?
- RQ5다양한 가림과 얼굴 특징을 포함한 데이터셋에서 다양한 백본 아키텍처(예: ResNet-50, MobileNet-V2, SegFormer-B5)의 성능은 어떻게 나타나는가?
주요 결과
- 1024×1024 크롭에 대해 FPN + ResNet-50 모델이 최고의 mIoU 점수 84.08을 기록하여, 낮은 아키텍처 복잡도로도 뛰어난 성능을 보였다.
- 1024×1024 입력을 사용한 SegFormer-B5는 mIoU 84.94를 기록하여, 효율적인 트랜스포머 아키텍처가 제한된 데이터로도 높은 정확도를 달성할 수 있음을 보여주었다.
- 경량 모델인 FCN + MobileNet-V2(1024)도 눈(70.81), 입술(69.99) 등의 주요 클래스에서 mIoU 70 이상을 기록하여 소형 모델의 강력한 일반화 능력을 입증하였다.
- BiSeNet-V2 모델은 전체 데이터셋에서 78.39 mIoU를 기록하여, 고품질이고 다양한 데이터로 훈련된 경우 경량 아키텍처도 뛰어난 성능을 낼 수 있음을 보여주었다.
- 이 데이터셋의 설계 방식(이와 턱수염을 피부에서 분리) 덕분에 이가 밝아짐, 피부 보정 등 정밀한 얼굴 개선 작업을 정확히 모델링할 수 있었으며, 이는 기존 표준 데이터셋으로는 구현이 어려운 분야였다.
- EasyPortrait에서 훈련된 모든 모델은 단 20,000 반복만으로도 높은 mIoU 값을 기록하였으며(예: 얼굴 피부 및 인물 클래스의 경우 >95), 이는 데이터셋이 빠르고 정확한 훈련에 적합함을 입증한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.