Skip to main content
QUICK REVIEW

[논문 리뷰] Auditing ImageNet: Towards a Model-driven Framework for Annotating Demographic Attributes of Large-Scale Image Datasets

Chris Dulhanty, Alexander Wong|arXiv (Cornell University)|2019. 05. 03.
Face recognition and analysis참고 문헌 27인용 수 15
한 줄 요약

이 논문은 대규모 이미지 데이터셋에서 명시적 연령과 성별을 자동으로 주석 처리하기 위한 모델 기반 프레임워크를 제안하며, 이를 2012년 ImageNet ILSVRC 서브셋과 'person' 시냅스에 적용한다. 연구에서는 성별 및 연령 분포의 심각한 불균형을 드러내는데, ILSVRC에서 여성 얼굴 비율은 41.62%이며, 60세 이상은 단 1.71%이며, 남성 15–29세가 가장 큰 군집을 이룬다. 동시에 모델 자체가 편향을 유발함을 확인했으며, 특히 어두운 피부색의 여성에게서 두드러진다.

ABSTRACT

The ImageNet dataset ushered in a flood of academic and industry interest in deep learning for computer vision applications. Despite its significant impact, there has not been a comprehensive investigation into the demographic attributes of images contained within the dataset. Such a study could lead to new insights on inherent biases within ImageNet, particularly important given it is frequently used to pretrain models for a wide variety of computer vision tasks. In this work, we introduce a model-driven framework for the automatic annotation of apparent age and gender attributes in large-scale image datasets. Using this framework, we conduct the first demographic audit of the 2012 ImageNet Large Scale Visual Recognition Challenge (ILSVRC) subset of ImageNet and the "person" hierarchical category of ImageNet. We find that 41.62% of faces in ILSVRC appear as female, 1.71% appear as individuals above the age of 60, and males aged 15 to 29 account for the largest subgroup with 27.11%. We note that the presented model-driven framework is not fair for all intersectional groups, so annotation are subject to bias. We present this work as the starting point for future development of unbiased annotation models and for the study of downstream effects of imbalances in the demographics of ImageNet. Code and annotations are available at: http://bit.ly/ImageNetDemoAudit

연구 동기 및 목표

  • 컴퓨터 시각 분야의 기초 데이터셋인 ImageNet에서 종합적인 인구통계 분 析의 부재를 해결하기 위해.
  • 특히 성별 및 연령 표현 측면에서 ImageNet의 구성에 내재된 편향을 조사하기 위해.
  • 대규모 데이터셋에서 명시적 연령과 성별을 자동으로 주석 처리하기 위한 모델 기반 파이프라인을 개발하고 적용하기 위해.
  • 향후 보다 공정하고 포용적인 인구통계 주석 처리 모델 개발을 위한 기초 기준을 설정하기 위해.
  • ImageNet의 인구통계 불균형이 전이 학습 과정에서 어떻게 확산될 수 있는지에 대한 후속 분석을 가능하게 하기 위해.

제안 방법

  • 신뢰도 임계값(0.9)을 갖는 딥러닝 기반의 얼굴 검출 모델을 사용하여 이미지 내 얼굴를 식별한다.
  • 성별 주석 처리에 DEX 모델을 활용하며, 0에서 1 사이의 연속적인 값을 출력하고, 이중 분류는 0.5 임계값을 기준으로 한다.
  • 명시적 연령 추정을 위한 별도의 딥러닝 모델을 적용하며, 이는 APPA-REAL 테스트 세트에서 평가된다.
  • 모델의 유효성을 검증하기 위해 기준 데이터셋(FDDB는 얼굴 검출, APPA-REAL은 연령 추정)을 활용한다.
  • 모델의 공정성을 평가하기 위해 피ilot 파리멘츠 벤치마크(PPB)를 활용하며, 교차군 집단 간 성능 격차를 확인한다.
  • 파이프라인을 ILSVRC 2012 서브셋(128만 장의 이미지)과 'person' 계층적 시냅스(118만 장의 이미지)에 적용하여 인구통계 주석을 생성한다.

실험 결과

연구 질문

  • RQ1ILSVRC 2012 서브셋과 'person' 시냅스에서 명시적 연령과 성별 측면에서 얼굴의 인구통계적 구성은 어떠한가?
  • RQ2기존의 자동 연령 및 성별 주석 처리 모델이 다양한 인구통계 하위군, 특히 교차군에서 어떻게 성능을 내는가?
  • RQ3현재의 모델 기반 주석 처리 프레임워크가 인구통계 레이블링에서 편향을 유발하거나 악화시키는 정도는 어느 정도인가?
  • RQ4ImageNet의 'person' 및 ILSVRC 서브셋에서 가장 저조하게 및 과도하게 표현된 인구통계 군은 무엇인가?
  • RQ5모델 기반 프레임워크를 어떻게 활용하여 대규모 비전 데이터셋의 공정성 향상과 감사 기반 기초를 마련할 수 있는가?

주요 결과

  • ILSVRC 2012 서브셋에서 검출 가능한 얼굴의 41.62%가 여성으로 주석 처리되었으며, 남성 15–29세가 가장 큰 군집을 형성하여 27.11%를 차지한다.
  • ILSVRC에서 60세 이상 얼굴 비율은 단 1.71%로, 노인층의 심각한 부족함을 시사한다.
  • 성별 주석 처리 모델은 테스트 세트에서 평균 정밀도 99.74%를 기록했지만, 어두운 피부색의 여성에서는 성능이 열악하여 PPB에서 정확도가 69.00%에 그친다.
  • 연령 추정 모델은 모든 군집에서 평균 평균 오차가 5.22년이며, 60세 이상인 경우 오차가 더 높아 8.40년으로 나타난다.
  • 'person' 서브셋의 상위 시냅스에서는 극단적인 성별 불균형이 나타나며, 'spree', 'bombshell', 'pitchman'은 모두 100% 남성으로 주석 처리되었다.
  • 모델 기반 프레임워크는 기존 자동 주석 처리 도구가 교차군 간에 공정하지 않음을 드러내었으며, 특히 어두운 피부색의 여성에게서 두드러지므로 향후 개선이 필수적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.