Skip to main content
QUICK REVIEW

[논문 리뷰] PASS: An ImageNet replacement for self-supervised pretraining without humans

Yuki Asano, Christian Rupprecht|arXiv (Cornell University)|2021. 09. 27.
Medical Imaging and Analysis인용 수 10
한 줄 요약

PASS는 인간이 포함되지 않은 128만 장의 이미지로 구성된, 자율 학습을 위한 사전 훈련 데이터셋으로, CC-BY 라이선스를 적용하고 완전한 기여자 표시를 제공하여 윤리적 또는 법적 우려 없이 ImageNet을 대체할 수 있도록 설계되었다. 인간 포즈 추정과 같은 후행 작업에서 ImageNet과 유사한 성능을 달성함으로써, 인간을 포함하지 않는 데이터로도 비전 모델의 사전 훈련이 효과적으로 가능하다는 것을 입증한다.

ABSTRACT

Computer vision has long relied on ImageNet and other large datasets of images sampled from the Internet for pretraining models. However, these datasets have ethical and technical shortcomings, such as containing personal information taken without consent, unclear license usage, biases, and, in some cases, even problematic image content. On the other hand, state-of-the-art pretraining is nowadays obtained with unsupervised methods, meaning that labelled datasets such as ImageNet may not be necessary, or perhaps not even optimal, for model pretraining. We thus propose an unlabelled dataset PASS: Pictures without humAns for Self-Supervision. PASS only contains images with CC-BY license and complete attribution metadata, addressing the copyright issue. Most importantly, it contains no images of people at all, and also avoids other types of images that are problematic for data protection or ethics. We show that PASS can be used for pretraining with methods such as MoCo-v2, SwAV and DINO. In the transfer learning setting, it yields similar downstream performances to ImageNet pretraining even on tasks that involve humans, such as human pose estimation. PASS does not make existing datasets obsolete, as for instance it is insufficient for benchmarking. However, it shows that model pretraining is often possible while using safer data, and it also provides the basis for a more robust evaluation of pretraining methods.

연구 동기 및 목표

  • 대규모 비전 데이터셋에서 인간의 프라이버시와 동의 문제와 관련된 윤리적 및 법적 우려를 해결하기 위해.
  • 검색 엔진을 통한 이미지 수집 방식으로 인한 인간 표현과 관련된 편향을 제거하기 위해.
  • 인간 중심의 콘텐츠를 피하고 자율 학습에 적합한 확장 가능한 비라벨링 데이터셋을 구축하기 위해.
  • 자율 학습 방법의 자연 이미지 분포에 대한 평가를 위한 더 안전하고 견고한 벤치마크를 제공하기 위해.
  • 사전 훈련 단계에서 인간 이미지를 포함하지 않는 것이 인간을 포함하는 작업에 대해 효과적이고 실현 가능하다는 것을 입증하기 위해.

제안 방법

  • PASS는 검색 엔진 기반 외의 방법을 사용해 Flickr에서 무작위로 이미지를 추출하여 선택 편향을 방지한다.
  • 자동 탐지 및 수동 검증을 통해 인간, 신체 부위, 번호판, 서명, 손글씨를 포함한 모든 이미지를 제외한다.
  • 모든 이미지는 완전한 메타데이터를 포함한 CC-BY 라이선스를 적용하여 법적 준수와 기여자 표시를 보장한다.
  • MoCo-v2, SwAV, DINO와 같은 최신 자율 학습 방법을 사용해 데이터셋을 사전 훈련에 활용한다.
  • 최종 데이터셋에 인간 관련 콘텐츠가 남아 있지 않은지 확인하기 위해 검증 파이프라인을 운영한다.
  • 버전 관리된 데이터셋은 Zenodo와 GitHub에 호스팅되며, 이미지 다운로드 및 메타데이터 접근을 위한 코드가 함께 제공된다.

실험 결과

연구 질문

  • RQ1인간 콘텐츠가 전혀 포함되지 않은 대규모 비라벨링 이미지 데이터셋이 자율 학습을 위한 사전 훈련에서 ImageNet을 효과적으로 대체할 수 있는가?
  • RQ2인간 이미지를 제거함으로써 모델 사전 훈련 시 윤리적 및 법적 리스크가 어느 정도 감소하는가?
  • RQ3PASS에서 사전 훈련된 모델의 성능은 다양한 후행 작업에서 ImageNet에서 사전 훈련된 모델과 비교해 어떻게 되는가?
  • RQ4검색 엔진과 라벨 없이 수집된 데이터셋이 라벨 기반으로 정제된 데이터셋보다 자율 학습의 일반화 성능을 더 잘 끌어올릴 수 있는가?
  • RQ5인간 콘텐츠의 부재가 특히 인간을 포함하는 작업에서 학습된 특징의 품질에 영향을 미치는가?

주요 결과

  • PASS는 인간 포즈 추정과 같은 인간을 포함하는 작업에서도 ImageNet 사전 훈련과 유사한 전이 학습 성능을 달성한다.
  • MoCo-v2, SwAV, DINO를 사용해 PASS에서 사전 훈련한 모델은 후행 벤치마크에서 ImageNet 사전 훈련 모델과 유사한 정확도를 달성한다.
  • 데이터셋은 128만 장의 이미지로 구성되어 있으며, 모든 이미지가 CC-BY 라이선스를 적용하고 완전한 기여자 표시 메타데이터를 보유하여 법적 및 윤리적 준수를 보장한다.
  • 자동 탐지 및 수동 검증을 통해 최종 데이터셋에 인간 관련 콘텐츠가 존재하지 않음을 확인했다.
  • GitHub와 Zenodo 통해 데이터셋을 제공하며, 이미지 다운로드 및 메타데이터 접근을 위한 코드가 함께 제공된다.
  • 데이터셋은 버전 관리되며, 향후 인간 비포함 기준에 어긋나는 이미지가 발견될 경우 제거하기 위해 업데이트될 예정이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.