Skip to main content
QUICK REVIEW

[논문 리뷰] Multimodal datasets: misogyny, pornography, and malignant stereotypes

Abeba Birhane, Vinay Uday Prabhu|arXiv (Cornell University)|2021. 10. 05.
Gender, Feminism, and Media참고 문헌 56인용 수 150
한 줄 요약

본 논문은 LAION-400M 멀티모달 데이터셋을 감사하고 명시적 여성혐오적, 포르노그래피적, 편향된 콘텐츠를 드러내며, 이해관계자를 위한 더 넓은 피해와 열린 문제를 논의한다.

ABSTRACT

We have now entered the era of trillion parameter machine learning models trained on billion-sized datasets scraped from the internet. The rise of these gargantuan datasets has given rise to formidable bodies of critical work that has called for caution while generating these large datasets. These address concerns surrounding the dubious curation practices used to generate these datasets, the sordid quality of alt-text data available on the world wide web, the problematic content of the CommonCrawl dataset often used as a source for training large language models, and the entrenched biases in large-scale visio-linguistic models (such as OpenAI's CLIP model) trained on opaque datasets (WebImageText). In the backdrop of these specific calls of caution, we examine the recently released LAION-400M dataset, which is a CLIP-filtered dataset of Image-Alt-text pairs parsed from the Common-Crawl dataset. We found that the dataset contains, troublesome and explicit images and text pairs of rape, pornography, malign stereotypes, racist and ethnic slurs, and other extremely problematic content. We outline numerous implications, concerns and downstream harms regarding the current state of large scale datasets while raising open questions for various stakeholders including the AI community, regulators, policy makers and data subjects.

연구 동기 및 목표

  • Common Crawl 및 CLIP-필터링 파이프라인에서 구축된 대규모 LAION-400M 멀티모달 데이터세트의 콘텐츠와 편향을 평가한다.
  • 이미지-텍스트 쌍에서의 여성혐오적, 포르노그래피적, 인종차별적 및 기타 유해한 콘텐츠의 위험을 강조한다.
  • 비전-언어 모델에 사용되는 대규모 데이터세트의 현재 큐레이션, 필터링 및 detoxification 관행을 비판한다.

제안 방법

  • CLIP 기반 필터링 및 대체 텍스트 분석을 통해 드러난 LAION-400M 콘텐츠에 대한 질적·양적 조사.
  • 광범위한 WWW 코퍼스를 크롤링하고 CLIP 기반 유사도로 필터링하며 이미지-텍스트 쌍을 선택하는 데이터셋 구성 파이프라인의 설명.
  • 텍스트 및 이미지 필터를 사용한 여러 질의에 대한 검색 결과에서 NSFW의 유병률을 실증적으로 평가.
  • CLIP의 편향 및 필터링된 데이터에서의 잠재적 잘못 연결에 대한 논의.
  • 수집(크롤링)과 하류 디톡스화 노력 간의 비대칭성에 대한 비판적 성찰.

실험 결과

연구 질문

  • RQ1LAION-400M에서의 명시적이고 유해한 콘텐츠(여성혐오, 포르노그래피, 고정관념)의 유병률과 특성은 무엇인가?
  • RQ2필터링 및 큐레이션 파이프라인(예: CLIP 기반 유사도 임계값)이 하류의 피해 및 편향에 어떤 영향을 미치는가?
  • RQ3이러한 대규모 시각-언어 데이터세트를 공개하고 사용하는 것의 윤리적, 규제적, 실무적 시사점은 무엇인가?
  • RQ4데이터 수집/큐레이션과 디톡스화 노력 사이에 어떤 비대칭성이 존재하며 이것이 모델 피해에 어떻게 영향을 미치는가?
  • RQ5데이터셋 구성 및 사용과 관련하여 이해관계자(연구자, 정책입안자, 데이터주체)가 다루어야 할 미해결 질문은 무엇인가?

주요 결과

  • LAION-400M 검색-감사는 겉보기엔 무해한 쿼리(예: Desi, Nun, Latina)와 연결된 NSFW 및 명시적 이미지를 드러냈다.
  • 민감 용어에 대한 일치의 상당 부분이 NSFW 지표를 포함하고 있어 검색 결과의 편향 및 해로운 연관성의 위험을 보여준다.
  • CLIP 기반 필터링 임계값(예: 코사인 유사도 0.3)은 모델의 편향과 모서리 케이스로 인해 유해 콘텐츠의 포함을 막지 못할 수 있다.
  • 거대한 데이터세트를 크롤링/생성하는 용이성과 하류 디톡스화 및 피해 감소에 필요한 노력 사이에는 상당한 비대칭성이 있다.
  • 데이터셋 큐레이션 과정은 종종 강력한 공동 이미지-텍스트 필터링이 부족하며 편향과 고정관념을 전파할 수 있다.
  • 민감도 수준의 데이터 큐레이션을 수행하는 연구자의 정서적 부담과 잠재적 트라우마는 본질적으로 크며 종종 과소평가된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.