Skip to main content
QUICK REVIEW

[논문 리뷰] Building Better Datasets: Seven Recommendations for Responsible Design from Dataset Creators

Will Orr, Kate Crawford|arXiv (Cornell University)|2024. 08. 30.
Big Data and Business Intelligence인용 수 7
한 줄 요약

이 논문은 18명의 데이터세트 제작자로부터 얻은 통찰을 제시하고 책임 있는 데이터셋 설계를 개선하기 위한 7가지 실용적인 권고를 제시하며, 데이터 품질, 다양성, 문서화 및 거버넌스에 초점을 맞춥니다.

ABSTRACT

The increasing demand for high-quality datasets in machine learning has raised concerns about the ethical and responsible creation of these datasets. Dataset creators play a crucial role in developing responsible practices, yet their perspectives and expertise have not yet been highlighted in the current literature. In this paper, we bridge this gap by presenting insights from a qualitative study that included interviewing 18 leading dataset creators about the current state of the field. We shed light on the challenges and considerations faced by dataset creators, and our findings underscore the potential for deeper collaboration, knowledge sharing, and collective development. Through a close analysis of their perspectives, we share seven central recommendations for improving responsible dataset creation, including issues such as data quality, documentation, privacy and consent, and how to mitigate potential harms from unintended use cases. By fostering critical reflection and sharing the experiences of dataset creators, we aim to promote responsible dataset creation practices and develop a nuanced understanding of this crucial but often undervalued aspect of machine learning research.

연구 동기 및 목표

  • 책임 있는 ML 실천에서 데이터세트 제작자의 역할과 시각을 강조한다.
  • 다양한 데이터세트와 제도적 맥락 전반에서 공통적인 도전과제를 식별한다.
  • 데이터 품질, 다양성, 동의 및 사용 한계 개선을 위한 실행 가능한 권고를 제시한다.
  • ML 커뮤니티 내에서 데이터 작업의 협업과 전문화를 촉진한다.

제안 방법

  • 2022년 7월–9월에 18명의 데이터세트 제작자를 대상으로 자유로운 질적 인터뷰를 실시했다.
  • 가능한 참가자 47명을 모집했고, 그 중 18명이 참여했다(응답률 38%).
  • 데이터세트의 기원, 사용, 유지 관리 및 노후화를 탐색하기 위해 반구조화된 인터뷰를 사용했다.
  • 인터뷰를 전사하고 반복적인 주제 코딩을 수행하여 권고안을 도출했다.
  • 참가자에 대한 익명성 또는 신원 확인 선택을 보장했고 연구는 IRB 승인을 받았다.

실험 결과

연구 질문

  • RQ1다양한 분야의 데이터세트 제작자들이 직면한 도전과 최선의 관행은 무엇인가?
  • RQ2제작자들이 책임 있는 데이터세트 생성을 개선하기 위해 제시하는 구체적인 권고는 무엇인가?
  • RQ3데이터셋 커뮤니티는 어떻게 더 나은 협력과 전문화를 향해 나아갈 수 있는가?
  • RQ4문서화, 다양성, 검증 및 동의는 책임 있는 데이터셋 설계에서 어떤 역할을 하는가?
  • RQ5데이터셋은 어떻게 전달되고 사용되며, 시간이 지남에 따라 은퇴되거나 업데이트될 수 있는가?

주요 결과

  • 인터뷰를 통해 책임 있는 데이터세트 생성을 위한 일곱 가지 핵심 권고가 도출됐다.
  • 다양성과 철저한 감사가 편향 및 의도치 않은 해를 완화하는 데 중요하다.
  • 높은 데이터 품질은 신중한 검증, 수동 점검 및 선별을 필요로 하며, 상충관계에 대한 인식을 요구한다.
  • 오류로부터의 학습을 포함한 초기의 반복적 개발이 필수적이다.
  • 개방적 문서화와 한계의 명확한 커뮤니케이션은 재현성과 재사용을 촉진한다.
  • 데이터세트는 명확히 정의된 의도된 사용 및 의도치 않은 사용 사례에 대한 고려를 갖춘 사용자 중심이어야 한다.
  • 윤리적 고려, 동의, 프라이버시, 라이선스, 저작자 표시 및 은퇴 문제는 지속적인 관심이 필요한 공개적 과제다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.