Skip to main content
QUICK REVIEW

[논문 리뷰] Biases in Data Science Lifecycle

Dinh-An Ho, Oya Beyan|arXiv (Cornell University)|2020. 09. 10.
Ethics and Social Impacts of AI참고 문헌 54인용 수 9
한 줄 요약

이 논문은 데이터 과학 라이프사이클의 모든 단계에서 발생하는 편향을 식별하고 분류하며, 데이터 과학자들이 윤리적 위험을 인지하고 완화할 수 있도록 단계별 실용적 프레임워크를 제공한다. 편향의 원인을 데이터 수집, 전처리, 모델링, 배포 단계에 맵핑함으로써, 실제 응용에서 뜻하지 않은 결과를 줄이기 위한 실질적인 지침을 제공한다.

ABSTRACT

In recent years, data science has become an indispensable part of our society. Over time, we have become reliant on this technology because of its opportunity to gain value and new insights from data in any field - business, socializing, research and society. At the same time, it raises questions about how justified we are in placing our trust in these technologies. There is a risk that such powers may lead to biased, inappropriate or unintended actions. Therefore, ethical considerations which might occur as the result of data science practices should be carefully considered and these potential problems should be identified during the data science lifecycle and mitigated if possible. However, a typical data scientist has not enough knowledge for identifying these challenges and it is not always possible to include an ethics expert during data science production. The aim of this study is to provide a practical guideline to data scientists and increase their awareness. In this work, we reviewed different sources of biases and grouped them under different stages of the data science lifecycle. The work is still under progress. The aim of early publishing is to collect community feedback and improve the curated knowledge base for bias types and solutions.

연구 동기 및 목표

  • 데이터 과학 워크플로우에서 기인하는 윤리적 위험에 대해 데이터 과학자들에게 인식을 제고하기 위해.
  • 데이터 과학 라이프사이클의 각 단계에서 편향의 근본 원인을 체계적으로 식별하기 위해.
  • 윤리 전문 지식이 없는 데이터 과학자들이도 사전에 편향을 탐지하고 해결할 수 있도록 실용적이고 접근 가능한 프레임워크를 제공하기 위해.
  • 편향 유형과 완화 전략에 대한 정제된 지식 기반을 조기에 공개하여 커뮤니티 피드백을 유도하기 위해.
  • 산업 및 분야 전반에 걸쳐 더 책임감 있고 공정한 데이터 과학 관행의 발전을 지원하기 위해.

제안 방법

  • 데이터 과학 윤리 및 편향에 관한 기존 문헌을 종합적으로 검토하였다.
  • 식별된 편향 원인을 데이터 과학 라이프사이클의 다섯 핵심 단계(문제 정의, 데이터 수집, 데이터 전처리, 모델링, 배포)에 맵핑하였다.
  • 각 라이프사이클 단계 내에서 기원과 영향에 따라 편향을 주제별 카테고리로 묶었다.
  • 편향 유형과 해당 완화 전략을 체계적으로 정리하기 위해 단계 기반의 접근 방식을 사용하였다.
  • 비전문가용 데이터 과학자들에게 적합한 실질적이고 실행 가능한 지침을 강조하였다.
  • 커뮤니티 피드백을 확보하고 지식 기반을 반복적으로 개선하기 위해 사전 인쇄(preprint) 형태로 논문을 공개하였다.

실험 결과

연구 질문

  • RQ1데이터 과학 라이프사이클의 각 단계에서 가장 흔하게 발생할 수 있는 편향의 유형은 무엇인가?
  • RQ2공식 윤리 교육을 받지 않은 데이터 과학자들은 자신의 워크플로우에서 편향을 어떻게 식별하고 해결할 수 있는가?
  • RQ3편향 원인을 데이터 과학 라이프사이클 전반에 걸쳐 맵핑하고 실질적인 완화를 위해 사용할 수 있는 체계적 프레임워크는 무엇인가?
  • RQ4커뮤니티 피드백은 데이터 과학에서 편향 유형과 해결책의 정제 과정을 어떻게 향상시킬 수 있는가?
  • RQ5기본적인 실무에서 자주 간과되는 데이터 과학과 관련된 주요 윤리적 위험 요소는 무엇인가?

주요 결과

  • 편향은 문제 정의에서부터 배포에 이르기까지 데이터 과학 라이프사이클 전반에 걸쳐 광범위하게 존재한다.
  • 데이터 수집 및 전처리 단계는 표본 추출 및 측정 편향에 특히 취약하다.
  • 모델링 단계에서는 가정과 데이터 표현 방식의 영향으로 인해 알고리즘적 편향과 특성 선택 편향이 자주 발생한다.
  • 배포 및 모니터링 단계에서는 피드백 루프와 해석 가능성 부족으로 인해 편향이 악화될 수 있다.
  • 본 연구는 라이프사이클 전반에서 12종의 구체적인 편향 유형을 식별하였으며, 각각에 대한 예시와 완화 전략을 제시하였다.
  • 초기 커뮤니티 피드백이 이미 편향 분류 체계의 정교화와 프레임워크의 실용성 향상에 기여하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.