Skip to main content
QUICK REVIEW

[論文レビュー] Biases in Data Science Lifecycle

Dinh-An Ho, Oya Beyan|arXiv (Cornell University)|Sep 10, 2020
Ethics and Social Impacts of AI参考文献 54被引用数 9
ひとこと要約

この論文は、データサイエンスライフサイクルの全段階にわたり、バイアスを特定・分類し、データサイエンティストが倫理的リスクを認識し緩和するための実用的で段階別フレームワークを提供する。バイアスの原因をデータ収集、前処理、モデリング、展開段階にマッピングすることで、実世界の応用における意図しない結果を低減するための実行可能なガイダンスを提供する。

ABSTRACT

In recent years, data science has become an indispensable part of our society. Over time, we have become reliant on this technology because of its opportunity to gain value and new insights from data in any field - business, socializing, research and society. At the same time, it raises questions about how justified we are in placing our trust in these technologies. There is a risk that such powers may lead to biased, inappropriate or unintended actions. Therefore, ethical considerations which might occur as the result of data science practices should be carefully considered and these potential problems should be identified during the data science lifecycle and mitigated if possible. However, a typical data scientist has not enough knowledge for identifying these challenges and it is not always possible to include an ethics expert during data science production. The aim of this study is to provide a practical guideline to data scientists and increase their awareness. In this work, we reviewed different sources of biases and grouped them under different stages of the data science lifecycle. The work is still under progress. The aim of early publishing is to collect community feedback and improve the curated knowledge base for bias types and solutions.

研究の動機と目的

  • データサイエンスワークフローにおけるバイアスに起因する倫理的リスクについて、データサイエンティストの認識を高めること。
  • データサイエンスライフサイクルの各段階におけるバイアスの原因を体系的に特定すること。
  • 倫理的専門知識が不要なデータサイエンティストが、事前にバイアスを検出・是正できる実用的でアクセスしやすいフレームワークを提供すること。
  • バイアスの種類と緩和戦略のキュレートされた知識ベースを早期に公開することで、コミュニティからのフィードバックを促進すること。
  • 産業分野や分野を越えて、より責任あるで公平なデータサイエンス実践の発展を支援すること。

提案手法

  • データサイエンス倫理およびバイアスに関する既存の文献を包括的にレビューした。
  • 識別されたバイアスの原因を、問題定義、データ収集、データ前処理、モデリング、展開の5つのコア段階にマッピングした。
  • 各ライフサイクル段階内での起源と影響に基づいて、バイアスをテーマ別にグループ化した。
  • バイアスの種類と対応する緩和戦略を体系的に整理するための、段階ベースのアプローチを採用した。
  • 非専門家向けのデータサイエンティストに特化した、実行可能で実用的なガイダンスを強調した。
  • コミュニティからのフィードバックを得るために、知識ベースを段階的に改善できるように、プレプリントとして公開した。

実験結果

リサーチクエスチョン

  • RQ1データサイエンスライフサイクルの異なる段階で、どのようなバイアスが最も発生しやすいか?
  • RQ2公式な倫理教育を受けていないデータサイエンティストは、どのようにして自身のワークフロー内のバイアスを特定・是正できるか?
  • RQ3実用的な緩和を可能にするために、データサイエンスライフサイクル全体にわたるバイアスの原因をマッピングするための体系的フレームワークは何か?
  • RQ4コミュニティからのフィードバックは、データサイエンスにおけるバイアスの種類と解決策のキュレーションをどのように改善できるか?
  • RQ5標準的な実践でしばしば見過ごされがちな、データサイエンスに関連する主な倫理的リスクは何か?

主な発見

  • バイアスは、問題定義から展開に至るまで、データサイエンスライフサイクルの全段階にわたり広く存在する。
  • データ収集および前処理段階は、標本選択バイアスと測定バイアスに特に脆弱である。
  • モデリング段階では、仮定やデータ表現の問題により、アルゴリズムバイアスおよび特徴選択バイアスが頻繁に生じる。
  • 展開および監視段階では、フィードバックループや解釈不能性の欠如により、バイアスが拡大する可能性がある。
  • 本研究では、ライフサイクル全体にわたり12種類の明確なバイアスの種類を特定し、例と緩和戦略を提示した。
  • 早期のコミュニティフィードバックにより、バイアスタクソノミーの洗練とフレームワークの実用性向上が既に達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。