Skip to main content
QUICK REVIEW

[論文レビュー] Mitigating Dataset Harms Requires Stewardship: Lessons from 1000 Papers

Kenny Peng, Arunesh Mathur|arXiv (Cornell University)|Aug 6, 2021
Face recognition and analysis参考文献 71被引用数 8
ひとこと要約

本稿は、LFW、MS-Celeb-1M、DukeMTMCの3つの高インパクトな顔認識および人物認識データセットの倫理的ライフサイクルを、ほぼ1,000件の引用論文を分析することで検討する。データセットの撤回、ライセンス、および派生モデルが、広範なデータの可用性と弱い執行力のため、損害を是正しないことが判明。代わりに、データセットライフサイクル全体にわたり、作成者、利用者、機関の間で分散型の責任体制を構築する継続的ケアの必要性を提言する。

ABSTRACT

Machine learning datasets have elicited concerns about privacy, bias, and unethical applications, leading to the retraction of prominent datasets such as DukeMTMC, MS-Celeb-1M, and Tiny Images. In response, the machine learning community has called for higher ethical standards in dataset creation. To help inform these efforts, we studied three influential but ethically problematic face and person recognition datasets -- Labeled Faces in the Wild (LFW), MS-Celeb-1M, and DukeMTM -- by analyzing nearly 1000 papers that cite them. We found that the creation of derivative datasets and models, broader technological and social change, the lack of clarity of licenses, and dataset management practices can introduce a wide range of ethical concerns. We conclude by suggesting a distributed approach to harm mitigation that considers the entire life cycle of a dataset.

研究の動機と目的

  • 機械学習データセットにおける倫理的懸念が、初期作成を過ぎてもどのように持続するかを理解すること。
  • データセットの撤回、ライセンス、および派生モデルの長期的影響が、倫理的リスクにどのように作用するかを調査すること。
  • データセットのドキュメンテーション、引用慣行、追跡メカニズムにおけるシステム的欠陥を同定すること。
  • データセット作成を越えて、倫理的責任を拡大する分散型ケアモデルを提言すること。
  • データセットの全ライフサイクルにわたる、偏見、プライバシー侵害、不正利用リスクの低減に向けた政策およびコミュニティ慣行を支援すること。

提案手法

  • LFW、MS-Celeb-1M、DukeMTMCを対象とした1,000件の引用論文の縦断的分析を実施。データセット利用、派生データ、事前学習済みモデルに焦点を当てる。
  • 親データセットとその派生データセットのライフサイクルをマッピング。アノテーション済み、処理済み、モデルベースのバリエーションを含む。
  • 特に非営利利用に関する制限を含む、データセットライセンスの実行可能性と一貫性を評価。
  • GitHub上の事前学習済みモデルを追跡し、ライセンス条項の遵守状況および実用的利用状況を評価。
  • 技術的進歩と社会的認識の変化に伴い、倫理的懸念が時間経過でどのように変化するかを分析。
  • 作成者、利用者、プログラム委員会、IRB(機関レビュー委員会)を含む、データセットケアのフレームワークを提言。

実験結果

リサーチクエスチョン

  • RQ1データセットの公式な撤回は、倫理的に問題のあるデータの継続的利用をどの程度効果的に防止できるか。
  • RQ2派生データセットやモデルは、元のデータセットを越えて、どのような新たな倫理的リスクを引き起こすか。
  • RQ3ライセンスは、倫理的でない利用や営利利用をどの程度効果的に制限できるか。
  • RQ4技術的および社会的変化は、時間の経過とともにデータセットの倫理的特性をどのように変化させるか。
  • RQ5現在のデータセットの引用、ドキュメンテーション、追跡慣行における主な欠陥は何か。

主な発見

  • 公式の撤回にもかかわらず、MS-Celeb-1MおよびDukeMTMCのデータは広く利用可能であり、研究分野で継続的に使用されており、撤回だけでは損害を是正できないことが示された。
  • 生産用途を可能にする、あるいは新たなアノテーションを導入するような派生データセットやモデルは、別個の、しばしば無視されている倫理的リスクを引き起こす。
  • MS-Celeb-1Mのようなデータセットを管理するライセンスは一貫性がなく、21件のGitHubリポジトリのうち、わずか3件のみが、そのデータセットで学習されたモデルについて営利利用を明確に制限していた。
  • 技術的進歩により、LFW や ImageNet といったデータセットが新たな生産用途に応用され、作成当時には存在しなかった監視やバイアスといった倫理的懸念が拡大した。
  • 現在の引用およびドキュメンテーション慣行は、恒久的かつアクセス可能なメタデータを保持できていないため、データセットのルート(ルートトレース)を追跡したり、長期的影響を評価したりすることが困難である。
  • 機関レビュー委員会(IRB)は、人間被験者を狭義に定義しており、下流の社会的影響を評価することを禁じているため、データセットの倫理的規制には不適切である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。