Skip to main content
QUICK REVIEW

[論文レビュー] Impact of Biases in Big Data

Patrick Glauner, Petko Valtchev|arXiv (Cornell University)|Mar 2, 2018
Imbalanced Data Classification Techniques参考文献 21被引用数 9
ひとこと要約

この論文は、ビッグデータ機械学習における2大バイアスであるクラス不均衡とコバリエートシフトを体系的にレビューし、単に大量のデータを用いるだけでは信頼性の高いモデルが得られないことを示している。コバリエートシフトの検出にはマシューの相関係数と意思決定木を用いた定量化手法を提案し、インスタンス重み付けやヘックマン法といった是正手法も提示。代表的なデータが、単なるデータ量よりも重要であることが示された。

ABSTRACT

The underlying paradigm of big data-driven machine learning reflects the desire of deriving better conclusions from simply analyzing more data, without the necessity of looking at theory and models. Is having simply more data always helpful? In 1936, The Literary Digest collected 2.3M filled in questionnaires to predict the outcome of that year's US presidential election. The outcome of this big data prediction proved to be entirely wrong, whereas George Gallup only needed 3K handpicked people to make an accurate prediction. Generally, biases occur in machine learning whenever the distributions of training set and test set are different. In this work, we provide a review of different sorts of biases in (big) data sets in machine learning. We provide definitions and discussions of the most commonly appearing biases in machine learning: class imbalance and covariate shift. We also show how these biases can be quantified and corrected. This work is an introductory text for both researchers and practitioners to become more aware of this topic and thus to derive more reliable models for their learning problems.

研究の動機と目的

  • 研究者および実務家に対して、機械学習におけるデータバイアスの影響についての認識を高めること。
  • 特にクラス不均衡とコバリエートシフトを含む、最も一般的なデータバイアスを特定・定義すること。
  • トレーニングデータおよびテストデータの分布におけるバイアスの有無と深刻度を定量化可能な手法を提供すること。
  • インスタンス重み付けやヘックマン法といった是正技術を提示し、バイアスの影響を軽減すること。
  • データの代表性が、モデルの信頼性においてデータ量を上回る重要性を持つという主張をすること。

提案手法

  • トレーニングデータとテストデータ間のコバリエートシフトの大きさを定量化するために、マシューの相関係数(MCC)を用いる。
  • 二値ラベル(s=1:トレーニング、s=0:テスト)を導入することで、意思決定木学習を用いてトレーニングデータとテストデータの分布を区別する。
  • コバリエートシフトの是正のために、インスタンス重み付けに密度推定を適用し、モデル学習中に是正を行う。
  • 線形回帰に適応したヘックマン法を用いて、トレーニングデータの選択バイアスを是正するが、線形モデルに限定される。
  • グローバル・ラーナーとローカル・ラーナーの違いを分析:グローバル・ラーナーはP(X)に依存するが、ローカル・ラーナーはP(Y|X)にのみ依存するため、コバリエートシフトに対して感受性が低い。
  • ニューラルネットワークの各層の入力の正規化を提案し、内部コバリエートシフトを軽減することで、学習収束性の向上と過学習リスクの低減を図る。

実験結果

リサーチクエスチョン

  • RQ1クラス不均衡とコバリエートシフトは、機械学習モデルの信頼性および一般化性能にどのように影響を与えるか?
  • RQ2実世界のデータセットにおいて、コバリエートシフトの有無と深刻度を的確に定量化するための指標は何か?
  • RQ3データの代表性が、モデル性能の向上において、データ量を上回る程度の重要性を持つとは言えるか?
  • RQ4ディープニューラルネットワークにおける内部コバリエートシフトのようなバイアスは、学習中にどのように是正できるか?
  • RQ5非線形学習の場面では、ヘックマン法のような既存の是正手法にどのような制限があるか?

主な発見

  • 1936年の『リーダーズ・マガジン』の選挙予測は、自動車所有者および電話利用者から構成された偏ったサンプル(230万人の回答)のため失敗したが、これはデータ量が代表性を補うことはできないことを示している。
  • ジョージ・ギャラップの3,000人の手動ピックアップされたサンプルによる正確な予測は、大規模だが代表的でないデータよりも、偏りのないサンプリングの重要性を強調している。
  • トレーニングデータとテストデータを分類するように訓練した意思決定木にマシューの相関係数(MCC)を適用することで、コバリエートシフトの大きさを定量化可能な指標が得られる。
  • グローバル・ラーナー(意思決定木やソフトマージンSVMなど)はコバリエートシフトに感受性が強いが、ローカル・ラーナー(ロジスティック回帰やハードマージンSVMなど)は感受性が低い。
  • 密度推定によるインスタンス重み付けとヘックマン法は、コバリエートシフトの是正に有効だが、後者は線形モデルに限定される。
  • ディープネットワークにおける内部コバリエートシフトは学習を遅くし、過学習のリスクを高めるが、各層の入力正規化によって軽減可能であり、収束性と一般化性能の向上が図れる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。