Skip to main content
QUICK REVIEW

[論文レビュー] Robust Learning from Untrusted Sources

Nikola Konstantinov, Christoph H. Lampert|arXiv (Cornell University)|Jan 29, 2019
Machine Learning and Algorithms被引用数 19
ひとこと要約

本稿では、一般化誤差の上界を最小化することで、信頼できる参照データセットを用いて複数の信頼できないデータソースに適応的な重みを自動的に割り当てる、頑健な学習フレームワークを提案する。統計的学習理論を活用し、局所的な信頼度推定を可能にすることで、さまざまな汚染タイプにおいて、単純な集約法や頑健なベースラインを上回る性能を達成し、高いデータ汚染下でも優れた精度を発揮する。

ABSTRACT

Modern machine learning methods often require more data for training than a single expert can provide. Therefore, it has become a standard procedure to collect data from external sources, e.g. via crowdsourcing. Unfortunately, the quality of these sources is not always guaranteed. As additional complications, the data might be stored in a distributed way, or might even have to remain private. In this work, we address the question of how to learn robustly in such scenarios. Studying the problem through the lens of statistical learning theory, we derive a procedure that allows for learning from all available sources, yet automatically suppresses irrelevant or corrupted data. We show by extensive experiments that our method provides significant improvements over alternative approaches from robust statistics and distributed optimization.

研究の動機と目的

  • 複数の信頼できない、潜在的に汚染されたソースからのデータが与えられた際の、信頼性の高いモデルの学習という課題に対処すること。
  • 完全なデータの点検を必要とせずに、低品質または悪意のあるデータを自動的に同定し、低減する手法を開発すること。
  • データを中央集権的に収集・点検できない分散型またはプライバシー制約のある環境でも、頑健性を保証すること。
  • ソース固有の信頼度スコアを用いて期待損失の上界を最小化することで、一般化性能を向上させること。

提案手法

  • 統計的学習理論に基づき、重み付き経験的リスクに基づく予測子の期待損失の理論的上界を導出する。
  • 小さな信頼できる参照データセットと比較することで、各データソースの信頼性を定量化する信頼度測度を導入する。
  • 得られた一般化誤差の上界を近似的に最小化することで、ソースの重みを学習し、参照データに近いソースを優遇する。
  • 信頼度測度は各ソースで局所的に計算可能であり、勾配ベースの最適化を介して実装可能であり、プライバシー保護型で分散型の展開を可能にする。
  • 標準的な分散学習フレームワークにスムーズに統合可能で、中央集権的および分散型の両方の学習をサポートする。
  • 本手法は下位の学習アルゴリズムに依存せず、一般の教師あり学習タスクに適用可能である。

実験結果

リサーチクエスチョン

  • RQ1データ品質が不確実で、プライバシー制約がデータアクセスを制限する状況において、複数の信頼できないデータソースからどのように頑健に学習できるか?
  • RQ2信頼できないデータソースに適応的重みを割り当てる学習手法に対して、どのような理論的保証を提供できるか?
  • RQ3参照データセットとの比較に基づく信頼度測度が、分散環境において汚染済みまたは不適切なデータを効果的に抑制できるか?
  • RQ4提案手法は、すべてのデータを用いた単純な集約法(すべてのデータ)や参照データのみを用いた学習と比べて、どのような汚染タイプにおいても優れているか?
  • RQ5本手法は、生データを共有せずに、プライバシー保護型または分散型の学習環境にどの程度展開可能か?

主な発見

  • 提案手法は、85の予測タスクすべてにおいて、すべてのデータを用いた学習(汚染下で性能が低下)および参照データセットのみを用いた学習を一貫して上回った。
  • 20%のラベルバイアス下で、n=10の条件下で85タスク中85件の正例を達成し、(Feng et al., 2014)が5件、(Yin et al., 2018)が25件を達成したのに対し、顕著に優れた性能を示した。
  • シャッフルされたラベルの状況では、n=10で84件の正例を達成し、(Pregibon, 1982)が47件、(Yin et al., 2018)が17件を達成したのを上回った。
  • ぼやけた画像の状況では、n=10で84件の正例を達成し、(Pregibon, 1982)が57件、(Yin et al., 2018)が15件を達成したのを上回った。
  • 本手法は、ラベルバイアス、シャッフルされたラベル、ぼやけた画像、死線、RGBチャネルの入れ替えといった多様な汚染タイプに対して一貫した優位性を示し、複数のベースラインを上回った。
  • 本手法は、高い汚染度(p=0.2)下でも高い性能を維持し、データが分散型またはプライベートな状況下でも精度に劣化が生じないことを確認した。これにより、スケーラビリティとプライバシー準拠性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。