Skip to main content
QUICK REVIEW

[論文レビュー] Data Cleaning and Machine Learning: A Systematic Literature Review

Pierre-Olivier Côté, Amin Nikanjam|arXiv (Cornell University)|Oct 3, 2023
Data Quality and Management被引用数 6
ひとこと要約

本システマティックレビューでは、2016年から2022年までの101件の研究を統合し、機械学習のためのデータクリーニング(DC4ML)およびデータクリーニングのための機械学習(ML4DC)について、特徴量クリーニング、ラベルクリーニング、エンティティマッチング、外れ値検出、補完、包括的クリーニングの6つのコアなデータクリーニング活動を特定した。本研究では、データ拡張、パブリックデータセット、ツール開発、大規模言語モデル(LLMs)、包括的アプローチ、インタラクティブクリーニングを重視した、24の実行可能な今後の研究方向性を提示した。

ABSTRACT

Context: Machine Learning (ML) is integrated into a growing number of systems for various applications. Because the performance of an ML model is highly dependent on the quality of the data it has been trained on, there is a growing interest in approaches to detect and repair data errors (i.e., data cleaning). Researchers are also exploring how ML can be used for data cleaning; hence creating a dual relationship between ML and data cleaning. To the best of our knowledge, there is no study that comprehensively reviews this relationship. Objective: This paper's objectives are twofold. First, it aims to summarize the latest approaches for data cleaning for ML and ML for data cleaning. Second, it provides future work recommendations. Method: We conduct a systematic literature review of the papers published between 2016 and 2022 inclusively. We identify different types of data cleaning activities with and for ML: feature cleaning, label cleaning, entity matching, outlier detection, imputation, and holistic data cleaning. Results: We summarize the content of 101 papers covering various data cleaning activities and provide 24 future work recommendations. Our review highlights many promising data cleaning techniques that can be further extended. Conclusion: We believe that our review of the literature will help the community develop better approaches to clean data.

研究の動機と目的

  • 機械学習のためのデータクリーニング(DC4ML)およびデータクリーニングのための機械学習(ML4DC)における最近の進展を包括的に要約し、両分野の二重的関係に対処すること。
  • 特徴量クリーニング、ラベルクリーニング、エンティティマッチング、外れ値検出、補完、包括的データクリーニングの6つのコアなデータクリーニング活動における最新の技術を特定・分類すること。
  • 研究者および実務家が機械学習システムのデータ品質を向上させるために、根拠に基づいた実行可能な今後の研究方向性を提示すること。
  • データ中心のAI(DCAI)の動向を支援するために、最新のデータクリーニング手法の構造的で根拠に基づいた概要を提供すること。
  • 透明なフィルタリング、品質管理、パブリックな再現パッケージを備えたシステマティックレビュー(SLR)により、方法論的厳密性と再現可能性を確保すること。

提案手法

  • PRISMAガイドラインに従ったシステマティックレビュー(SLR)を実施し、IEEE Xplore、ACM Digital Library、Springerを含む主要な学術データベースから2016年から2022年までの出版物をカバーした。
  • 複数段階のフィルタリングプロセスを適用:キーワードとスノーボール手法による初期検索の後、関連性、データタイプ(表形式、テキスト、画像)、出版の質に基づく含む/除外する基準を設けた。
  • 方法論的厳密性を評価し、選択された論文の正確な解釈を保証するために品質管理の質問を用い、各フィルタリング段階で二重レビューによる検証を実施した。
  • 6つのカテゴリに分類できるデータクリーニング活動の分類法(分類ツリー)を構築した:特徴量クリーニング、ラベルクリーニング、エンティティマッチング、外れ値検出、補完、包括的クリーニング。
  • 再現性と明確さに注力し、101件の高品質な論文から主要な技術、モデル、評価指標を抽出・統合した。
  • すべてのフィルタリング済み論文、品質評価、抽出データを含む、GitHub上のパブリックな再現パッケージを提供し、透明性と再現性を確保した。

実験結果

リサーチクエスチョン

  • RQ12016年から2022年までの間、機械学習モデルのパフォーマンス向上を目的としたデータクリーニング技術で、最も顕著に使われたものは何か(DC4ML)?
  • RQ2最近の機械学習の進展は、データクリーニングプロセスの自動化または強化にどのように応用されているか(ML4DC)?
  • RQ3特徴量クリーニング、ラベル補正、外れ値検出などのデータクリーニング活動の中で、どれが最も活発に研究されており、その主な手法は何か?
  • RQ4文献に基づく現在の機械学習のためのデータクリーニングアプローチにおける主なギャップと制限は何か?
  • RQ5機械学習システムにおけるデータクリーニングを前進させるために、最も有望な今後の研究方向性は何か?

主な発見

  • 2016年から2022年までの間に発表された関連論文として101件を同定し、多様なデータタイプ(表形式、テキスト、画像)およびデータクリーニング活動をカバーした。
  • 特徴量クリーニングとラベルクリーニングが最も頻繁に研究されており、モデルの不確実性、アクティブラーニング、ウェイクアップ・スーパービジョンを活用した手法が用いられている。
  • 外れ値検出および補完技術は、特に高次元またはノイズの多いデータ環境において、深層学習および自己教師ありモデルをますます活用している。
  • エンティティマッチングおよび包括的クリーニングは注目を集めつつあり、最近のアプローチではグラフニューラルネットワークとマルチタスク学習を組み合わせて精度を向上させている。
  • 多くの研究が合成データまたは特許データセットに依存していることが判明し、より多くのパブリックで高品質なデータクリーニングベンチマークの必要性が顕著になった。
  • 本研究では、大規模言語モデル(LLMs)を用いたデータクリーニング、データ拡張の改善、インタラクティブでユーザー参加型のクリーニングツールの開発を含む、24の今後の研究方向性を同定した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。