Skip to main content
QUICK REVIEW

[論文レビュー] DMLR: Data-centric Machine Learning Research -- Past, Present and Future

Luis Oala, Manil Maskey|TU/e Research Portal|Nov 21, 2023
Scientific Computing and Data Management被引用数 6
ひとこと要約

本論文は、インフラ、データセット、共同研究エコシステムを通じて、データ中心の機械学習(DMLR)を前進させる協働的でコミュニティ主導の枠組みを提案する。過去の主な業績、Croissant や DataPerf といった現在の取り組みを概説し、科学的・社会的・産業的応用分野におけるデータ品質、相互運用性、影響力の向上を図るための継続的なコミュニティ参加を呼びかけている。

ABSTRACT

Drawing from discussions at the inaugural DMLR workshop at ICML 2023 and meetings prior, in this report we outline the relevance of community engagement and infrastructure development for the creation of next-generation public datasets that will advance machine learning science. We chart a path forward as a collective effort to sustain the creation and maintenance of these datasets and methods towards positive scientific, societal and business impact.

研究の動機と目的

  • 機械学習におけるデータ作業の歴史的低評価に応じ、データ中心の研究を根幹的な科学的営みとして推進すること。
  • コミュニティ参加と共有インフラを活用した、公共データセットの作成と維持の持続可能なエコシステムを確立すること。
  • 標準化されたフォーマットとベンチマークを通じて、データの相互運用性、変更可能性、共同作業の障壁を低減すること。
  • 高品質なデータのキュレーションと再利用を促進するインcentives を整えることで、長期的な科学的・社会的影響を生み出すこと。
  • モデル中心のアプローチと補完的に、データ中心の機械学習を将来の AI 進歩の中心的柱と位置づけること。

提案手法

  • ICML 2023 で開催された初回の DMLR ワークショップおよびそれ以前のコミュニティ会議からの知見を統合し、DMLR の現状を把握する。
  • 標準化されたデータフォーマット(例:Croissant)を含む、コミュニティ主導のデータインフラ開発を核とする枠組みを提唱する。
  • データとデータ中心のアルゴリズムを体系的に評価するためのコミュニティ主導のベンチマークスイートである DataPerf を導入する。
  • Kaggle や HuggingFace、OpenML といった既存のプラットフォーム、および Lance などのオープンソースツールを活用して、データのアクセシビリティとパフォーマンスを向上させる。
  • 共有ガバナンスモデルとオープンソース貢献を通じて、共同データキュレーションを推進する。
  • プロンプトベース開発や自動データ検証といったツールを活用して、データ中心の実践を機械学習ワークフローに統合することを奨励する。

実験結果

リサーチクエスチョン

  • RQ1どのようにしてデータ中心の機械学習研究を、持続可能な科学的営みとして制度化できるか?
  • RQ2MLコミュニティ全体でデータの相互運用性と再利用性を向上させるために、どのようなインfraや基準が必要か?
  • RQ3コミュニティ参加と共有所有モデルは、公共データセットの品質と存続期間をどのように向上させられるか?
  • RQ4データ中心の ML 方法やデータセットを評価する際に、最も効果的なベンチマークと評価指標は何か?
  • RQ5ML研究におけるインcentives を再編成することで、モデル革新と同等にデータキュレーションと品質に価値を置けるようにはできないか?

主な発見

  • 本論文は、モデル開発がデータキュレーションよりも優先されがちなML研究におけるインcentives の持続的かつ顕著な不均衡を特定している。例として、MNIST の前身となる基礎的データ収集作業の低引用数が挙げられる。
  • ImageNet や CIFAR のような成功事例は、高品質で適切にキュレートされたデータセットがML分野における変革的進歩をもたらせることを示している。
  • Croissant や DataPerf のような新興の基準とベンチマークツールは、データフォーマットの統一と、データ中心の手法の再現可能性のある評価を可能にする上で不可欠である。
  • Kaggle や HuggingFace、OpenML のようなコミュニティプラットフォームは、データ共有と共同作業の事実上のハブとなっているが、データの変更可能性や互換性に関する課題は未解決のままである。
  • プロンプトベース開発や自動データ検証といったデータ中心の実践をMLワークフローに統合することで、研究の加速とモデルの頑健性向上が可能になる。
  • 科学的・社会的・ビジネス的影響を長期的に実現するためには、データセットの作成と維持を、集団的でコミュニティ主導のアプローチで行うことが不可欠である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。