Skip to main content
QUICK REVIEW

[論文レビュー] Reinforced Data Sampling for Model Diversification

Hoang D. Nguyen, Xuan-Son Vu|arXiv (Cornell University)|Jun 12, 2020
Data Stream Mining Techniques参考文献 17被引用数 5
ひとこと要約

本稿では、複数のベースモデルを価値関数として活用することで、多様で潜在的価値の高いデータサブセットを選択する強化学習ベースの手法である強化データサンプリング(RDS)を提案する。RDSは分類および回帰タスクにおいて、アンサンブルモデルとベースモデルの精度を顕著に向上させ、4つの実世界データセットでランダム、ストラティファイド、事前設定スプリットといった従来のサンプリング手法を上回る性能を示す。

ABSTRACT

With the rising number of machine learning competitions, the world has witnessed an exciting race for the best algorithms. However, the involved data selection process may fundamentally suffer from evidence ambiguity and concept drift issues, thereby possibly leading to deleterious effects on the performance of various models. This paper proposes a new Reinforced Data Sampling (RDS) method to learn how to sample data adequately on the search for useful models and insights. We formulate the optimisation problem of model diversification $δ{-div}$ in data sampling to maximise learning potentials and optimum allocation by injecting model diversity. This work advocates the employment of diverse base learners as value functions such as neural networks, decision trees, or logistic regressions to reinforce the selection process of data subsets with multi-modal belief. We introduce different ensemble reward mechanisms, including soft voting and stochastic choice to approximate optimal sampling policy. The evaluation conducted on four datasets evidently highlights the benefits of using RDS method over traditional sampling approaches. Our experimental results suggest that the trainable sampling for model diversification is useful for competition organisers, researchers, or even starters to pursue full potentials of various machine learning tasks such as classification and regression. The source code is available at https://github.com/probeu/RDS.

研究の動機と目的

  • 機械学習コンペティションおよび実世界のタスクにおいて、モデルの一般化性能を低下させる証拠の曖昧さとコンセプトドリフトを解消するためのデータサンプリングの課題に取り組む。
  • 多様なデータサブセットの選択を通じて学習の潜在的価値を最大化する、モデル多様化(δ-div)の最適化問題を定式化する。
  • 多様なベースラーナー(例:ニューラルネットワーク、決定木、ロジスティック回帰)を価値関数として活用し、データ選択をガイドするトレーニング可能なサンプリングフレームワークを開発する。
  • 強化学習における最適なサンプリング方策を近似するための新規アンサンブル報酬メカニズム(ソフトボーリングと確率的選択)を導入する。
  • クラスバランスを維持しながら、モデルの多様性と性能を向上させる割合的で分布正則化されたサンプリングを可能にする。

提案手法

  • モデル多様化問題δ-divを、多様なベースモデルにおける学習潜在力の最大化を目指すデータサブセットのサンプリングを学習する強化学習タスクとして定式化する。
  • 長期的な報酬を推定するために、多様なベースラーナー(例:SVM、正則化回帰、ニューラルネットワーク、決定木)を価値関数として採用する。
  • 2つの新規報酬メカニズムを導入:アンサンブルの一貫性を向上させるためのソフトボーリング、および多様性を高めるためにモデルの不一致を注入するための確率的選択。
  • 報酬をモデルのパフォーマンスと複数の学習エピソードにおける多様性指標に基づいて調整したポリシー勾配法を用いて、サンプラーを訓練する。
  • 特に不均衡データセットにおいて重要な、クラス間のバランスを保つために分布正則化を適用する。
  • エンドツーエンドのフレームワークを採用し、サンプラーは全データセット上で訓練され、機械学習パイプラインの初期段階に適用可能である。

実験結果

リサーチクエスチョン

  • RQ1強化学習を用いて、モデルの多様性と学習潜在力を向上させるデータサンプラーを効果的に訓練できるか?
  • RQ2ソフトボーリングと確率的選択という異なるアンサンブル報酬メカニズムは、訓練済みサンプラーの性能にどのように影響するか?
  • RQ3RDSは、ランダム、ストラティファイド、事前設定スプリットといった古典的手法を上回る性能を、多様な機械学習タスクにおけるモデルの精度と多様性の観点で示せるか?
  • RQ4不均衡データセットにおいて、RDSはモデル性能を向上させる一方で、クラスバランスをどの程度維持できるか?
  • RQ5RDSフレームワークは、テキスト、画像、表形式といった異なるデータタイプおよびモデルアーキテクチャに一般化可能か?

主な発見

  • 確率的選択報酬メカニズムを用いたRDSは、Madelonデータセットで、すべてのベースライン(ストラティファイドおよび事前設定スプリットを含む)を大きく上回り、ロジスティック回帰性能で6.7%の向上を達成(0.5997 vs. 0.5350)。
  • Drug Reviewsデータセットでは、RDS STOがMLPモデル性能で10.5%の向上を達成(0.6354 vs. 0.5802)し、最良のベースラインを上回った。
  • RDS DETは全データセットで一貫した性能向上を示し、MNISTではアンサンブル精度が1.5%向上(0.6057 vs. 0.5983)、Kalapa信用スコアリングデータセットでも1.5%の向上(0.6096 vs. 0.5953)を記録した。
  • 確率的選択メカニズムは、決定論的手法に比べて優れた最適化ダイナミクスを示し、収束が速く、学習勾配がより安定していた。
  • RDSはストラティファイドサンプリングと同等のクラス比バランスを維持しながら、モデルパフォーマンスで顕著に優れており、多様性とバランスを同時に最適化可能であることを示した。
  • 提案手法は、二値分類および多値分類、回帰タスクを含む4つのベンチマークデータセット(Madelon、Drug Reviews、MNIST、Kalapa)において、すべてで最先端の性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。