Skip to main content
QUICK REVIEW

[論文レビュー] Active Learning for Regression Using Greedy Sampling

Dongrui Wu, Chin‐Teng Lin|arXiv (Cornell University)|Aug 8, 2018
Machine Learning and Algorithms参考文献 24被引用数 4
ひとこと要約

本稿では、モデル再訓練を必要とせず、特徴空間および出力空間における多様性に基づいて情報量の多いサンプルを選択する2つの新しい回帰用アクティブラーニング(ALR)手法—GSx(入力空間におけるグリーディサンプリング)およびiGS(入力空間および出力空間におけるグリーディサンプリング)—を提案する。iGSは12個のUCI/StatLibデータセットおよび15名のEEGを用いたドライバーの眠気推定タスクにおいて、QBCやEMCMを含む既存手法を上回り、RMSEおよびCCにおいて統計的に有意な改善を達成した。

ABSTRACT

Regression problems are pervasive in real-world applications. Generally a substantial amount of labeled samples are needed to build a regression model with good generalization ability. However, many times it is relatively easy to collect a large number of unlabeled samples, but time-consuming or expensive to label them. Active learning for regression (ALR) is a methodology to reduce the number of labeled samples, by selecting the most beneficial ones to label, instead of random selection. This paper proposes two new ALR approaches based on greedy sampling (GS). The first approach (GSy) selects new samples to increase the diversity in the output space, and the second (iGS) selects new samples to increase the diversity in both input and output spaces. Extensive experiments on 12 UCI and CMU StatLib datasets from various domains, and on 15 subjects on EEG-based driver drowsiness estimation, verified their effectiveness and robustness.

研究の動機と目的

  • 回帰における高コストなラベル付けの課題に対処し、アクティブラーニングによって必要なラベル付きサンプル数を削減すること。
  • モデル再訓練に依存するか、サンプルの多様性を十分に捉えていない既存のALR手法の限界を克服すること。
  • 計算コストが低く、モデルに依存しないALRアプローチを開発し、最小限のラベル付きデータで一般化性能を向上させること。
  • UCI/StatLibデータセットおよび実世界のEEGを用いたドライバーの眠気推定タスクを含む多様な回帰タスクにおいて、提案手法を評価すること。
  • 入力空間および出力空間における多様性を組み合わせたサンプル選択が、回帰精度の向上に寄与することを実証すること。

提案手法

  • 入力(特徴)空間における多様性に基づくグリーディサンプリング手法であるGSxを提案。最初にラベルなしプールの重心に最も近いサンプルを選択し、以降はすでに選択済みのすべてのサンプルから最も遠いサンプルを逐次選択する。
  • GSxを拡張し、出力(目的変数)空間における多様性を最大化するGSyを導入。出力空間の多様性は、未ラベルサンプルの予測出力と既に選択済みサンプルの予測出力との距離によって計算される。
  • 入力空間および出力空間の両方の多様性を組み合わせたハイブリッド手法iGSを開発。特徴空間および出力空間における分離度を考慮した合成距離尺度を用いる。
  • 多様性の測定にはユークリッド距離を用いる:GSxでは $ d_n^x = \min_m ||\mathbf{x}_n - \mathbf{x}_m|| $;GSyでは $ d_n^y = \min_m ||\hat{y}_n - \hat{y}_m|| $;iGSでは両者の重み付き組み合わせを用いる。
  • モデル再訓練なしに逐次的にサンプルを選択するプールベースのアクティブラーニングフレームワークを採用し、計算コストを低く抑える。
  • リッジ回帰をベースモデルとして用い、RMSEおよび相関係数(CC)を指標に性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1入力空間における多様性に基づくグリーディサンプリング(GSx)は、ランダムまたは不確実性ベースのサンプリングと比較して、回帰のためのアクティブラーニングを改善できるか?
  • RQ2出力空間における多様性を組み込む(GSy)ことで、入力空間のみの多様性に比べて回帰性能が向上するか?
  • RQ3入力空間および出力空間における多様性を組み合わせた(iGS)ことで、多様な回帰タスクにおいて優れた性能が得られるか?
  • RQ4提案手法iGSは、QBCやEMCMなどの既存のALRベースラインと比較して、複数のデータセットにおいてロバスト性および一般化性能に優れているか?
  • RQ5EEGを用いたドライバーの眠気推定という、高コストなラベル付けが求められる実世界の状況において、本手法は有効であるか?

主な発見

  • iGSはEEGベースのドライバーの眠気推定タスクにおける全15名の被験者において、RMSEおよびCCの両指標でBL、QBC、EMCM、GSx、GSyを上回る平均的な性能を達成した。
  • iGSは他のすべての手法と比較してRMSEで統計的に有意な改善(p < 0.001)を示し、CCについてもGSxを除くすべての手法と比較して有意(p = 0.0394)であった。これにより、iGSのロバスト性と優位性が裏付けられた。
  • GSxはRMSEおよびCCにおいてQBCおよびEMCMを有意に上回り、回帰のためのアクティブラーニングにおける入力空間の多様性の有効性を裏付けた。
  • GSyはRMSEにおいてQBCおよびEMCMを有意に上回り、またGSxと比較しても有意な改善(p = 0.0955)を示した。これは出力空間の多様性が性能向上に寄与することを示している。
  • 12個のUCIおよびCMU StatLibデータセットにおいて、iGSは一貫して最高の性能を示し、GSyおよびGSxもベースライン手法を上回った。
  • 統計的分析により、提案されたすべてのALR手法がベースライン(BL)と比較してRMSEを有意に低減し、CCを向上させた。これは、多様な回帰タスクにおいて本手法の有効性が確認されたことを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。