Skip to main content
QUICK REVIEW

[論文レビュー] Supervised Learning for Multi-Block Incomplete Data

Hadrien Lorenzo, Jérôme Saracco|arXiv (Cornell University)|Jan 14, 2019
Statistical Methods and Inference参考文献 37被引用数 4
ひとこと要約

本稿では、Koh-Lantaと呼ばれる新アルゴリズムを用いて、変数選択、部分空間推定、欠損値補完を統合的に行う、mdd-sPLSと呼ばれる新しい教師ありマルチブロックPLS手法を提案する。この手法は、平均補完、nipals、softImpute、imputeMFAといった従来の2段階手法と比較して、特にブロック内およびブロック間相関が高い状況下で予測誤差が最小となり、高次元で欠損値を含むデータ設定において優れた性能を示す。

ABSTRACT

In the supervised high dimensional settings with a large number of variables and a low number of individuals, one objective is to select the relevant variables and thus to reduce the dimension. That subspace selection is often managed with supervised tools. However, some data can be missing, compromising the validity of the sub-space selection. We propose a Partial Least Square (PLS) based method, called Multi-block Data-Driven sparse PLS mdd-sPLS, allowing jointly variable selection and subspace estimation while training and testing missing data imputation through a new algorithm called Koh-Lanta. This method was challenged through simulations against existing methods such as mean imputation, nipals, softImpute and imputeMFA. In the context of supervised analysis of high dimensional data, the proposed method shows the lowest prediction error of the response variables. So far this is the only method combining data imputation and response variable prediction. The superiority of the supervised multi-block mdd-sPLS method increases with the intra-block and inter-block correlations. The application to a real data-set from a rVSV-ZEBOV Ebola vaccine trial revealed interesting and biologically relevant results. The method is implemented in a R-package available on the CRAN and a Python-package available on pypi.

研究の動機と目的

  • 教師あり学習設定における欠損共変量を含む高次元データの課題に対処すること。
  • データ補完とその後の解析を別々に行う2段階的手法の限界を克服すること。
  • 同時に変数選択、部分空間推定、欠損値補完を実行する統合手法の開発。
  • ブロック単位の相関を活用することで、不完全なマルチブロックデータにおける応答変数の予測精度を向上させること。
  • 現実の生物学的・医療的データセットにおける欠損値に対し、計算的に効率的かつ統計的に頑健なソリューションを提供すること。

提案手法

  • L1正則化最適化による変数選択を統合した教師ありマルチブロックPLS手法、mdd-sPLSの提案。
  • SVDに基づく補完とPLSに基づく推定を交互に繰り返すことで、補完と予測を統合するKoh-Lantaアルゴリズムの導入。
  • 現在のPLS成分から得られる低ランク近似を用いて、反復的に欠損値を更新するデータ駆動型アプローチの採用。
  • 予測子ブロックおよび応答ブロックにおける関連変数の選択のため、L1ノルム正則化を適用したスパースPLSの適用。
  • 非凸問題を解くために、凹成分を調整パrameter κによって低減する交互最適化の採用。
  • ブロック間の比較可能性を確保するため、分析前にすべてのデータ行列を平均0、分散1に標準化する。

実験結果

リサーチクエスチョン

  • RQ1統合的手法は、高次元でマルチブロックなデータにおいて、欠損値補完と教師あり予測を同時に実行できるか?
  • RQ2mdd-sPLSの性能は、平均補完や分析後に補完する2段階手法(例:impute-then-analyze)と比較して、予測誤差の観点でどのように異なるか?
  • RQ3ブロック内およびブロック間相関の程度が変化する条件下でも、本手法は優れた性能を維持するか?
  • RQ4個体数の増加に伴い、mdd-sPLSは既存手法と比較して予測精度がどのように変化するか?
  • RQ5ブロック構造が弱い低相関設定下でも、mdd-sPLSは頑健性を示すか?

主な発見

  • mdd-sPLSは、すべてのシミュレーション設定で予測誤差(RMSEP)が最小であり、特にブロック内およびブロック間相関が高い状況で顕著に優れた性能を示す。
  • 平均補完、nipals、softImpute、imputeMFAと比較して顕著に優れており、予測誤差は常に競合手法を下回る。
  • 低相関設定(ρd = 0.3, ρt = 0.5)では、すべての手法が同程度の性能を示し、RMSEP ≈ 0.73となるが、Lassoベースの手法は誤差が高くなる(≈ 0.83)。
  • 個体数が増加するにつれて、mdd-sPLS(Koh-Lantaを用いて)の予測精度が著しく向上し、nipals + クラシックsPLSですら上回る。
  • mdd-sPLS(Koh-Lantaを用いて)は、あらゆる条件下で最小の誤差を維持しており、相関が高い状況で特に優れた性能を発揮する。
  • 実際のrVSV-ZEBOVエボラワクチンデータセットにおいて、4つの関連共変量(各成分2つずつ)を正しく同定し、交差検証(1人を除いた交差検証)で完全なグループ割り当てを達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。