Skip to main content
QUICK REVIEW

[論文レビュー] Deep Learning Partial Least Squares

Nicholas Polson, Vadim Sokolov|arXiv (Cornell University)|Jun 26, 2021
Spectroscopy and Chemometric Analyses参考文献 47被引用数 6
ひとこと要約

本稿では、非線形性、スケーラビリティ、解釈可能性を兼ね備えた予測モデリングと不確実性の定量化を可能にする、深層学習を部分最小二乗法(PLS)に統合したDL-PLS(Deep Learning Partial Least Squares)フレームワークを提案する。特徴抽出に特化したSVDに基づくXスコアの深層学習としてのYスコアのモデリングにより、スクリープロットやMCMCによるベイズ的不確実性といった診断ツールを併用し、赤ワインの品質およびオレンジジュースの好みのデータセットにおいて、従来手法を上回る予測性能を達成した。

ABSTRACT

High dimensional data reduction techniques are provided by using partial least squares within deep learning. Our framework provides a nonlinear extension of PLS together with a disciplined approach to feature selection and architecture design in deep learning. This leads to a statistical interpretation of deep learning that is tailor made for predictive problems. We can use the tools of PLS, such as scree-plot, bi-plot to provide model diagnostics. Posterior predictive uncertainty is available using MCMC methods at the last layer. Thus we achieve the best of both worlds: scalability and fast predictive rule construction together with uncertainty quantification. Our key construct is to employ deep learning within PLS by predicting the output scores as a deep learner of the input scores. As with PLS our X-scores are constructed using SVD and applied to both regression and classification problems and are fast and scalable. Following Frank and Friedman 1993, we provide a Bayesian shrinkage interpretation of our nonlinear predictor. We introduce a variety of new partial least squares models: PLS-ReLU, PLS-Autoencoder, PLS-Trees and PLS-GP. To illustrate our methodology, we use simulated examples and the analysis of preferences of orange juice and predicting wine quality as a function of input characteristics. We also illustrate Brillinger's estimation procedure to provide the feature selection and data dimension reduction. Finally, we conclude with directions for future research.

研究の動機と目的

  • ブラックボックス型の深層学習と解釈可能な統計的モデリングの間のギャップを埋めるために、深層学習を部分最小二乗法(PLS)に統合すること。
  • 特徴選択、アーキテクチャ設計、モデル診断を併せ持つ、統計的に解釈可能な非線形拡張PLSを提供すること。
  • 最終層でのMCMCを用いた不確実性定量化により、スケーラビリティと統計的厳密性を両立した深層学習における不確実性の定量化を可能にすること。
  • PLS-ReLU、PLS-Autoencoder、PLS-Trees、PLS-GPといった新たなアーキテクチャを含む、多様な予測タスクに適したPLSの拡張を実現すること。
  • 変数拡張およびBrillingerの推定法を用いて、実世界のデータセット(赤ワインの品質およびオレンジジュースの好み)において、フレームワークの有効性を実証すること。

提案手法

  • 入力データXに対してSVDを適用し、Xスコア(T)を計算。これにより、深層学習のための低次元特徴が得られる。
  • Yスコア(U)をXスコア(T)の深層ニューラルネットワーク(G_L)としてモデル化。これにより、PLSの次元削減の利点を保ちつつ非線形予測が可能になる。
  • Steinの補題に基づくBrillingerの推定手順を用いて、データから非線形活性化関数(例:ReLU、tanh)を回復する。
  • 最終層でMCMC手法を適用し、事後予測不確実性を取得。これにより、深層学習における統計的推論が可能になる。
  • PLSを適用する前に、変数拡張(例:二次項および交互作用項)を用いて非線形モデリング能力を向上させる。
  • 新たなPLS変種を導入:PLS-ReLU(ReLU活性化)、PLS-Autoencoder(ノイズ除去オートエンコーダ)、PLS-Trees(木構造ベース)、PLS-GP(ガウス過程)を用い、柔軟なモデリングを実現する。

実験結果

リサーチクエスチョン

  • RQ1深層学習を部分最小二乗法に体系的に統合することで、非線形的で解釈可能かつスケーラブルな予測フレームワークを構築できるか?
  • RQ2特徴選択およびアーキテクチャ設計の文脈で、スクリープロットやバイプロットといったモデル診断ツールが、深層学習の文脈でも維持可能か?
  • RQ3標準的な深層学習および古典的PLSと比較して、DL-PLSフレームワークは予測精度および不確実性定量化においてどの程度向上を達成するか?
  • RQ4PLSに基づく特徴抽出を用いた深層学習の文脈で、Brillingerの手法が非線形活性化関数(例:ReLU、tanh)をデータから回復できるか?
  • RQ5DL-PLSフレームワークは、赤ワインの品質およびオレンジジュースの好みといった実世界の高次元データセットにおいて、どの程度の性能を示すか?

主な発見

  • 赤ワインの品質データセットにおいて、77変数の拡張セットを用いたPLSは、サンプル外精度0.60を達成し、OLS(0.575)およびPCR(0.595)を上回った。
  • 77-16-32-16-6というアーキテクチャの深層ニューラルネットワークは、サンプル外分類精度88.9%を達成したが、Brillingerの手法を適用後はわずかに88.5%に低下した。
  • シミュレーションスタディにおいて、DL-PLSフレームワークはBrillingerの推定手順を用いて、ReLUおよびtanh活性化関数を成功裏に回復した。
  • 変数拡張(二次項および交互作用項)の適用により、すべての線形モデル(OLS、PCR、PLS)において、モデルの適合度およびサンプル外性能が顕著に向上した。
  • スクリープロットおよびバイプロットが、DL-PLSフレームワークにおいて、モデルの構成要素の診断および潜在的要因の選択を支援するために効果的に用いられた。
  • 最終層でのMCMCを用いた不確実性定量化により、深層学習の文脈における統計的推論が成功裏に実現された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。