Skip to main content
QUICK REVIEW

[論文レビュー] Fast Penalized Regression and Cross Validation for Tall Data with the oem Package

Jared D. Huling, Peter Z. G. Qian|arXiv (Cornell University)|Jan 29, 2018
Statistical Methods and Inference被引用数 8
ひとこと要約

この論文は、観察数が変数数よりも著しく多い大規模な「タール」データ設定(n ≫ p)において、高速なペナルティ付き回帰および交差検証を実現する高性能なRパッケージoemを紹介する。このパッケージは、最適化されたC++およびOpenMP並列処理を活用した直交化期待最大化(OEM)アルゴリズムを採用しており、lasso、MCP、リッジ・エラスティック・ネットなどの複数のペナルティに対して、チューニング・パラメータのパスを効率的に計算可能である。また、RAMに収まらない巨大なデータセットに対してもメモリ外処理をサポートしており、テラバイト規模のデータ処理が可能である。

ABSTRACT

A large body of research has focused on theory and computation for variable selection techniques for high dimensional data. There has been substantially less work in the big tall data paradigm, where the number of variables may be large, but the number of observations is much larger. The orthogonalizing expectation maximization (OEM) algorithm is one approach for computation of penalized models which excels in the big tall data regime. The oem package is an efficient implementation of the OEM algorithm which provides a multitude of computation routines with a focus on big tall data, such as a function for out-of-memory computation, for large-scale parallel computation of penalized regression models. Furthermore, in this paper we propose a specialized implementation of the OEM algorithm for cross validation, dramatically reducing the computing time for cross validation over a naive implementation.

研究の動機と目的

  • 観察数nが変数数pよりも著しく多い『タール』データ設定(n ≫ p)において、ペナルティ付き回帰の計算ボトルネックを解消すること。この領域はp ≫ nの設定と比較してまだ十分に研究が進んでいない。
  • lasso、MCP、エラスティック・ネットなどの複数のペナルティ付き回帰モデルを同時に、最小限の計算オーバーヘッドで統合的かつ効率的に推定するフレームワークの構築。
  • モデル選択の主要なボトルネックである交差検証の時間コストを、OEMに基づく特化した交差検証アルゴリズムにより低減すること。
  • RAMに収まらないデータセットに対しても、ディスク上に保存された行列を用いたメモリ外計算を可能とし、テラバイト規模のデータ処理を実現すること。
  • 効率的なチューニング・パラメータ選択と、XᵀXやXᵀyといった事前に計算済みの統計量へのアクセスを提供することで、実用的なモデル適合ワークフローを支援すること。

提案手法

  • Eigenライブラリを用いてC++で高速な数値線形代数を実装した直交化期待最大化(OEM)アルゴリズムを実装する。
  • RcppEigenを用いて効率的なRインタフェースを提供し、Rワークフローへのシームレスな統合を実現する。
  • 大規模データセットの計算を高速化するため、複数のCPUコアを活用した共有メモリ並列処理(OpenMP)を活用する。
  • OEMアルゴリズムからの中間計算を再利用する特殊な交差検証ルーチンを設計し、重複計算を削減することで、交差検証の実行時間を著しく短縮する。
  • bigmemoryパッケージを統合して、ディスク上に保存されたデータへの参照を可能とし、全データをRAMにロードせずにモデルを適合可能にするメモリ外計算を実現する。
  • XᵀXやXᵀyといった事前計算済み統計量を扱えるインターフェースを提供することで、データが分散化されている場合やHPCクラスタ上で事前に処理済みの環境でも効率的な分析が可能になる。

実験結果

リサーチクエスチョン

  • RQ1n ≫ p の『タール』データ環境において、ペナルティ付き回帰をどのようにして計算的に効率化できるか。特に、複数のペナルティを評価する必要がある場合に有効な手法は何か。
  • RQ2lasso、MCP、エラスティック・ネットなどの複数のペナルティに対して、チューニング・パラメータの全パスを、単一ペナルティ法と同等の性能で一元的に計算できる統合フレームワークを構築可能か。
  • RQ3ペナルティ付き回帰における交差検証の計算コストを著しく低減するために、どのような最適化が可能か。
  • RQ4RAMに収まらないデータセットに対しても、ペナルティ付き回帰モデルをどのようにして適合できるか。また、実世界の大規模データ応用に与える実用的インパクトは何か。
  • RQ5glmnet、ncvreg、gglassoといった既存パッケージと比較して、OEMアルゴリズムは線形回帰およびロジスティック回帰の両設定において、解の精度と収束速度をどの程度向上させるか。

主な発見

  • oemパッケージは、中間的なOEM計算を再利用することで交差検証の実行時間を大幅に短縮し、特にnが大きい場合に、単純な実装と比較して顕著な高速化を達成している。
  • 線形回帰において、oem()はglmnet、gglasso、ncvregと比較して、目的関数値の精度がより高く、差は10⁻¹⁴〜10⁻¹²のオーダーで現れる。
  • ロジスティック回帰において、Hessianを完全に使用したoem()は、他の手法と比較して顕著に低い目的関数値を達成しており、glmnetとの差は-7.01×10⁻¹⁴にまで及ぶ。これは収束精度に優れていることを示している。
  • Hessianの上界を用いたoem()の実装も、glmnet(ub)や他のパッケージを上回っており、一部のケースでは目的関数の差が最大-5.48×10⁻³に達する。これにより、強固で高精度な性能が裏付けられている。
  • 本パッケージは、数百ギガバイトに達するデータセットを、ラップトップ1台でメモリ外処理によりモデル適合可能であり、スケーラビリティと実用的価値を実証している。
  • XᵀXとXᵀyが事前に計算済みのデータセットに対しては、oemは全データをメモリにロードせずに迅速にモデル適合が可能であり、分散処理環境でも効率的な分析が可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。