Skip to main content
QUICK REVIEW

[論文レビュー] Optimal Algorithms for Ridge and Lasso Regression with Partially Observed Attributes

Elad Hazan, Tomer Koren|arXiv (Cornell University)|Aug 23, 2011
Advanced Bandit Algorithms Research参考文献 12被引用数 10
ひとこと要約

本稿では、各例に対して利用可能な特徴量の数が限られている部分的属性観測下におけるリッジ回帰およびラッソ回帰の効率的なオンラインアルゴリズムを提示する。提案されたアルゴリズムは、定数要因を除いて完全情報ベースラインと同等のサンプル複雑度を達成し、Cesa-Bianchiら(2010)が提起した未解決問題を解決する。また、サポートベクタ回帰における先行研究に比べて、特徴量依存性を指数関数的に低減することで顕著に優れた性能を示す。

ABSTRACT

We consider the most common variants of linear regression, including Ridge, Lasso and Support-vector regression, in a setting where the learner is allowed to observe only a fixed number of attributes of each example at training time. We present simple and efficient algorithms for these problems: for Lasso and Ridge regression they need the same total number of attributes (up to constants) as do full-information algorithms, for reaching a certain accuracy. For Support-vector regression, we require exponentially less attributes compared to the state of the art. By that, we resolve an open problem recently posed by Cesa-Bianchi et al. (2010). Experiments show the theoretical bounds to be justified by superior performance compared to the state of the art.

研究の動機と目的

  • 医療診断などの現実世界の応用で一般的な制約である、各例に対して利用可能な特徴量の数が限られている状況において、最適な回帰器を学習する課題に対処すること。
  • Cesa-Bianchiら(2010)が提起した、属性効率的学習が完全情報回帰のサンプル複雑度を達成できるかどうかという未解決の問いを解消すること。
  • 部分的観測下でも低いサンプル複雑度を維持できる、リッジ回帰、ラッソ回帰、およびサポートベクタ回帰のための単純で効率的なオンラインアルゴリズムを開発すること。
  • 属性効率的であることの学習性能への影響を損なわず、各例で小さな特徴量サブセットしか観測できない状況でも性能が保たれることを示すこと。

提案手法

  • 各例に対して観測する特徴量を適応的に選択することで、予測誤差を最小化しつつ、各例あたりの特徴量予算を守るオンライン学習フレームワークを提案する。
  • スパースな特徴量アクセスに特化したオンライン勾配降下法の変種を設計し、収束保証を維持するための確率的選択戦略を用いる。
  • 部分的観測下でもスパarsityと一般化性能のバランスを取るためのラッソ回帰のためのデュアル平均化アプローチを導入する。
  • サポートベクタ回帰では、先行研究で見られた次元数に指数関数的に依存する問題を軽減するための新しいサンプリング戦略を採用する。
  • 損失関数の強い凸性および滑らかさの性質を活用し、観測された特徴量数の観点からタイトな一般化バウンドを導出する。
  • 完全情報アルゴリズムを属性効率的バージョンに変換するための確率的ラウンド法を用い、保証された性能を達成する。

実験結果

リサーチクエスチョン

  • RQ1完全情報法と同等のサンプル複雑度を達成できる、リッジ回帰およびラッソ回帰の属性効率的アルゴリズムを設計できるか?
  • RQ2次元数に指数関数的に依存しないように、部分的観測下におけるサポートベクタ回帰のサンプル複雑度を低減できるか?
  • RQ31例あたり観測する特徴量数と、収束に必要な総例数との間の根本的トレードオフは何か?
  • RQ4厳密な属性観測制約下でも、オンラインアルゴリズムがオフライン完全情報ベースラインと同等の性能を達成できるか?

主な発見

  • ラッソ回帰のための提案されたAELRアルゴリズムは、$ O\left(\frac{d\log d}{k\varepsilon^{2}}\right) $ のサンプル複雑度を達成し、完全情報ラッソの理論的バウンドと対数要因を除いて同等である。
  • リッジ回帰では、$ O\left(\frac{d}{k\varepsilon^{2}}\right) $ のサンプル複雑度を達成し、$ k = \Omega(d) $ のとき完全情報領域と同等となる。
  • サポートベクタ回帰では、サンプル複雑度を $ O\left(e^{\frac{d^{2}}{k\varepsilon^{2}}}\right) $ から $ O\left(\frac{d}{k}\right) \cdot e^{O\left(\log^{2}{\frac{1}{\varepsilon}}\right)} $ にまで低減し、指数的改善を達成した。
  • MNIST「3対5」の文字認識タスクにおける実験では、AELRは例え1例あたり4つの特徴量しか観測しなくても、最先端のAERアルゴリズムに比べてテスト誤差がほぼ10倍改善された。
  • 訓練データの前半を増加させても、AELRは低テスト誤差を維持し、部分的観測下での頑健性とスケーラビリティを示した。
  • 理論的下界により、$ \varepsilon $-精度のリッジ回帰には $ \Omega\left(\frac{d}{\varepsilon^{2}}\right) $ 個の特徴量が必要であると確認され、提案されたバウンドの最適性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。