Skip to main content
QUICK REVIEW

[論文レビュー] Learning Sparse Additive Models with Interactions in High Dimensions

Hemant Tyagi, Anastasios Kyrillidis|arXiv (Cornell University)|Apr 18, 2016
Machine Learning and Algorithms参考文献 29被引用数 5
ひとこと要約

本稿では、高次元における2次相互作用を伴うスパース加法的モデルを正確に回復するための確率的クエリベースアルゴリズムを提案する。圧縮センシングを活用して有効な変数および相互作用ペアを同定する。ノイズなしでは O(kρₘ(log d)³)、ノイズありでは O(ρₘ⁵k²(log d)⁴) のクエリで正確回復を達成し、成分推定に対して非漸近的誤差バウンドを提供する。

ABSTRACT

A function $f: \mathbb{R}^d ightarrow \mathbb{R}$ is referred to as a Sparse Additive Model (SPAM), if it is of the form $f(\mathbf{x}) = \sum_{l \in \mathcal{S}}ϕ_{l}(x_l)$, where $\mathcal{S} \subset [d]$, $|\mathcal{S}| \ll d$. Assuming $ϕ_l$'s and $\mathcal{S}$ to be unknown, the problem of estimating $f$ from its samples has been studied extensively. In this work, we consider a generalized SPAM, allowing for second order interaction terms. For some $\mathcal{S}_1 \subset [d], \mathcal{S}_2 \subset {[d] \choose 2}$, the function $f$ is assumed to be of the form: $$f(\mathbf{x}) = \sum_{p \in \mathcal{S}_1}ϕ_{p} (x_p) + \sum_{(l,l^{\prime}) \in \mathcal{S}_2}ϕ_{(l,l^{\prime})} (x_{l},x_{l^{\prime}}).$$ Assuming $ϕ_{p},ϕ_{(l,l^{\prime})}$, $\mathcal{S}_1$ and, $\mathcal{S}_2$ to be unknown, we provide a randomized algorithm that queries $f$ and exactly recovers $\mathcal{S}_1,\mathcal{S}_2$. Consequently, this also enables us to estimate the underlying $ϕ_p, ϕ_{(l,l^{\prime})}$. We derive sample complexity bounds for our scheme and also extend our analysis to include the situation where the queries are corrupted with noise -- either stochastic, or arbitrary but bounded. Lastly, we provide simulation results on synthetic data, that validate our theoretical findings.

研究の動機と目的

  • 高次元関数の学習においてスパース加法的および相互作用成分を扱い、次元の呪いを克服すること。
  • 主効果および2次相互作用項の両方の正確回復を可能にするクエリベースの学習フレームワークの構築。
  • ノイズなしおよびノイズありのクエリ設定下で、正確回復および成分推定の有限標本保証の提供。
  • 非線形かつ高次元関数におけるスパースヘッセ行列および勾配回復のための圧縮センシング技術の拡張。
  • 制御されたノイズおよび相互作用構造を有する合成データ上のシミュレーションを通じて理論的発見の妥当性を検証すること。

提案手法

  • 関数 f を戦略的に選ばれた点でクエリするための確率的サンプリング戦略を用い、勾配およびヘッセ情報のプローブを実施する。
  • 構造化されたサンプリングを用いて、圧縮センシングによりスパースヘッセ行列を回復し、相互作用項の同定を可能にする。
  • 2段階の回復プロセスを採用:まず有効な変数および相互作用ペアを同定し、次に個々の成分関数を推定する。
  • 期待値ベースの推定器を用いてランダムプロジェクションの平均を取ることで、ノイズを低減し、成分推定の精度を向上させる。
  • 複数の項からの重複寄与によるバイアスを補正するための正規化および補正ステップを導入する。
  • 最大相互作用次数 ρₘ およびスパarsity k に基づく標本複雑度バウンドを導出することで、有界ノイズおよび確率的ノイズ下でも頑健性を保証する。

実験結果

リサーチクエスチョン

  • RQ1有限個の関数クエリを用いて、2次相互作用を伴う高次元スパース加法的モデルにおいて、主効果 𝒮₁ および相互作用ペア 𝒮₂ を正確に回復できるか?
  • RQ2ノイズなしおよびノイズありのクエリ条件下で、モデル構造の正確回復を達成するための最小クエリ数は何か?
  • RQ3最大相互作用次数 ρₘ は、回復アルゴリズムの標本複雑度にどのように影響するか?
  • RQ4ノイズありクエリ下で、個々の成分関数 ϕₚ および ϕ₍ₗ,ₗ′₎ の推定に対して非漸近的誤差バウンドを達成できるか?
  • RQ5有界ノイズまたは i.i.d. ガウスノイズといった異なるノイズモデルは、回復プロセスの精度および標本複雑度にどのような影響を及ぼすか?

主な発見

  • ノイズなしでは、O(kρₘ(log d)³) のクエリで 𝒮₁ および 𝒮₂ の正確回復が達成され、ρₘ は1変数あたりの最大相互作用数を表す。
  • i.i.d. ガウスノイズ下では、O(ρₘ⁵k²(log d)⁴) のクエリで正確回復が保証され、このようなモデルにおける最初の有限標本バウンドを提供する。
  • n 回のノイズありクエリ後、主効果関数 ϕₚ の期待 L∞-誤差は O((n⁻¹ log n)^{3/7}) である。
  • n 回のノイズありクエリ後、2変数相互作用関数 ϕ₍ₗ,ₗ′₎ の期待 L∞-誤差は O((n⁻¹ log n)^{3/8}) である。
  • 複数の相互作用に参加する変数(ρ(l) > 1)については、ϕₗ の推定誤差も O((n⁻¹ log n)^{3/8}) で有界である。
  • 制御されたノイズおよび相互作用構造を有する合成データ上のシミュレーション結果は、理論的標本複雑度および誤差バウンドを確認し、アルゴリズムの頑健性と正確性を検証する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。