Skip to main content
QUICK REVIEW

[論文レビュー] Provable learning of Noisy-or Networks

Sanjeev Arora, Rong Ge|arXiv (Cornell University)|Dec 28, 2016
Machine Learning and Algorithms参考文献 12被引用数 5
ひとこと要約

本論文は、テンソル分解を用いた、一層のノイズありORネットワークを学習する初めての証明可能に効率的なアルゴリズムを提示している。これは、パrameter推定における体系的誤差の課題を克服したものであり、サンプル複雑性の境界を確立し、十分なデータが得られれば、相関するノイズが存在してもネットワークパラメータを正確に回復できることを示している。これにより、QMR-DTのような医療診断モデルのスケーラブルな学習が可能になる。

ABSTRACT

Many machine learning applications use latent variable models to explain structure in data, whereby visible variables (= coordinates of the given datapoint) are explained as a probabilistic function of some hidden variables. Finding parameters with the maximum likelihood is NP-hard even in very simple settings. In recent years, provably efficient algorithms were nevertheless developed for models with linear structures: topic models, mixture models, hidden markov models, etc. These algorithms use matrix or tensor decomposition, and make some reasonable assumptions about the parameters of the underlying model. But matrix or tensor decomposition seems of little use when the latent variable model has nonlinearities. The current paper shows how to make progress: tensor decomposition is applied for learning the single-layer {\em noisy or} network, which is a textbook example of a Bayes net, and used for example in the classic QMR-DT software for diagnosing which disease(s) a patient may have by observing the symptoms he/she exhibits. The technical novelty here, which should be useful in other settings in future, is analysis of tensor decomposition in presence of systematic error (i.e., where the noise/error is correlated with the signal, and doesn't decrease as number of samples goes to infinity). This requires rethinking all steps of tensor decomposition methods from the ground up. For simplicity our analysis is stated assuming that the network parameters were chosen from a probability distribution but the method seems more generally applicable.

研究の動機と目的

  • 非線形潜在変数モデルのための証明可能に効率的なアルゴリズムを開発することで、理論と実践のギャップを埋めること。
  • 線形モデルを超えて、特にノイズありORネットワークにおける非線形性を扱えるように、テンソル分解手法を拡張すること。
  • サンプル数の増加にかかわらず消失しないノイズが信号と相関するという、テンソル分解における体系的誤差の課題に対処すること。
  • 患者の症状データから、QMR-DTのような大規模な医療診断ネットワークを自動で学習可能にすること。
  • ノイズありORネットワークにおけるサンプル複雑性とパラメータ回復精度に関する理論的保証を提供すること。

提案手法

  • 症状が疾患の下で条件付き独立であると仮定し、1層のノイズありORネットワークにおける重み行列Wをテンソル分解により学習する。
  • 症状の不在の3重共起確率の経験的推定値を用いて、3次元テンソルを構築する。
  • サンプリング誤差を低減するために、PMI(ポイントワイズ相互情報量)とPMIT(3重共起PMI)を用いて高次統計量を推定する。
  • チェルノフの不等式を用いて、ペアワイズおよび3重共起確率の推定誤差を制御し、十分なサンプル数下で濃度が保証されることを示す。
  • ウェディンの定理とワイエルの定理を用いて、テンソル分解中の特異値および特異ベクトルの摂動を境界づけ、体系的誤差が存在する場合でも有効であることを保証する。
  • 行列摂動理論を適用して、回復された重み行列の誤差を境界づけ、やや厳しい仮定のもとで真のパラメータに収束することを保証する。

実験結果

リサーチクエスチョン

  • RQ1体系的誤差が存在するにもかかわらず、ノイズありORネットワークのような非線形潜在変数モデルにテンソル分解を適用できるか?
  • RQ2経験的テンソル手法を用いてノイズありORネットワークで正確なパrameter推定を達成するためには、どの程度のサンプル複雑性が必要か?
  • RQ3サンプルサイズの増加にかかわらず減少しないノイズに、どのようにしてテンソル分解をロバストにできるか?
  • RQ4非線形な潜在モデルが前提となる場合でも、ノイズありORネットワークの重み行列Wを証明可能に回復できるか?
  • RQ5QMR-DTのように、数千の症状と疾患を含む大規模な実世界応用に、この手法はスケーラブルに適用可能か?

主な発見

  • 症状および疾患の数の多項式関数としての境界を超えたサンプル数が得られれば、ノイズありORネットワークにおける重み行列Wの回復が高確率で達成される。
  • ペアワイズPMI推定のサンプル複雑性はO(1/δ² log m)、3重共起PMITのサンプル複雑性はO(1/δ² log m)で境界づけられており、δは推定誤差を制御する。
  • ウェディンの定理とワイエルの定理を用いた摂動境界により、体系的誤差に対してもアルゴリズムがロバストであることが示された。
  • 経験的PMIおよびPMIT推定値は、高確率で真の値の周囲に集中し、信頼性の高いテンソル構築が可能である。
  • 理論的保証により、サンプルサイズが増加するにつれて、相関するノイズが存在する状況でも回復されたパラメータが真のパラメータに収束することが示された。
  • 本手法により、従来は自動学習が困難であった大規模な医療診断モデル(例:QMR-DT)の証明可能な学習が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。