Skip to main content
QUICK REVIEW

[論文レビュー] Estimating the inverse trace using random forests on graphs

Simon Barthelmé, Nicolas Tremblay|arXiv (Cornell University)|May 6, 2019
Markov Chains and Monte Carlo Methods参考文献 9被引用数 5
ひとこと要約

この論文は、ウィルソンのアルゴリズムを用いて一様な全域木をサンプリングすることで、対角優勢行列の正則化逆トレースを推定する、新しい不偏推定量を提案する。この手法は高速でメモリ効率が良く、特に $ s(q) $ が低〜中程度のスケールの大きなグラフにおいて、共役勾配法や代数的多重グリッド法といった従来のモンテカルロ手法を凌駕する。100万ノードのグラフですでに1秒未塔の実行時間で推定が可能である。

ABSTRACT

Some data analysis problems require the computation of (regularised) inverse traces, i.e. quantities of the form $\Tr (q \bI + \bL)^{-1}$. For large matrices, direct methods are unfeasible and one must resort to approximations, for example using a conjugate gradient solver combined with Girard's trace estimator (also known as Hutchinson's trace estimator). Here we describe an unbiased estimator of the regularized inverse trace, based on Wilson's algorithm, an algorithm that was initially designed to draw uniform spanning trees in graphs. Our method is fast, easy to implement, and scales to very large matrices. Its main drawback is that it is limited to diagonally dominant matrices $\bL$.

研究の動機と目的

  • 正則化パrameter 選択のための重要な量である、正則化逆トレース $ s(q) = q \operatorname{Tr}((\mathbf{L} + q\mathbf{I})^{-1}) $ のスケーラブルで効率的な推定量を開発すること。
  • 大規模行列における固有値計算の計算不能性に対処し、高価なソルバーの代わりにグラフベースのサンプリングを用いること。
  • 対角優勢行列およびグラフラプラシアンの構造を活用して、不偏かつ高並列性を備えた手法を設計すること。
  • 特に大規模な環境において、分散と実行時間を削減する、既存のモンテカルロ推定量の実用的代替を提供すること。

提案手法

  • この手法はウィルソンのアルゴリズムを用いてグラフ上の一様全域木を生成し、その木を用いて逆トレースの不偏推定量を構築する。
  • 各ランダムフォレストの実現はトレースのサンプルに対応し、フォレスト内の根の期待数は $ s(q) $ に等しい。
  • 推定量 $ \hat{s}(q) $ は、複数の独立なフォレスト実現における根の平均数として計算され、行列の逆行列計算を回避する。
  • このアプローチは、ランダムフォレストの構築が適切に定義されかつ効率的であるため、対角優勢行列 $ \mathbf{L} $ に限定される。
  • ノード数に線形にスケーリングされ、メモリ使用量は $ \mathcal{O}(n) $ 比例するため、非常に大きなグラフに適している。
  • 線形システムの解法や固有値の計算を避けており、代わりにグラフ走査と木のサンプリングに依存する。

実験結果

リサーチクエスチョン

  • RQ1グラフ上のランダムフォレストは、大規模で対角優勢な行列の正則化逆トレースに対して、不偏的かつ効率的な推定量を提供できるか?
  • RQ2共役勾配法や代数的多重グリッド法といった確立されたモンテカルロ手法と比較して、このランダムフォレスト推定量の実行時間と分散性能はいかがなものか?
  • RQ3この手法は、100万ノードのような非常に大きなグラフにどの程度スケーリング可能か?
  • RQ4この手法を、逆行列の対角成分を推定するのに拡張可能か?これにより、より洗練された解析が可能になる。

主な発見

  • 提案されたランダムフォレスト手法は、$ n \approx 27,000 $ のグラフにおいて、$ s(q) $ が中程度以上の場合、直接ソルバーと同等の実行時間で推定を達成する。
  • サイズ $ n = 1,000,000 $ のバラバシ・アルバートグラフにおいて、$ q = 6 \times 10^{-3} $ のとき、1回の実現で約0.2秒で $ s(q) $ を推定でき、$ s(q) \approx 100 $ となる。
  • テストされたベンチマークにおいて、共役勾配法やAMGプリコンディショニングといった反復ソルバーを凌駆しており、特にセットアップコストがゼロでメモリ使用量が少ない点が特徴である。
  • 推定量は不偏であり、トレースに自然にスケーリングされる分散構造を持つため、AIC や GCV を用いた正則化パrameter 選択に適している。
  • 特に $ s(q) $ が大きい場合には、固定相対誤差を達成するためのフォレスト実現数が減少するため、非常に効率的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。