Skip to main content
QUICK REVIEW

[論文レビュー] Semi-supervised Eigenvectors for Large-scale Locally-biased Learning

Toke Jansen Hansen, Michael W. Mahoney|arXiv (Cornell University)|Apr 28, 2013
Face and Expression Recognition参考文献 46被引用数 8
ひとこと要約

本論文は、局所的にバイアスがかかるグローバルなグラフラプラシアン固有ベクトルの類似物である半教師付き固有ベクトルを導入する。これらの固有ベクトルは一次方程式系を解くことで計算され、局所的にバイアスがかかる機械学習を効率的かつ安定的かつスケーラブルに可能にする。本手法は、適応的閾値を用いた拡散ベースのソルバー(例:Pushアルゴリズム)を用いることで、特に大規模ネットワークにおいて共役勾配法よりも顕著な高速化を達成する。

ABSTRACT

In many applications, one has side information, e.g., labels that are provided in a semi-supervised manner, about a specific target region of a large data set, and one wants to perform machine learning and data analysis tasks "nearby" that prespecified target region. For example, one might be interested in the clustering structure of a data graph near a prespecified "seed set" of nodes, or one might be interested in finding partitions in an image that are near a prespecified "ground truth" set of pixels. Locally-biased problems of this sort are particularly challenging for popular eigenvector-based machine learning and data analysis tools. At root, the reason is that eigenvectors are inherently global quantities, thus limiting the applicability of eigenvector-based methods in situations where one is interested in very local properties of the data. In this paper, we address this issue by providing a methodology to construct semi-supervised eigenvectors of a graph Laplacian, and we illustrate how these locally-biased eigenvectors can be used to perform locally-biased machine learning. These semi-supervised eigenvectors capture successively-orthogonalized directions of maximum variance, conditioned on being well-correlated with an input seed set of nodes that is assumed to be provided in a semi-supervised manner. We show that these semi-supervised eigenvectors can be computed quickly as the solution to a system of linear equations; and we also describe several variants of our basic method that have improved scaling properties. We provide several empirical examples demonstrating how these semi-supervised eigenvectors can be used to perform locally-biased learning; and we discuss the relationship between our results and recent machine learning algorithms that use global eigenvectors of the graph Laplacian.

研究の動機と目的

  • グローバル固有ベクトルが特定の領域付近の局所的データ構造を捉える能力に限界があることに対処すること。
  • グラフ内の指定されたシード集合にバイアスがかかる、スケーラブルで安定的かつ効率的な固有ベクトルの計算手法を開発すること。
  • ユーザー指定の領域付近でのクラスタリング、セグメンテーション、コミュニティ検出などの局所的にバイアスがかかる機械学習タスクを可能にすること。
  • フル行列計算が非現実的となる大規模グラフにおいて、従来の固有ベクトル手法のスケーラビリティの問題を克服すること。
  • グローバル固有ベクトルの優れた性質を継承しつつ、局所的な関連性に焦点を当てた実用的な半教師付き学習フレームワークを提供すること。

提案手法

  • 本手法は、シードノード集合によってバイアスが符号化されたバイアス付きラプラシアン行列から導出される一次方程式系の解として、半教師付き固有ベクトルを計算する。
  • 固有ベクトルは、順次直交し、分散を最大化しつつ、入力シード集合と高い相関を持つように構築される。
  • 一次方程式系は、Pushアルゴリズムなどの反復的拡散ベースのアルゴリズムを用いて解かれる。これらのアルゴリズムは、シード集合から近隣ノードへ質量を伝搬する。
  • Pushアルゴリズムは、収束と質量分布を制御するための閾値パラメータεを用いる。εが小さいほど収束が速くなり、計算コストは高くなるが、より高い収束速度が得られる。
  • 繰り返し計算されたベクトルとの相関を除去することで複数の半教師付き固有ベクトルを抽出するためのピーリング手順が適用される。
  • 共役勾配法が非現実的になる大規模ネットワークにおいてもスケーリングを向上させるための変種が本手法に拡張されている。

実験結果

リサーチクエスチョン

  • RQ1グローバル固有ベクトルの優れた性質を継承しつつ、シード集合付近の局所的データ構造に敏感な固有ベクトルを構築することは可能か?
  • RQ2特にフル固有値分解が非現実的となる大規模グラフにおいて、このような局所的にバイアスがかかる固有ベクトルをスケーラブルに効率的に計算することは可能か?
  • RQ3アルゴリズムのパラメータ(ε や α)の影響は、計算された固有ベクトルとシード集合との相関にどのように現れるか?
  • RQ4大規模ネットワークにおいて、Pushのような拡散ベースのソルバーと共役勾配法との間で、速度とスケーラビリティの観点からどのように差がつくか?
  • RQ5本手法を用いて、複数の直交的かつ局所的にバイアスがかかる固有ベクトルを抽出し、多段階の局所的解析を可能にすることができるか?

主な発見

  • 半教師付き固有ベクトルは、入力ラベルと高い相関を持つことで、スパarsなグラフや大規模グラフにおいても、シード集合付近の局所的データ構造を効果的に捉えることができる。
  • 大規模な設定において、共役勾配法に比べてPushアルゴリズムが顕著な高速化を達成しており、絶対実行時間はεを小さくするにつれて減少するが、単調的ではない。
  • 大規模ネットワーク(例:30GB以上のメモリフットプリントを有するウェブクロールグラフ)では、共役勾配法が非現実的になる一方、Pushベースの手法は実用的かつ効率的である。
  • 本手法はεに非常に感受性が高く、低い値(例:1e-6)をとると相関の減衰が良く、複数の固有ベクトルをピーリングするのに適している。
  • 高次数ノードにシードを設定すると実行時間が最も遅くなるが、同時に相関の低減効果も最大となり、複数ベクトル抽出の観点から最適なシードとなる。
  • 本手法により、画像セグメンテーションや神経接続性解析などの実世界応用に適した、大規模グラフにおけるスケーラブルな局所的にバイアスがかかる学習が実現可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。