[論文レビュー] Comprehend DeepWalk as Matrix Factorization
この論文は、DeepWalkが行列因子分解と数学的に同等であることを示している。ノード埋め込みは、ランダムウォーク中に固定ウィンドウ内でノードがコンテキストノードとして出現する回数の期待値の対数を表す行列 M の因子分解によって学習される。主な貢献は、DeepWalk の Negative Sampling および Softmax の両バリアントが、ノード-コンテキスト共起統計から導かれる行列を暗黙的に因子分解していることの解明であり、M はノード間の平均ランダムウォーク遷移確率の対数を捉えている。
Word2vec, as an efficient tool for learning vector representation of words has shown its effectiveness in many natural language processing tasks. Mikolov et al. issued Skip-Gram and Negative Sampling model for developing this toolbox. Perozzi et al. introduced the Skip-Gram model into the study of social network for the first time, and designed an algorithm named DeepWalk for learning node embedding on a graph. We prove that the DeepWalk algorithm is actually factoring a matrix M where each entry M_{ij} is logarithm of the average probability that node i randomly walks to node j in fix steps.
研究の動機と目的
- DeepWalk と行列因子分解の間の数学的同等性を形式化すること。
- DeepWalk の Skip-Gram with Negative Sampling および Softmax バリアントが暗黙的に因子分解する行列 M の分析すること。
- M の各エントリをノード間の平均ランダムウォーク遷移確率の対数として解釈すること。
- サンプリング戦略および正規化の役割が学習されたノード表現に与える影響を明確にすること。
提案手法
- Skip-Gram with Negative Sampling の目的関数を導出し、それを最適化すると PMI に類似した行列の暗黙的因子分解が得られることを示す。
- Softmax を用いた目的関数を定式化し、その最適解がエントリがノード-コンテキスト共起の条件付き確率の対数である行列 M を得ることを示す。
- 行列 M を M_ij = log(#(v_i,c_j)/#(v_i)) + b_v_i と定義する。ここで b_v_i はノード固有のバイアス項である。
- 理想化されたランダムウォークサンプリングプロセスを用いて、#(v_i,c_j)/#(v_i) がノード i から t ステップでノード j に到達する平均確率を近似することを示す。
- M_ij がノード i のコンテキストウィンドウ内でノード j が出現する回数の期待値の対数に比例することを確立する。
- 因子分解がノード-コンテキスト共起統計の対数変換された行列の低ランク近似を学習することに等しいことを証明し、DeepWalk を古典的行列因子分解と結びつける。
実験結果
リサーチクエスチョン
- RQ1DeepWalk の Skip-Gram with Negative Sampling は行列因子分解とどのように関係しているか?
- RQ2Negative Sampling 目的関数下で DeepWalk の学習中に暗黙的に因子分解されている行列は何か?
- RQ3Softmax バリアントの DeepWalk は Negative Sampling と比較して、どのような行列因子分解の観点から異なるか?
- RQ4DeepWalk が学習する行列 M のエントリの確率的解釈は何か?
- RQ5ランダムウォークサンプリング戦略は行列 M の構造にどのように影響するか?
主な発見
- Negative Sampling を用いた DeepWalk アルゴリズムは、エントリ M_ij がノード-コンテキストペア (v_i, c_j) のポイントワイズ相互情報量 (PMI) に log k をずらした値である行列 M を暗黙的に因子分解している。
- Softmax バリアントでは、最適な埋め込み内積が v_i · c_j = log(#(v_i,c_j)/#(v_i)) + b_v_i を満たし、M_ij がノード-コンテキスト共起の条件付き確率の対数であることが示された。
- 理想化されたランダムウォークサンプリング下で、比率 #(v_i,c_j)/#(v_i) はノード i の周囲のウィンドウサイズ t 内でノード j が出現する平均確率に一致する。
- 行列 M_ij = log(#(v_i,c_j)/#(v_i)) は、ランダムウォークによるノード i からノード j への t ステップの平均遷移確率の対数に等しい。
- b_v_i = log(2t) で正規化すると、M_ij はノード i のコンテキストにノード j が出現する回数の期待値の対数に一致する。
- 本論文は、DeepWalk がノード-コンテキスト共起統計の対数変換に基づく行列因子分解手法であると明確にした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。