Skip to main content
QUICK REVIEW

[論文レビュー] Convex Factorization Machine for Regression

Makoto Yamada, Lian, Wenzhao|arXiv (Cornell University)|Jul 4, 2015
Tensor decomposition and applications参考文献 35被引用数 4
ひとこと要約

本稿では、凸型因子分解マシン(CFM)を提案する。CFMは、行列補完問題を半正定値計画法(SDP)として定式化し、ℓ₂ノルムとトレースノルム正則化を用いることで、グローバル最適解を保証する因子分解マシンの凸型変種である。CFMは、毒性ゲノム解析タスクにおいて最先端の手法を上回る性能を発揮するとともに、単純さと多視覚およびテンソル因子分解問題への一般化可能性を維持している。

ABSTRACT

We propose the convex factorization machine (CFM), which is a convex variant of the widely used Factorization Machines (FMs). Specifically, we employ a linear+quadratic model and regularize the linear term with the $\ell_2$-regularizer and the quadratic term with the trace norm regularizer. Then, we formulate the CFM optimization as a semidefinite programming problem and propose an efficient optimization procedure with Hazan's algorithm. A key advantage of CFM over existing FMs is that it can find a globally optimal solution, while FMs may get a poor locally optimal solution since the objective function of FMs is non-convex. In addition, the proposed algorithm is simple yet effective and can be implemented easily. Finally, CFM is a general factorization method and can also be used for other factorization problems including including multi-view matrix factorization and tensor completion problems. Through synthetic and movielens datasets, we first show that the proposed CFM achieves results competitive to FMs. Furthermore, in a toxicogenomics prediction task, we show that CFM outperforms a state-of-the-art tensor factorization method.

研究の動機と目的

  • 非凸最適化による因子分解マシン(FMs)が悪い局所最適解に収束するという限界を解消すること。
  • 半正定値計画法を用いて、グローバル最適解を保証するFMの凸型定式化を開発すること。
  • 特に低データ量または高スパarsityな状況において、行列補完および因子分解タスクにおけるロバストで安定した学習を可能にすること。
  • 多視覚およびテンソル因子分解問題(例:毒性ゲノム解析)へのフレームワークの一般化を図ること。
  • 既存の最先端手法を凌駕する、実世界の応用において実装可能で単純なアルゴリズムを提供すること。

提案手法

  • 線形項にℓ₂ノルム、二次相互作用項にトレースノルムを正則化することで、FMの目的関数を凸な半正定値計画法(SDP)として定式化する。
  • 共有潜在要因への因子分解により、二次相互作用行列を低ランクの正定値行列として表現する。
  • ハザンのフランク=ウォルフ法を用いて、得られたSDPを解き、大規模問題に適した効率的かつスケーラブルな解法を実現する。
  • 特徴ベクトルの連結により補助情報を統合し、遺伝子発現や薬剤プロファイルなどの追加データの利用を可能にする。
  • 複数の視覚を連結して1つの行列に統合し、統一された低ランク表現を学習することで、多視覚因子分解にフレームワークを適用する。
  • トレースノルム正則化を用いて相互作用行列の低ランク構造を促進し、一般化性能と安定性を確保する。

実験結果

リサーチクエスチョン

  • RQ1因子分解マシンの凸型再定式化は、非凸FMで一般的な悪い局所最適解を回避し、グローバル最適解を達成できるか?
  • RQ2提案された凸因子分解マシン(CFM)は、実世界の回帰タスクにおいて、標準的FMおよび最先端のテンソル因子分解手法と比較してどのように性能を発揮するか?
  • RQ3CFMは、毒性ゲノムデータ統合のような多視覚およびテンソル因子分解問題へどの程度一般化可能か?
  • RQ4手作業で設計した特徴(例:最近接近傍類似度の平均および標準偏差)の導入は、生物学的データにおける予測性能を向上させるか?
  • RQ5提案されたアルゴリズムは、大規模かつスパースなデータセットに対しても効率的に実装可能で、収束保証を維持できるか?

主な発見

  • CFMは、合成データおよびMovieLensデータセットにおいて、標準的FMと同等の性能を発揮し、標準的な行列補完タスクにおける有効性を示している。
  • 毒性ゲノムデータでは、CFMは最先端のベイジアン多視覚テンソル因子分解(BMTF)手法を顕著に上回り、平均相対MSEが0.4037(BMTFは0.4811)を記録した。
  • 手作業で設計した特徴(m=5の最近接近傍類似度の平均および標準偏差)の導入により、CFMの性能が向上し、平均相対MSEが0.5624から0.5215に低下した。
  • CFMは100回のランダムなデータ分割においても、低標準誤差(例:多視覚設定では平均相対MSEの標準誤差が0.0163)を示し、一貫性のある性能を発揮した。
  • CFMは、標準的な行列因子分解を越えて、多視覚およびテンソル補完問題を効果的に解くことができ、強力な実証的結果を示した。
  • CFMフレームワークは、核ノルム正則化付き行列因子分解を特別な場合として含むことが示され、理論的整合性と広範な適用可能性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。