Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Approximate a Bregman Divergence

Ali Siahkamari, Xide Xia|OpenBU (Boston University)|May 28, 2019
Statistical Mechanics and Entropy参考文献 31被引用数 7
ひとこと要約

本論文は、任意のBregman散発を、区分的線形関数による凸生成関数の近似によって学習する手法を提案する。これにより、線形でない散発へのマハラノビス距離学習の一般化が可能になる。本手法は一般化誤差を $\mathcal{O}_p(m^{-1/2})$ に抑え、線形手法の理論的境界と一致し、UCIベンチマークにおけるクラスタリングおよびランク付けタスクで既存のベースラインを上回る性能を示した。

ABSTRACT

Bregman divergences generalize measures such as the squared Euclidean distance and the KL divergence, and arise throughout many areas of machine learning. In this paper, we focus on the problem of approximating an arbitrary Bregman divergence from supervision, and we provide a well-principled approach to analyzing such approximations. We develop a formulation and algorithm for learning arbitrary Bregman divergences based on approximating their underlying convex generating function via a piecewise linear function. We provide theoretical approximation bounds using our parameterization and show that the generalization error $O_p(m^{-1/2})$ for metric learning using our framework matches the known generalization error in the strictly less general Mahalanobis metric learning setting. We further demonstrate empirically that our method performs well in comparison to existing metric learning methods, particularly for clustering and ranking problems.

研究の動機と目的

  • 教師ありデータから任意のBregman散発を学習する原理的枠組みを構築すること。線形距離学習の制限を超える拡張を目的とする。
  • Bregman散発の背後にある凸関数のクラスを、理論的解析と実用的最適化が可能となる形でパラメータ化することの挑戦に応えること。
  • 一般化誤差境界などの強力な理論的保証を維持しつつ、マハラノビス距離学習を非線形散発へ一般化すること。
  • クラスタリング、ランク付け、k近傍分類タスクにおいて、本手法の実験的妥当性を検証し、線形および非線形のベースラインを上回る性能を示すこと。

提案手法

  • Bregman散発の凸生成関数 $\phi$ を、max-アフィン(区分的線形)関数 $h(\mathbf{x}) = \max_{k \in [K]} \mathbf{a}_k^T \mathbf{x} + b_k$ でパラメータ化する。
  • Bregman散発は、$D_h(\mathbf{x}_1, \mathbf{x}_2) = h(\mathbf{x}_1) - h(\mathbf{x}_2) - \nabla h(\mathbf{x}_2)^T (\mathbf{x}_1 - \mathbf{x}_2)$ として近似される。勾配は部分微分を用いて計算する。
  • 凸最適化を用いて、相対的比較や類似/非類似ペアといった教師信号から学習を可能にするフレームワークを提供する。
  • 理論的解析により、このパラメータ化によるBregman散発の近似誤差は $\mathcal{O}(K^{-1/d})$ であることが示され、ここで $d$ は入力次元を表す。
  • 一般化誤差は $\mathcal{O}_p(m^{-1/2})$ で有界であり、マハラノビス距離学習における既知の境界と一致する。
  • 本手法は柔軟なフレームワークとして実装されており、PBDL(Piecewise Linear Bregman Divergence Learning)として、クラスタリング、ランク付け、最近傍分類に応用可能である。

実験結果

リサーチクエスチョン

  • RQ1区分的線形関数は、任意のBregman散発を理論的に根拠のある形で効果的に近似するパラメータ化を提供できるか?
  • RQ2提案されたフレームワークは、広く知られたマハラノビス距離学習設定と同等の一般化誤差を達成できるか?
  • RQ3クラスタリングおよびランク付けタスクにおいて、本手法の性能は、既存の線形および非線形距離学習ベースラインと比べてどうか?
  • RQ4マハラノビス学習が捉えられない非線形散発を、本手法は効果的にモデル化できるか?

主な発見

  • 提案手法PBDLは、$\mathcal{O}_p(m^{-1/2})$ の一般化誤差を達成し、マハラノビス距離学習設定の理論的境界と一致する。
  • 区分的線形関数によるBregman散発の近似誤差は $\mathcal{O}(K^{-1/d})$ で有界であり、線形部分の数が増加するにつれて収束することが示された。
  • 30個のUCIベンチマークデータセットにおいて、PBDLはクラスタリング、ランク付け、k-NN正答率の3分野で30件中22件で1位または2位を達成し、線形および非線形ベースラインを上回った。
  • クラスタリングおよびランク付けタスクでは、PBDLは平均Rand指数94.5%、AUC 93.5%を達成し、いくつかのデータセットでITMLやLMNNを著しく上回った。
  • Wineデータセットでは、PBDLは96.5%のk-NN正答率を達成し、GMMLやKernel NCAを含むすべての他の手法を上回った。
  • 実験結果から、PBDLは線形手法(例:ITML)が捉えられない複雑な非線形データ構造を効果的にモデル化できることを示した。これは、合成散発近似実験でも裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。