Skip to main content
QUICK REVIEW

[論文レビュー] Differentiable Ranks and Sorting using Optimal Transport

Marco Cuturi, Olivier Teboul|arXiv (Cornell University)|May 28, 2019
Machine Learning and Algorithms参考文献 39被引用数 11
ひとこと要約

本稿では、エントロピー正則化を施した最適輸送(OT)を用いて、ソートおよびランク付けの微分可能代理関数を提案する。この手法により、ディープラーニングにおけるエンドツーエンド学習が可能となる。ソートをOTの割り当て問題として定式化し、Sinkhorn反復法で解くことで、滑らかで微分可能なランクおよびソート演算子が得られ、分位数回帰および分類タスクにおいて非微分可能なベースラインを上回る性能を発揮する。

ABSTRACT

Sorting an array is a fundamental routine in machine learning, one that is used to compute rank-based statistics, cumulative distribution functions (CDFs), quantiles, or to select closest neighbors and labels. The sorting function is however piece-wise constant (the sorting permutation of a vector does not change if the entries of that vector are infinitesimally perturbed) and therefore has no gradient information to back-propagate. We propose a framework to sort elements that is algorithmically differentiable. We leverage the fact that sorting can be seen as a particular instance of the optimal transport (OT) problem on $\mathbb{R}$, from input values to a predefined array of sorted values (e.g. $1,2,\dots,n$ if the input array has $n$ elements). Building upon this link , we propose generalized CDFs and quantile operators by varying the size and weights of the target presorted array. Because this amounts to using the so-called Kantorovich formulation of OT, we call these quantities K-sorts, K-CDFs and K-quantiles. We recover differentiable algorithms by adding to the OT problem an entropic regularization, and approximate it using a few Sinkhorn iterations. We call these operators S-sorts, S-CDFs and S-quantiles, and use them in various learning settings: we benchmark them against the recently proposed neuralsort [Grover et al. 2019], propose applications to quantile regression and introduce differentiable formulations of the top-k accuracy that deliver state-of-the art performance.

研究の動機と目的

  • ディープラーニングパイプラインにおける標準的ソートおよびランク付け操作の非微分可能性に対処すること。
  • トップ-k正解率や0/1損失、分位数回帰などの損失関数に不可欠な離散的ランクおよびソート演算子の滑らかで微分可能な代替手法を開発すること。
  • 最適輸送理論を活用して、n対nのマッピングを超えて一般化されたソートを可能とし、m ≠ n 個のポイントを持つ柔軟なターゲット測度を許容すること。
  • 離散的演算を滑らかで勾配に優れた代替手法に置き換えることで、ランクに基づく評価指標を微分可能な学習目的として使用可能にすること。
  • 分位数回帰およびマルチクラス分類における応用を通じて、実用的有効性を実証すること。この際、0/1損失の滑らかな近似を用いる。

提案手法

  • 入力値とm個の増加する値からなるターゲット測度との間の最適割り当て問題としてソートを定式化し、標準的なn対nソートを一般化する。
  • カントロビッチランクおよびソート演算子を導入し、最適輸送計画を用いたランクおよびソート値の凸結合として定式化する。
  • 効率的な解法を実現するため、エントロピー正則化をOT問題に導入し、Sinkhornアルゴリズムによる解法を採用。ℓ反復でO(nmℓ)の計算量を達成する。
  • 勾配の安定化のため、微分可能なスラッシング関数とコスト関数を用いる。入力を[0,1]にホワイトニングすることで数値安定性が向上するという実証的証拠がある。
  • 滑らかな演算子を用いて、分類タスクにおける0/1損失および回帰タスクにおける分位数回帰損失の微分可能な代理関数を定義する。
  • ミニバッチ最適化を採用し、Sinkhornランク演算子を用いたソフト分位数推定を実施。離散的な分位数点の選択を、微分可能なソフト選択に置き換える。

実験結果

リサーチクエスチョン

  • RQ1機械学習タスクにおける意味的意味を保持しつつ、ソートおよびランク付けを微分可能にできるか?
  • RQ2最適輸送は、n対nのマッピングを超えて標準的ソート操作を一般化できるか?
  • RQ3エントロピー正則化およびSinkhorn反復が、ランクおよびソート演算子の微分可能性および数値安定性に与える影響は何か?
  • RQ4微分可能なランクおよびソート演算子は、分位数回帰および分類タスクにおける学習ダイナミクスを改善できるか?
  • RQ5コスト関数、ターゲットベクトル、スラッシング関数の選択が、正則化OTフレームワークにおける勾配安定性に与える影響は何か?

主な発見

  • ε = 10⁻²の条件下で提案されたソフト分位数演算子は、複数のデータセットにおいて50%および90%分位数で、非微分可能なベースライン(ε = 0)よりも優れた訓練時の分位数誤差を達成した。
  • テストセットの性能(分位数誤差およびMSE)は、提案手法とベースラインとで同等であり、一般化性能の低下がないことが示された。これは、最適化の改善にもかかわらず、一般化性能に悪影響がないことを意味する。
  • 最小限のハイパーパrameterチューニングで安定した学習が達成可能であり、入力を処理前に[0,1]にホワイトニングおよびスラッシングすることで、数値安定性が顕著に向上した。
  • ターゲット測度のサイズmを3まで小さくしても、性能に顕著な損失が生じないため、本手法の柔軟性および効率性が示された。
  • 微分可能なランクおよびソート演算子により、トップ-k正解率や0/1損失といったランクに基づく評価指標を微分可能な学習目的として使用可能となり、エンドツーエンド学習が可能になった。
  • 実験的結果から、滑らかな最適化のための地形が局所的最小値を低減し、分位数回帰タスクにおける収束の一貫性が向上したことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。