Skip to main content
QUICK REVIEW

[論文レビュー] Toward a Characterization of Loss Functions for Distribution Learning

Nika Haghtalab, Cameron Musco|arXiv (Cornell University)|Jun 6, 2019
Machine Learning and Algorithms参考文献 22被引用数 5
ひとこと要約

本稿は、分布学習における損失関数を特徴付けるフレームワークを提案する。そのために、適切性、局所性、強適切性といった公理的基準——真の分布における期待損失が最小化される、観測された結果の予測確率にのみ依存する、損失の差が分布間の距離に比例する——を特定する。本稿では、すべての基準を満たす損失関数は普遍的に存在しないが、真実を歪めないキャリブレーション済み分布(真の分布より情報が少ない可能性はあるが)に制限することで、対数損失や逆平方根損失といった新しい損失関数を含む広範な損失クラスがこれらの基準を満たすことが示され、高次元の分布学習において対数損失の原理的代替が可能になる。

ABSTRACT

In this work we study loss functions for learning and evaluating probability distributions over large discrete domains. Unlike classification or regression where a wide variety of loss functions are used, in the distribution learning and density estimation literature, very few losses outside the dominant $log\ loss$ are applied. We aim to understand this fact, taking an axiomatic approach to the design of loss functions for learning distributions. We start by proposing a set of desirable criteria that any good loss function should satisfy. Intuitively, these criteria require that the loss function faithfully evaluates a candidate distribution, both in expectation and when estimated on a few samples. Interestingly, we observe that \emph{no loss function} possesses all of these criteria. However, one can circumvent this issue by introducing a natural restriction on the set of candidate distributions. Specifically, we require that candidates are $calibrated$ with respect to the target distribution, i.e., they may contain less information than the target but otherwise do not significantly distort the truth. We show that, after restricting to this set of distributions, the log loss, along with a large variety of other losses satisfy the desired criteria. These results pave the way for future investigations of distribution learning that look beyond the log loss, choosing a loss function based on application or domain need.

研究の動機と目的

  • 分布学習における良好な損失関数が満たすべき公理的基準を特定すること。
  • 他の代替損失が存在するにもかかわらず、なぜ対数損失が支配的であるのかを解明すること。
  • 高次元離散ドメインにおいて、代替損失関数が適切かつ頑健である条件を同定すること。
  • 真の分布に対してキャリブレーションされた分布に制限することで、非対数損失の適用範囲を広げられることを示すこと。
  • 逆平方根損失を含む、新しい適切損失関数のクラスを導入・分析すること、特にℓ₁ノルム下での強適切性を示すこと。

提案手法

  • 公理的基準のセットを提案:適切性(期待損失が真の分布で最小化)、局所性(損失が観測結果の予測確率にのみ依存)、強適切性(損失の差が分布間の距離に比例)。
  • 真実を歪めないが、真の分布より情報が少ない可能性がある「キャリブレーション済み分布」の概念を導入し、これによりより強い理論的保証が可能になることを示す。
  • Bregman散発と強い強凸性を用いて、特にℓ₁およびℓ₂ノルム下での強適切性を形式化する。
  • エントロピー関数の2階微分を分析することで、新たな適切損失関数のクラスを導出。これにより、0 < α < 1 に対して h(q_x) = q_x^{1−α} を用いた損失関数が得られる。
  • 逆平方根損失を特定の例(α = 0.5)として構築し、ℓ(q,x) = 1/√q_x + ∑√q_x′ が得られ、関連するBregman散発 D_H(p,q) = ∑(√p_x − √q_x)² / √q_x が得られる。
  • ∑f(q_x) ≤ 1 であるとき、f(q_x) = q_x^{1+α} ならば、結果として得られる損失がℓ₁ノルム下で1-強適切であることを証明する。

実験結果

リサーチクエスチョン

  • RQ1分布学習のための損失関数が、候補分布の忠実な評価を保証するために満たすべき公理的性質は何か?
  • RQ2他の代替損失が存在するにもかかわらず、なぜ対数損失が分布学習で支配的であるのか?
  • RQ3対数損失を超える、より広い損失関数のクラスを、高次元離散ドメインで適切かつ頑健である条件として特定できるか?
  • RQ4非対数損失が強適切性を達成し、真の分布への忠実性を維持するための条件は何か?
  • RQ5強い強凸性とBregman散発の枠組みを用いて、どのような新しい良好な損失関数を構築できるか?

主な発見

  • すべての候補分布に対して、適切性、局所性、強適切性というすべての望ましい基準を満たす損失関数は、普遍的に存在しない。
  • 真実を歪めないキャリブレーション済み分布に制限すると、対数損失やその他の広範な損失関数が、望ましい基準のすべてを満たす。
  • h(q_x) = 2√q_x で定義される逆平方根損失は、新しい適切損失関数であり、ℓ₁ノルム下で1-強適切であり、二乗ヘルンゲル距離に類似したBregman散発を持つ。
  • α = 0.5 の場合、損失関数 ℓ(q,x) = 1/√q_x + ∑√q_x′ は強適切性を達成し、単体上での有界性を保つ。これにより、他の形式が抱える無限大発散の問題を回避できる。
  • 本稿では、二乗損失がℓ₂ノルム下で1-強適切であることを証明するが、この性質はℓ₁に基づく強適切性ほど実用的ではない。
  • 0 < α < 1 に対して h(q_x) = q_x^{1−α} を用いた損失関数のクラスは、適切かつ有界であり、強適切性を満たす損失関数の族を形成し、対数損失を超える一般化を実現する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。