Skip to main content
QUICK REVIEW

[論文レビュー] A plug-in approach to maximising precision at the top and recall at the top

Dirk Tasche|arXiv (Cornell University)|Apr 9, 2018
Machine Learning and Algorithms参考文献 12被引用数 5
ひとこと要約

この論文は、二値分類および情報検索において、陽性クラスの事後確率をしきい値処理することで、トップk件の精度(precision@k)とトップk件の再現率(recall@k)を最適に最大化できることを確立している。このアプローチはコストに敏感な分類を一般化し、連続でない分布や予測陽性率にさまざまな制約がある状況でも、最適なしきい値処理によるプラグイン解を提供する。

ABSTRACT

For information retrieval and binary classification, we show that precision at the top (or precision at k) and recall at the top (or recall at k) are maximised by thresholding the posterior probability of the positive class. This finding is a consequence of a result on constrained minimisation of the cost-sensitive expected classification error which generalises an earlier related result from the literature.

研究の動機と目的

  • トップk件の精度とトップk件の再現率を最大化する理論的に最適なプラグイン分類器を確立すること。
  • 従来のコストに敏感な誤差の制約付き最小化の結果を、任意の非負のコスト重みと陽性率に関するより広範な制約に一般化すること。
  • 陽性クラスの事後確率をしきい値処理することで、分布が不連続であってもこれらの性能基準下で最適な分類器が得られることを示すこと。
  • 二つの分散が等しい二正規分布モデルのような、正確な最適解が解析的に得られる状況において、新しい最適化アルゴリズムの評価のための実用的ベンチマークを提供すること。

提案手法

  • 予測陽性率に制約を課したもとでのコストに敏感な期待分類誤差の制約付き最小化問題を定式化する。
  • 最適な分類器が、特定の分位数で陽性クラスの事後確率をしきい値処理する確率的意思決定分類器(RDC)であることを証明する。
  • ClémençonとVayatis(2007)の結果を一般化し、a + b > 0 を満たす任意の非負のコスト重み(a, b)を許容する。
  • 事後確率分布が不連続である場合にも適用可能であり、さまざまなデータタイプにわたるロバストネスを確保する。
  • 具体的な例として、二つの分散が等しい二正規分布モデルを用い、最適なしきい値 q を分位数推定により解析的表現で導出する。
  • 確率 P[P(A|H) > q] が 1 - α に等しくなるようなしきい値 q を求めることが解決策である。ここで α は所望の陽性率である。

実験結果

リサーチクエスチョン

  • RQ1陽性クラスの事後確率をしきい値処理することで、二値分類においてトップk件の精度とトップk件の再現率を最適に最大化できることが示せるか?
  • RQ2精度@k と再現率@k の最適分類器は、コストに敏感な分類およびネイマン=ピアソンの補題とどのように関係するか?
  • RQ3事後確率分布が不連続である場合の最適分類器の数学的形態は何か?
  • RQ4特に分散が等しい二正規分布モデルにおいて、最適なしきい値はどのように実用的に計算できるか?
  • RQ5このプラグイン手法は、精度およびトップk件の再現率最適化の文脈で、他の学習アルゴリズムの評価のベンチマークとして機能できるか?

主な発見

  • 陽性クラスの事後確率を特定の分位数でしきい値処理することで、精度@k と再現率@k の両方を最適に最大化するプラグイン分類器が得られる。
  • 最適な分類器は、制約付き性能指標に一般化されたコストに敏感なベイズ分類器を拡張した確率的意思決定分類器(RDC)である。
  • 事後確率分布が不連続であっても、この結果は成り立ち、従来の連続分布に限られた研究を拡張する。
  • 分散が等しい二正規分布モデルでは、最適なしきい値 q は標準正規分布の累積分布関数とモデルパラメータを含む分位数方程式を解くことで決定される。
  • 解 q は P[P(A|H) > q] = 1 - α を満たし、ここで α は所望の陽性率であり、q はモデルパラメータによって一意に定まる。
  • この手法は、精度およびトップk件の再現率の最適化設定における新しい最適化アルゴリズムの評価のための閉形式ベンチマークを提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。