Skip to main content
QUICK REVIEW

[論文レビュー] Evaluation of binary classifiers for asymptotically dependent and independent extremes

J. F. Legrand, Philippe Naveau|arXiv (Cornell University)|Dec 27, 2021
Anomaly Detection Techniques and Applications被引用数 5
ひとこと要約

本稿では、極値設定におけるバイナリ分類器の評価のための新しいリスク関数を提案し、希少事象予測における不均衡問題に対処する。イベント発生確率に基づいて誤分類コストを再重み付けすることで、分類器の公平な比較を保証し、理論的整合性と多変量正則変動下での実証的妥当性を有する。河川流出予測への応用で検証された。

ABSTRACT

Machine learning classification methods usually assume that all possible classes are sufficiently present within the training set. Due to their inherent rarities, extreme events are always under-represented and classifiers tailored for predicting extremes need to be carefully designed to handle this under-representation. In this paper, we address the question of how to assess and compare classifiers with respect to their capacity to capture extreme occurrences. This is also related to the topic of scoring rules used in forecasting literature. In this context, we propose and study a risk function adapted to extremal classifiers. The inferential properties of our empirical risk estimator are derived under the framework of multivariate regular variation and hidden regular variation. A simulation study compares different classifiers and indicates their performance with respect to our risk function. To conclude, we apply our framework to the analysis of extreme river discharges in the Danube river basin. The application compares different predictive algorithms and test their capacity at forecasting river discharges from other river stations.

研究の動機と目的

  • 標準のリスク関数が単純な「常にネガティブ」予測を好むため、希少な極値事象のためのバイナリ分類器を評価する課題に対処する。
  • 過剰に楽観的または過剰に悲観的な分類器に対して公平にペナルティを与えるリスク関数を構築し、自明な解へのバイアスを回避する。
  • 多変量正則変動および隠れた正則変動の枠組み下で、リスク関数の理論的整合性を確立する。
  • 多変量正則変動下でのシミュレーションとドナウ川流域における河川流出の実世界応用を通じて、手法の実証的妥当性を検証する。
  • 新しいリスク関数に基づく線形分類器の最適化により、極値行動の主要な予測因子を同定する。

提案手法

  • イベントと予測確率の和集合で正規化された誤差関数 $ l_u(g;(m{x},y)) = \frac{1}{\mathbb{P}(Y^{(u)}=1 \text{ or } g(\bm{X};u)=1)} \mathds{1}\{g(\bm{x};u)\neq y\} $ を提案し、誤分類コストを再重み付けする。
  • 関連するリスク $ R^{(u)}(g) = \mathbb{E}[l_u(g;(m{X},Y^{(u)}))] $ を定義し、[0,1] に有界であり、『常にネガティブ』および『常にポジティブ』分類器で値が1となる。
  • 多変量正則変動および隠れた正則変動の下で、経験的リスク推定器の漸近的理論を確立し、ガウス過程への弱収束を証明する。
  • 経験過程理論とバケツ化エントロピーを用い、適切なモーメントおよび連続性条件の下で、リスク推定器のタイトネスおよび弱収束を検証する。
  • 線形分類器 $ b_{\bm{\theta}}(\bm{x},h) = \mathds{1}\{\bm{\theta}^T\bm{x}>1 \text{ or } h>1\} $ にこの枠組みを適用し、リスクの最小化が極値依存構造の一貫した推定に繋がることを示す。
  • 関数的デルタ法およびストキャスティック過程のためのリンデバーグ型条件を用いて、経験的リスク推定器の漸近的正規性を導出する。

実験結果

リサーチクエスチョン

  • RQ1陽性クラスが希少な状況下で、極値事象のためのバイナリ分類器を公平に評価するためのリスク関数をどのように構築できるか?
  • RQ2多変量正則変動および隠れた正則変動の下で、経験的リスク推定器の漸近的性質は何か?
  • RQ3提案されたリスク関数は、高次元設定下で極値行動の最も関連性の高い予測因子を一貫して特定できるか?
  • RQ4古典的指標(例:臨界成功指数)と比較して、新しいリスク関数は極値事象予測においてどのように異なるか?
  • RQ5本フレームワークは、河川流出予測のような実世界の応用において、予測性能をどの程度向上させるか?

主な発見

  • 提案されたリスク関数 $ R^{(u)}(g) $ は、『常にネガティブ』および『常にポジティブ』分類器が両方ともリスク値1をとることを保証し、公平な比較の明確な基準を提供する。
  • 多変量正則変動下では、経験的リスク推定器はガウス過程に弱収束し、収束速度は尾指数および次元に依存する。
  • 線形分類器では、リスク関数の最小化が極値依存構造の一貫した推定に繋がり、最も影響力のある予測因子を同定する。
  • ドナウ川の河川流出への応用において、本フレームワークは複数の予測アルゴリズムを効果的に比較し、極値事象に寄与する主要な変数を同定した。
  • シミュレーションスタディにより、新しいリスク関数が分類器の真の極値予測能力に基づいて順位付けを的確に行い、単純なモデルへのバイアスを回避できることを確認した。
  • 理論的分析により、リスク推定器は漸近的に正規分布に従い、収束速度は $ \mathbb{P}(H>u_n) \to 0 $ が $ u_n \to \infty $ のとき成り立つことによって支配される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。