Skip to main content
QUICK REVIEW

[論文レビュー] Never mind the metrics -- what about the uncertainty? Visualising confusion matrix metric distributions

David Lovell, Dimity Miller|arXiv (Cornell University)|Jun 5, 2022
Data Visualization and Analytics被引用数 5
ひとこと要約

本稿では、ベイジアン事後予測分布を用いて、混同行列に基づく性能指標の不確実性を可視化する手法を提案している。その結果、少数のサンプルサイズからの不確実性が、分類器間の差を上回ることが多いことが明らかになった。真陽性率と偽陽性率をベータ=二項分布でモデル化し、ROC空間における指標の等高線を可視化することで、特にクラス不均衡やデータ不足の状況下では、性能に関する主張はこの内在的な不確実性を考慮すべきであると示している。

ABSTRACT

There are strong incentives to build models that demonstrate outstanding predictive performance on various datasets and benchmarks. We believe these incentives risk a narrow focus on models and on the performance metrics used to evaluate and compare them -- resulting in a growing body of literature to evaluate and compare metrics. This paper strives for a more balanced perspective on classifier performance metrics by highlighting their distributions under different models of uncertainty and showing how this uncertainty can easily eclipse differences in the empirical performance of classifiers. We begin by emphasising the fundamentally discrete nature of empirical confusion matrices and show how binary matrices can be meaningfully represented in a three dimensional compositional lattice, whose cross-sections form the basis of the space of receiver operating characteristic (ROC) curves. We develop equations, animations and interactive visualisations of the contours of performance metrics within (and beyond) this ROC space, showing how some are affected by class imbalance. We provide interactive visualisations that show the discrete posterior predictive probability mass functions of true and false positive rates in ROC space, and how these relate to uncertainty in performance metrics such as Balanced Accuracy (BA) and the Matthews Correlation Coefficient (MCC). Our hope is that these insights and visualisations will raise greater awareness of the substantial uncertainty in performance metric estimates that can arise when classifiers are evaluated on empirical datasets and benchmarks, and that classification model performance claims should be tempered by this understanding.

研究の動機と目的

  • 機械学習における単一の指標値に依存しすぎている傾向を是正すること。これは、推定の不確実性を無視する傾向がある。
  • 特に陽性または陰性例が少ない場合に、混同行列のエントリにおける不確実性が、分類器間の差を上回ることがあることを強調すること。
  • バランス精度やMCCのような性能指標が不確実性のもとでどのように変動するかを理解するための、視覚的かつ確率的フレームワークを提供すること。
  • 特に不均衡なデータやデータ量が少ない状況下では、性能比較の焦点を「性能の勝負」から、データの質と代表性へと転換すべきであることを提唱すること。
  • 二項分布およびベータ=二項分布モデルに根ざした、性能指標の離散的事後予測分布を可視化するインタラクティブツールを開発すること。

提案手法

  • 各真陽性・偽陽性・真陰性・偽陰性のカウントの組み合わせに対応する、3次元の組み合わせ的ラティス上に二値の混同行列を表現する。
  • 真陽性率および真陰性率の観点から、性能指標(例:BA、MCC)の等高線を導出し、ROC空間の基盤を形成する。
  • 観測データと事前分布を前提に、二項分布およびベータ=二項分布モデルを用いて、混同行列エントリの正確な事後予測確率質量関数(PMF)を計算する。
  • 混同行列の事後PMFを、性能指標の事後PMFに変換することで、不確実性を考慮した比較が可能になる。
  • さまざまなサンプルサイズやクラス不均衡の下で、指標値とその不確実性がどのように変化するかを探索するためのインタラクティブな可視化およびアニメーションを作成する。
  • マルチノミアル分類への拡張として、1対すべての分解を用い、将来的な一般化のためのディリクレ=多項分布モデルを検討する。

実験結果

リサーチクエスチョン

  • RQ1混同行列エントリの不確実性は、バランス精度やマクカーシー相関係数といった一般的に用いられる性能指標の信頼性にどのように影響するか?
  • RQ2特にレアクラスに対して少数のサンプルサイズが与えられた場合、実証的分類器性能の差が統計的に意味を持たなくなる可能性はどの程度か?
  • RQ3ROC空間における性能指標の等高線の幾何的性質は、元々の離散的混同行列分布とどのように関係しているか?
  • RQ4クラス不均衡は性能指標の解釈をどの程度歪めるか?不確実性モデリングがその歪みを明確にするのをどのように支援できるか?
  • RQ5指標の事後予測分布の可視化は、研究者や実務家が分類器性能に関する主張の妥当性をよりよく評価するのを支援できるか?

主な発見

  • バランス精度やマクカーシー相関係数といった性能指標は、特にクラス不均衡な分布の下で、少数のデータセットで評価された場合に顕著な不確実性を示す。
  • ベータ=二項分布でモデル化された混同行列エントリの事後予測分布は、同じ実証的混同行列であっても、観測された指標値が大きく変動しうることを明らかにした。
  • 真陽性率および偽陽性率の離散的事後予測PMFは、陽性または陰性例の数が少ない場合、指標推定が本質的に不確実であることを示している。
  • 可視化により、ROC空間における指標の等高線の幾何的性質が、異なる指標におけるクラス不均衡への感受性の違いを反映していることが示された。
  • 性能推定の不確実性は、分類器間の差を上回ることが多く、単一の指標値に基づく性能順位付けが誤解を招く可能性があると示唆された。
  • 著者らは、より多くのデータ、特にレアクラスの代表的なデータが、不確実性を低減するために不可欠であると結論づけ、現在の性能主張には不確実性を考慮した解釈を伴うべきだと提言した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。