Skip to main content
QUICK REVIEW

[論文レビュー] Improving Conditional Coverage via Orthogonal Quantile Regression

Shai Feldman, Stephen Bates|arXiv (Cornell University)|Jun 1, 2021
Machine Learning and Data Classification参考文献 46被引用数 6
ひとこと要約

本稿では、予測区間の条件付きカバレッジを向上させるために直交分位数回帰を提案する。これは、区間長と誤差発生事象の間の統計的独立性を強制することで、すべての特徴サブパopulationにおいて信頼性の高い不確実性推定を実現する。この手法は、従来のものと最新の分位数回帰モデルの両方を強化し、実世界のデータセットにおいて顕著に優れた条件付きカバレッジを達成するとともに、カバレッジ妥当性を評価するための新しい指標を導入する。

ABSTRACT

We develop a method to generate prediction intervals that have a user-specified coverage level across all regions of feature-space, a property called conditional coverage. A typical approach to this task is to estimate the conditional quantiles with quantile regression -- it is well-known that this leads to correct coverage in the large-sample limit, although it may not be accurate in finite samples. We find in experiments that traditional quantile regression can have poor conditional coverage. To remedy this, we modify the loss function to promote independence between the size of the intervals and the indicator of a miscoverage event. For the true conditional quantiles, these two quantities are independent (orthogonal), so the modified loss function continues to be valid. Moreover, we empirically show that the modified loss function leads to improved conditional coverage, as evaluated by several metrics. We also introduce two new metrics that check conditional coverage by looking at the strength of the dependence between the interval size and the indicator of miscoverage.

研究の動機と目的

  • 標準的な分位数回帰における悪い条件付きカバレッジ、特に有限標本およびニューラルネットワークのような複雑なモデルにおいて問題となる点を是正すること。
  • 特徴空間のすべての領域でユーザー指定のカバレッジ水準を維持できるように、訓練手法を開発すること。
  • 区間長と誤差発生の間の従属関係の強さを示す、解釈可能な新しい指標を導入し、条件付きカバレッジの失敗を示唆すること。
  • 有限標本における性能向上を、区間長とカバレッジの直交性を強制することで実証的に検証すること。
  • 多様な実世界のデータセットおよびモデルアーキテクチャにおいて、この手法の有効性を示すこと。

提案手法

  • 区間長と誤差発生インジケータの間の統計的独立性を促進する正則化項を追加することで、分位数回帰損失関数を変更する。
  • 二重に強力な推定フレームワークを用いて、モデル誤指定下でも漸近的に直交性条件が成立することを保証する。
  • 真の条件付き分位数では、区間長と誤差発生が無相関であることに着目し、これが妥当で安定した最適化目的関数であることを活用する。
  • 区間長と誤差発生事象の従属関係を測る指標として、ピアソン相関とHSICの2つの新しい指標を導入し、条件付きカバレッジを評価する。
  • 従来型およびディープラーニングベースの分位数回帰モデル、特にマージナルカバレッジ補正のためのコンフォーマル化分位数回帰に対してもこの手法を適用する。
  • 大バッチ学習を用いて、区間長とカバレッジの間の従属関係を信頼性高く推定し、効果的な正則化を実現する。

実験結果

リサーチクエスチョン

  • RQ1区間長と誤差発生の間の統計的独立性を強制することで、分位数回帰における有限標本の条件付きカバレッジが向上するか?
  • RQ2提案された直交分位数回帰手法は、多様なサブパopulationにわたるカバレッジ維持において、標準的分位数回帰と比べてどのように異なるか?
  • RQ3標準的な評価では見逃されがちな条件付きカバレッジの違反を、新しい指標(例:相関、HSIC)がどの程度検出できるか?
  • RQ4マージナルカバレッジを保証するためのコンフォーマル推論と組み合わせた場合、この手法は依然として有効性を示すか?
  • RQ5区間長以外の特徴関数に対しても、このアプローチを一般化して独立性を強制できるか?

主な発見

  • 提案された直交分位数回帰手法は、9つの実世界データセットにおいて条件付きカバレッジを顕著に向上させ、相関やHSICのような従属に基づく指標において平均で+40%~+88%の改善を達成した。
  • meps_21データセットでは、ベースラインのCQRと比較して、Δノードカバレッジ指標で誤差長の従属が37.33%低減された。
  • コンフォーマライゼーション後、正確なマージナルカバレッジ(90%)を達成した一方で、条件付きカバレッジも優れた水準を維持し、facebook_1では相関指標で67.79%の改善を達成した。
  • この手法は、9つのベンチマークデータセットすべてにおいて標準的分位数回帰を上回り、相関、HSIC、ΔWSCの3つの主要な条件付きカバレッジ指標において一貫した向上を示した。
  • 特に分散が大きく、不均衡なデータセット(例:meps_19およびmeps_20)では、カバレッジの信頼性が顕著に向上した。
  • この手法は、フィードフォワードネットワークおよびディープニューラルネットワークを含むさまざまなモデルアーキテクチャにおいて、通常の分位数回帰およびコンフォーマライズド分位数回帰と組み合わせて用いても、頑健性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。