Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Calibration under Covariate Shift

Anusri Pampari, Stefano Ermon|arXiv (Cornell University)|Jun 29, 2020
Anomaly Detection Techniques and Applications参考文献 26被引用数 4
ひとこと要約

本稿では、訓練データとテストデータの分布が異なる共変量シフト下で機械学習モデルをキャリブレーションするための、重要度サンプリングに基づく手法を提案する。ドメイン不変特徴量と識別器による密度比推定を活用することで、ラベルなしのターゲットデータを必要とせずに、温度スケーリングなどの既存のキャリブレーション手法を適応可能にし、キャリブレーション誤差を顕著に低減する(例:ECEが20.6%から7.7%に低下)。ドメイン適応で訓練されたモデルに対しても有効である。

ABSTRACT

A probabilistic model is said to be calibrated if its predicted probabilities match the corresponding empirical frequencies. Calibration is important for uncertainty quantification and decision making in safety-critical applications. While calibration of classifiers has been widely studied, we find that calibration is brittle and can be easily lost under minimal covariate shifts. Existing techniques, including domain adaptation ones, primarily focus on prediction accuracy and do not guarantee calibration neither in theory nor in practice. In this work, we formally introduce the problem of calibration under domain shift, and propose an importance sampling based approach to address it. We evaluate and discuss the efficacy of our method on both real-world datasets and synthetic datasets.

研究の動機と目的

  • ドメイン適応によって高精度を達成したモデルでも、共変量シフト下ではキャリブレーションが不十分であることを特定すること。
  • 訓練データ分布からテストデータ分布がシフトする状況において、モデルのキャリブレーションが欠落することへの対処。
  • ラベルなしのターゲットデータを必要とせず、ドメインシフト下でもモデルのキャリブレーションを可能にする手法の開発。
  • 安全性が求められる応用分野における不確実性の評価を向上させること。ここでは、モデルの信頼度が真の予測信頼性を反映する必要がある。

提案手法

  • ソースの検証データに対して、ソースとターゲット分布間の推定密度比に基づいて重み付けを施すために重要度サンプリングを用いる。
  • ドメインアダプティブネットワーク(例:CDAN)から得られるドメイン不変特徴量層を用い、密度比推定のための二値識別器を訓練する。
  • 推定された密度比を用いてキャリブレーション目的関数を変更し、任意の既存キャリブレーション手法(例:温度スケーリング)をターゲットドメインに適応可能にする。
  • 識別器の出力を用いて、尤度比 p_target(x)/p_source(x) を近似し、キャリブレーション損失における重要度重みとして使用する。
  • 重み付けされたキャリブレーション目的関数を標準的な事後キャリブレーション手法に統合し、分布シフト下でも一般化可能にする。
  • 実世界のデータセット(Office-31、Office-Home、MNIST-USPS)を用いて、多様なドメインシフト状況下で手法を評価する。

実験結果

リサーチクエスチョン

  • RQ1温度スケーリングなどの既存キャリブレーション手法は、共変量シフト下でもキャリブレーション性能を維持できるか?
  • RQ2精度が保たれている状況でも、ドメイン適応によってモデルのキャリブレーションがどの程度損なわれるか?
  • RQ3ラベルなしのターゲットデータを前提に、共変量シフト下で非教師ありキャリブレーションが達成可能か?
  • RQ4推定密度比を用いた重要度サンプリングは、ドメインシフト下でのキャリブレーション向上にどの程度有効か?
  • RQ5実世界の設定において、提案手法の性能を制限する要因は何か?

主な発見

  • 提案された重み付きキャリブレーション手法は、ドメインシフトされたデータにおいて期待キャリブレーション誤差(ECE)を顕著に低減し、Office-31のA→DシナリオでECEを14.7%から6.0%に低下させた。
  • MNIST-USPSデータセットでは、M→U移行においてECEが20.6%から7.7%に改善され、シフト下でも優れた性能を示した。
  • Office-HomeデータセットのCl→Pr移行では、ECEが13.3%から6.4%に低下し、多様なドメイン間で一貫した改善が確認された。
  • 重みなしキャリブレーションやベースライン手法に比べて、特にソースとターゲットのデータ分布が著しく異なる状況で優れた性能を示した。
  • 一部の設定(例:A→W、A→D)では、データの不均衡や密度比推定の精度が低いことが性能劣化の要因であることが判明し、主な制限要因であることが示された。
  • 本手法の有効性は、正確な密度比推定に強く依存しており、今後の研究においてこのステップの改善が不可欠であることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。