Skip to main content
QUICK REVIEW

[論文レビュー] Testing for concept shift online

Vladimir Vovk|arXiv (Cornell University)|Dec 28, 2020
Data Stream Mining Techniques参考文献 11被引用数 4
ひとこと要約

本論文は、適合予測に基づいて導出された分解可能交換可能性マルティングルを用いて、機械学習におけるオンライン的コンセプトシフト検出のための新規手法を提案する。コンセプトシフトの証拠とラベルシフトの証拠を分離することにより、顕著に優れた検出性能を達成した—USPSデータセットでは最終マルティングル値が10^43に達し、先行手法を上回った。

ABSTRACT

This note continues study of exchangeability martingales, i.e., processes that are martingales under any exchangeable distribution for the observations. Such processes can be used for detecting violations of the IID assumption, which is commonly made in machine learning. Violations of the IID assumption are sometimes referred to as dataset shift, and dataset shift is sometimes subdivided into concept shift, covariate shift, etc. Our primary interest is in concept shift, but we will also discuss exchangeability martingales that decompose perfectly into two components one of which detects concept shift and the other detects what we call label shift. Our methods will be based on techniques of conformal prediction.

研究の動機と目的

  • データ分布が時間とともに変化する分類タスクにおけるオンライン的コンセプトシフト検出手法の開発を目的とする。
  • 交換可能性マルティングルを、コンセプトシフトとラベルシフトの両者に対する証拠を分離する成分に分解することを目的とする。
  • 従来の交換可能性マルティングルを改善し、コンセプトシフトに非常に感受性が高く、かつ完全に分解可能なマルティングルを構築することを目的とする。
  • 検出可能な分布シフトに基づいて機械学習モデルの再訓練をいつ行うかを決定する実用的なフレームワークの提供を目的とする。
  • 適合予測技術を拡張し、Y→XドメインにおけるROC分析を無効にする危険なシフトを検出することを目的とする。

提案手法

  • 任意の交換可能性分布の下でマルティングルであるような交換可能性マルティングルを構築し、IID仮定の違反に対するオンライン仮説検定を可能にする。
  • ラベル条件付きの適合度測度を用いて、ラベルの順列変更に対して不変なp値を生成することで、交換可能性を保証する。
  • 適合p値に「スリーピー・ジャンパー」ベッティング戦略を適用し、分布シフトが発生する際に成長する非負のマルティングルを生成する。
  • 全体のマルティングルを、コンセプトシフトを検出する(条件付きp値を用いた)成分とラベルシフトを検出する(周辺p値を用いた)成分の積に分解する。
  • 同じクラスの適合度測度と最近傍オブジェクトの適合度測度を用いて、適合度スコア設計の検出性能への影響を調査する。
  • 第2の定理を用いて、コンセプトシフトとラベルシフトのための別個のマルティングルを組み合わせ、IID仮定の下で積が有効な交換可能性マルティングルのまま保たれることを保証する。

実験結果

リサーチクエスチョン

  • RQ1交換可能性マルティングルを、コンセプトシフトを特に検出することを目的として構築することは可能か?
  • RQ2交換可能性マルティングルを、コンセプトシフトとラベルシフトを別々に検出する成分に分解することは可能か?
  • RQ3分解可能なマルティングルは、非分解可能なものと比較して、データセットシフトの検出性能において優れているか?
  • RQ4ラベルシフトへの感受性を損なわせることなく、コンセプトシフトの検出を改善することは可能か?
  • RQ5異なる適合度測度が、実世界のデータセットにおける交換可能性マルティングルの最終値に与える影響は何か?

主な発見

  • コンセプトシフト検出用マルティングルとラベルシフト検出用マルティングルの積は、有効で完全に分解可能な交換可能性マルティングルを形成する。
  • USPSデータセットでは、分解可能マルティングルが約5.16 × 10^43の最終値に達し、以前の記録であるブラック・マルティングルを著しく上回った。
  • 図1の赤(コンセプトシフト)と緑(ラベルシフト)のマルティングルは、約3000件の観測後、分解可能アプローチが元のブラック・マルティングルを上回っていることを示している。
  • 同じクラスの適合度測度を用いることで、コンセプトシフトの検出性能が著しく向上するが、その代わりラベルシフト検出性能が低下する。
  • 適合度スコアの分母を、クラスにかかわらず最近傍の距離に置き換えると、コンセプトシフト検出性能がわずかに低下する。これは、クラスに依存する距離がより情報を含んでいることを示唆している。
  • 図1の緑のマルティングルと図2の赤のマルティングルを組み合わせることで、最終マルティングル値が5.16 × 10^43に達し、成分ごとの最適化の有効性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。