Skip to main content
QUICK REVIEW

[論文レビュー] Did the Model Change? Efficiently Assessing Machine Learning API Shifts

Lingjiao Chen, Tracy Cai|arXiv (Cornell University)|Jul 29, 2021
Software Engineering Research参考文献 29被引用数 8
ひとこと要約

本稿では、混同行列の変化を推定することで、機械学習APIの予測における時間的変化を効率的に検出・定量するための新しい適応的サンプリング手法MA-SAMを提案する。予測の不確実性に基づいて動的にデータポイントをサンプリングすることで、MA-SAMはAPIコールコストを最大90%削減しつつ、一様サンプリングに比べて推定誤差を1桁小さく実現し、生産環境におけるモデルのドリフトを費用対効果に優れた精度で監視可能にする。

ABSTRACT

Machine learning (ML) prediction APIs are increasingly widely used. An ML API can change over time due to model updates or retraining. This presents a key challenge in the usage of the API because it is often not clear to the user if and how the ML model has changed. Model shifts can affect downstream application performance and also create oversight issues (e.g. if consistency is desired). In this paper, we initiate a systematic investigation of ML API shifts. We first quantify the performance shifts from 2020 to 2021 of popular ML APIs from Google, Microsoft, Amazon, and others on a variety of datasets. We identified significant model shifts in 12 out of 36 cases we investigated. Interestingly, we found several datasets where the API's predictions became significantly worse over time. This motivated us to formulate the API shift assessment problem at a more fine-grained level as estimating how the API model's confusion matrix changes over time when the data distribution is constant. Monitoring confusion matrix shifts using standard random sampling can require a large number of samples, which is expensive as each API call costs a fee. We propose a principled adaptive sampling algorithm, MASA, to efficiently estimate confusion matrix shifts. MASA can accurately estimate the confusion matrix shifts in commercial ML APIs using up to 90% fewer samples compared to random sampling. This work establishes ML API shifts as an important problem to study and provides a cost-effective approach to monitor such shifts.

研究の動機と目的

  • 第三者のML APIにおける顕著なパフォーマンスの変化を特定・定量すること。これらの変化はしばしば影響を及ぼすにもかかわらず、多くの場合、無視されがちである。
  • 標準的なランダムサンプリングによるML APIパフォーマンス監視の高コスト問題に対処すること。これは、多数の高価なAPIコールを必要とする。
  • 計算的・経済的コストを大幅に削減しながらも高い推定精度を維持する、軽量で適応的なサンプリング戦略の開発。
  • 生産チームが精度を犠牲にすることなく、実世界のML APIにおけるモデルドリフトをリアルタイムで監視できる実用的でコスト効率の良いソリューションの提供。
  • 固定のサンプル予算下で、APIのシフト検出を混同行列の変化推定問題として形式化すること。

提案手法

  • MA-SAMは、混同行列のシフト推定に最も情報を与えるデータポイントを優先する適応的サンプリングを用いる。特に、予測の不確実性が高く、影響が大きい予測に注目する。
  • データセットをクラスタリングし、モデルの予測の不確実性に基づいて各クラスタから適応的にサンプリングすることで、シフト推定の分散を低減する。
  • 信頼区間のアプローチを用いて、各クラスタごとに自動的にサンプリングレートを最適化し、精度とコストのバランスを取る。
  • 変化が最も起こりやすい高不確実性領域に対してスーパーサンプリング戦略を採用し、推定の精度を向上させる。
  • 推定誤差の理論的上限を活用することで、サンプルサイズ制約下でも信頼性の高い性能を保証する。
  • 本手法は、実世界のML APIと互換性があり、既存の監視パイプラインへの変更を最小限に抑える軽量な設計である。

実験結果

リサーチクエスチョン

  • RQ1ML APIは時間の経過とともにどの程度の頻度で顕著なパフォーマンスの変化を経験しており、それらの変化は下流のアプリケーションにどのような影響を及えるか?
  • RQ2標準的一様サンプリングを用いたモデルシフト監視のコストはどの程度で、精度を損なわず低減可能か?
  • RQ3少ないAPIコール数で混同行列のシフトを推定するにあたり、適応的サンプリング戦略は一様サンプリングを上回る性能を示せるか?
  • RQ4同じサンプル予算下で、適応的サンプリングの推定誤差は一様サンプリングと比べてどの程度か?
  • RQ5適応的サンプリングは、許容可能な推定誤差を維持しつつ、必要なAPIコール数をどの程度まで削減できるか?

主な発見

  • 2020年から2021年の間、36のML APIとデータセットの組み合わせのうち12件で顕著なモデルシフトが同定され、いくつかのケースで1%を超えるパフォーマンス低下が観察された。
  • 1件の事例では、IBMの音声認識APIが2020年3月から2021年3月にかけて全体の正答率が7%低下した。主な原因は「four」を「five」と誤分類していたことである。
  • MA-SAMは、一様サンプリングに比べて、必要なAPIコール数を最大90%削減した一方で、推定誤差は1桁小さくなった。
  • 平均して、同じサンプルサイズ下でMA-SAMは一様サンプリングに比べて推定誤差を1〜2桁小さく実現した。
  • 与えられた予算下で、Google、Microsoft、AmazonのAPIを含む多数の実世界APIにおいて、MA-SAMは推定誤差を50%以上低減した。
  • 本手法は高い信頼性と低コストを維持しており、生産環境における継続的監視に適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。