Skip to main content
QUICK REVIEW

[논문 리뷰] Did the Model Change? Efficiently Assessing Machine Learning API Shifts

Lingjiao Chen, Tracy Cai|arXiv (Cornell University)|2021. 07. 29.
Software Engineering Research참고 문헌 29인용 수 8
한 줄 요약

이 논문은 기계 학습 API 예측의 시간에 따른 변화를 효율적으로 탐지하고 정량화하기 위해 혼동 행렬의 변화를 추정하는 새로운 적응형 샘플링 알고리즘 MA-SAM을 제안한다. 예측의 불확실성에 기반해 동적으로 데이터 포인트를 샘플링함으로써 MA-SAM은 API 호출 비용을 최대 90%까지 줄이며, 균일 샘플링 대비 추정 오차를 한 계급 수준 낮춘다. 이는 생산 환경에서 모델 드리프트를 비용 효율적이고 정밀하게 모니터링할 수 있도록 한다.

ABSTRACT

Machine learning (ML) prediction APIs are increasingly widely used. An ML API can change over time due to model updates or retraining. This presents a key challenge in the usage of the API because it is often not clear to the user if and how the ML model has changed. Model shifts can affect downstream application performance and also create oversight issues (e.g. if consistency is desired). In this paper, we initiate a systematic investigation of ML API shifts. We first quantify the performance shifts from 2020 to 2021 of popular ML APIs from Google, Microsoft, Amazon, and others on a variety of datasets. We identified significant model shifts in 12 out of 36 cases we investigated. Interestingly, we found several datasets where the API's predictions became significantly worse over time. This motivated us to formulate the API shift assessment problem at a more fine-grained level as estimating how the API model's confusion matrix changes over time when the data distribution is constant. Monitoring confusion matrix shifts using standard random sampling can require a large number of samples, which is expensive as each API call costs a fee. We propose a principled adaptive sampling algorithm, MASA, to efficiently estimate confusion matrix shifts. MASA can accurately estimate the confusion matrix shifts in commercial ML APIs using up to 90% fewer samples compared to random sampling. This work establishes ML API shifts as an important problem to study and provides a cost-effective approach to monitor such shifts.

연구 동기 및 목표

  • 시간이 지남에 따라 외부 ML API에서 발생하는 심각한 성능 저하를 식별하고 정량화하는 것. 이러한 변화는 종종 하류 애플리케이션에 영향을 주지만, 인식되지 않는 경우가 많다.
  • 표준 랜덤 샘플링을 통한 ML API 성능 모니터링의 높은 비용 문제를 해결하는 것. 이는 수많은 비용이 드는 API 호출을 수반한다.
  • 높은 추정 정확도를 유지하면서도 계산 및 재정적 비용을 극도로 줄이는 경량의 적응형 샘플링 전략을 개발하는 것.
  • 생산 팀이 정밀도를 희생시키지 않고도 실세계 ML API에서의 모델 드리프트를 실시간으로 모니터링할 수 있는 실용적이고 비용 효율적인 솔루션을 제공하는 것.
  • 고정된 샘플 예산 하에 API 성능 변화 탐지를 혼동 행렬 변화 추정 문제로 체계화하는 것.

제안 방법

  • MA-SAM은 혼동 행렬 변화 추정에 가장 유용한 정보를 가진 데이터 포인트를 우선적으로 샘플링하기 위해 적응형 샘플링을 사용한다. 특히 예측의 불확실성 또는 영향력이 큰 예측에 집중한다.
  • 데이터셋을 클러스터링하고, 모델의 예측 불확실성에 기반해 각 클러스터에서 적응형으로 샘플을 추출함으로써 변화 추정의 분산을 줄인다.
  • 정확도와 비용의 균형을 맞추기 위해 신뢰구간 접근법을 사용해 클러스터별로 자동으로 샘플링 비율을 조정한다.
  • 변화가 발생할 가능성이 가장 높은 고불확실성 영역에 대해 슈퍼 샘플링 전략을 적용해 추정 정밀도를 향상시킨다.
  • 샘플 크기 제약 조건 하에서도 안정적인 성능을 확보하기 위해 추정 오차의 이론적 상한선을 활용한다.
  • 이 방법은 경량이며 실세계 ML API와 호환되도록 설계되어 있으며, 기존 모니터링 파이프라인에 최소한의 변경만 필요로 한다.

실험 결과

연구 질문

  • RQ1ML API는 시간이 지남에 따라 얼마나 자주 심각한 성능 저하를 겪으며, 이러한 변화는 하류 애플리케이션에 어떤 영향을 미치는가?
  • RQ2표준 균일 샘플링을 사용해 모델 드리프트를 모니터링할 경우 비용은 얼마나 되며, 정확도를 희생시키지 않고 이를 줄일 수 있는가?
  • RQ3적응형 샘플링 전략이 더 적은 API 호출 수로 혼동 행렬 변화를 추정하는 데 균일 샘플링을 능가할 수 있는가?
  • RQ4동일한 샘플 예산 하에서 적응형 샘플링의 추정 오차는 균일 샘플링과 비교해 어떻게 되는가?
  • RQ5적응형 샘플링을 통해 필요한 API 호출 수를 얼마나 줄일 수 있으며, 이로 인해 모델 드리프트 탐지에 대해 수용 가능한 추정 오차를 유지할 수 있는가?

주요 결과

  • 2020년에서 2021년 사이에 36개의 ML API 및 데이터셋 조합 중 12개에서 심각한 모델 변화를 확인했으며, 몇몇 사례에서는 성능 저하가 1%를 초과했다.
  • 한 사례에서 IBM의 음성 인식 API는 2020년 3월에서 2021년 3월 사이에 총 정확도가 7% 감소했으며, 주로 'four'를 'five'로 잘못 분류한 데 기인했다.
  • MA-SAM은 균일 샘플링 대비 최대 90%까지 API 호출 수를 줄였으며, 추정 오차는 균일 샘플링 대비 한 계급 수준 낮춘 결과를 얻었다.
  • 평균적으로 MA-SAM은 동일한 샘플 크기에서 균일 샘플링 대비 추정 오차를 1~2 계급 수준 낮추었다.
  • 주어진 예산 하에서 MA-SAM은 Google, Microsoft, Amazon 등의 실세계 API를 포함한 대부분의 API에서 추정 오차를 50% 이상 줄였다.
  • 이 방법은 높은 신뢰성과 낮은 계산 비용을 유지하여, 생산 환경에서의 지속적 모니터링에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.