Skip to main content
QUICK REVIEW

[논문 리뷰] A Critical Evaluation of Open-World Machine Learning

Liwei Song, Vikash Sehwag|arXiv (Cornell University)|2020. 07. 08.
Adversarial Robustness in Machine Learning참고 문헌 15인용 수 8
한 줄 요약

이 논문은 다양한 조건, 특히 손상된 및 악성 OOD 입력에서 작동하는 최첨단 OOD 검출기 여섯 종류의 내구성 테스트를 통해 개방형 기계학습 시스템을 철저히 평가한다. 실험 결과, 검출기 성능이 심각하게 저하됨을 확인하였으며, 거짓 양성률이 70%를 초과하고 악성 편향 조건에서는 100%에 이를 정도로 악화됨을 보여주었다. 또한, 강건성 향상을 위한 악성 훈련은 OOD 검출 능력을 떨어뜨리며, 강건성과 이상 탐지 능력 사이에 새로운 상충관계를 드러냈다.

ABSTRACT

Open-world machine learning (ML) combines closed-world models trained on in-distribution data with out-of-distribution (OOD) detectors, which aim to detect and reject OOD inputs. Previous works on open-world ML systems usually fail to test their reliability under diverse, and possibly adversarial conditions. Therefore, in this paper, we seek to understand how resilient are state-of-the-art open-world ML systems to changes in system components? With our evaluation across 6 OOD detectors, we find that the choice of in-distribution data, model architecture and OOD data have a strong impact on OOD detection performance, inducing false positive rates in excess of $70\%$. We further show that OOD inputs with 22 unintentional corruptions or adversarial perturbations render open-world ML systems unusable with false positive rates of up to $100\%$. To increase the resilience of open-world ML, we combine robust classifiers with OOD detection techniques and uncover a new trade-off between OOD detection and robustness.

연구 동기 및 목표

  • 손상되거나 악성으로 훼손된 OOD 데이터가 존재하는 비이상적인 조건에서 개방형 기계학습 시스템의 신뢰성과 내구성을 평가하기 위해.
  • 내분포 데이터, 모델 아키텍처, OOD 데이터의 변화가 OOD 검출 성능에 미치는 영향을 조사하기 위해.
  • 악성 훈련이 강건성을 향상시키면서도 OOD 검출 능력을 유지하는지 효과적으로 평가하기 위해.
  • 악성 훈련과 OOD 검출을 병행할 경우 발생하는 새로운 강건성과 OOD 검출 능력 사이의 상충관계를 드러내고 분석하기 위해.

제안 방법

  • 통합 실험 환경에서 최첨단 OOD 검출기 여섯 종류—ODIN, Network Agnostophobia, Mahalanobis Detector, Autoencoder Detector, Deep-SVDD, Outlier Exposure—를 평가한다.
  • CIFAR-10, SVHN 등의 내분포 데이터, ImageNet, MNIST, CIFAR-100 등의 OOD 데이터, WRN-28-10, ResNet-28-10 등의 모델 아키텍처를 다양하게 조합하여 민감도를 평가한다.
  • PGD 공격를 변형하여 OOD 검출을 회피할 수 있도록 하되, 여전히 OOD인 입력을 생성하는 OOD 악성 예제를 도입하고 적용한다.
  • L∞=8로 설정된 PGD를 사용해 분류기를 강건하게 만들고, OOD 검출 성능에 미치는 영향을 평가한다.
  • t-SNE 시각화를 통해 자연적 훈련과 악성 훈련을 한 모델의 특징 표현을 비교하여 클래스 간 분리도가 감소하는지 분석한다.
  • 검출기 실패와 공격 성공도를 정량화하기 위해 FPR(거짓 양성률)과 OW-TSR(OOD-World 진짜 비율)를 핵심 지표로 사용한다.

실험 결과

연구 질문

  • RQ1내분포 데이터, OOD 데이터, 모델 아키텍처의 변화가 OOD 검출 성능에 어떤 영향을 미치는가?
  • RQ2데이터 손상과 악성 편향 조건이 OOD 검출기의 신뢰성에 어떤 영향을 미치는가?
  • RQ3악성 훈련이 OOD 검출 성능을 떨어뜨리지 않고 개방형 기계학습 시스템의 강건성을 향상시킬 수 있는가?
  • RQ4OOD 악성 예제는 개방형 기계학습 시스템의 무결성을 어느 정도까지 침해하는가?
  • RQ5악성 훈련과 OOD 검출을 병행할 경우 강건성과 OOD 검출 능력 사이에 본질적인 상충관계가 존재하는가?

주요 결과

  • 내분포 데이터, OOD 데이터, 모델 아키텍처의 선택이 OOD 검출 성능에 크게 영향을 미치며, 일부 설정에서는 거짓 양성률이 70%를 초과한다.
  • 22종의 다양한 손상 유형을 가진 OOD 입력은 거짓 양성률을 최대 100%까지 끌어올려 시스템을 사용 불가능하게 만들며, 이는 심각한 문제이다.
  • OOD 악성 예제는 거의 100% 성공률로 검출을 회피하며, 대부분의 검출기에서 FPR과 OW-TSR 모두 100%에 수렴한다.
  • 악성 훈련은 특징의 분류 능력을 저하시켜, 일반적인 OOD 데이터에 대한 OOD 검출 성능에 심각한 하락을 초래한다.
  • 강건성 향상을 위한 악성 훈련과 OOD 검출 능력 사이에 새로운 상충관계가 발생한다: 강건성은 향상되지만 OOD 검출 능력은 떨어진다.
  • t-SNE 시각화 결과, 악성 훈련을 한 모델은 내분포와 OOD 특징 간의 명확한 분리를 상실함을 확인하였으며, 이는 검출 성능 저하의 이유를 설명한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.