Skip to main content
QUICK REVIEW

[논문 리뷰] Nearest Neighbor Classifiers over Incomplete Information: From Certain Answers to Certain Predictions

Bojan Karlaš, Peng Li|arXiv (Cornell University)|2020. 05. 11.
Data Quality and Management참고 문헌 22인용 수 7
한 줄 요약

이 논문은 근접 이웃 분류기의 경우에 데이터의 부족함이 기계 학습 모델에 미치는 영향을 평가하기 위해 '확실한 예측'(Certain Predictions, CP)을 도입한다. 모든 가능한 데이터 보정에 걸쳐 예측이 보장되는 경우를 형식화함으로써, 저자들은 CP 상태를 확인하고 지지하는 분류기 수를 세는 효율적인 알고리즘을 개발하여, 최소한의 수동 노력으로 모델 정확도를 크게 향상시킬 수 있는 데이터 정제 프레임워크(CPClean)를 구현한다.

ABSTRACT

Machine learning (ML) applications have been thriving recently, largely attributed to the increasing availability of data. However, inconsistency and incomplete information are ubiquitous in real-world datasets, and their impact on ML applications remains elusive. In this paper, we present a formal study of this impact by extending the notion of Certain Answers for Codd tables, which has been explored by the database research community for decades, into the field of machine learning. Specifically, we focus on classification problems and propose the notion of "Certain Predictions" (CP) -- a test data example can be certainly predicted (CP'ed) if all possible classifiers trained on top of all possible worlds induced by the incompleteness of data would yield the same prediction. We study two fundamental CP queries: (Q1) checking query that determines whether a data example can be CP'ed; and (Q2) counting query that computes the number of classifiers that support a particular prediction (i.e., label). Given that general solutions to CP queries are, not surprisingly, hard without assumption over the type of classifier, we further present a case study in the context of nearest neighbor (NN) classifiers, where efficient solutions to CP queries can be developed -- we show that it is possible to answer both queries in linear or polynomial time over exponentially many possible worlds. We demonstrate one example use case of CP in the important application of "data cleaning for machine learning (DC for ML)." We show that our proposed CPClean approach built based on CP can often significantly outperform existing techniques in terms of classification accuracy with mild manual cleaning effort.

연구 동기 및 목표

  • 부분적인 데이터가 기계 학습 예측에 미치는 영향을 '확실한 예측'(CP) 개념을 통해 형식화하는 것.
  • 두 가지 핵심 질의인 CP 확인 및 부분적인 데이터 세계에서의 예측 수 계산에 대해 효율적인 알고리즘을 개발하는 것.
  • 기계 학습을 위한 데이터 정제(DC for ML)에 CP를 적용하여 수동 노력은 줄이고 모델 정확도는 높이는 것.
  • CP 기반 정제가 기존 방법보다 정확도와 효율성 측면에서 뛰어나다는 것을 입증하는 것.

제안 방법

  • Codd 테이블의 '확실한 답변' 개념을 기계 학습으로 확장하여, 모든 가능한 데이터 보정에 걸쳐 일관되게 유지되는 예측을 '확실한 예측'(CP)으로 정의한다.
  • 두 가지 기본 질의를 제안한다: (Q1) CP 확인 — 테스트 예제가 모든 가능한 데이터 보정에 걸쳐 예측적으로 확실한지 여부를 판단하는 것; (Q2) 수세기 — 각 레이블을 지지하는 분류기의 수를 계산하는 것.
  • 기하학적 및 조합적 성질을 활용하여, 지수적으로 큰 가능한 세계에서 근접 이웃 분류기의 선형 및 다항 시간 알고리즘을 개발한다.
  • CP를 기반으로 한 새로운 데이터 정제 프레임워크인 CPClean을 설계하여, 검증 세트에서의 확실성에 가장 큰 영향을 미치는 훈련 예제를 우선순위로 정리한다.
  • 검증 세트를 사용하여, 정제 시 가장 많은 검증 인스턴스를 CP 상태로 만드는 예제를 식별함으로써 필요한 정제 노력의 최소화를 도모한다.
  • 사람이 참여하는 오라클을 활용하여 수리 결과를 검증하고 적용하며, CP 분석을 통해 각 정제 단계에서 정확도 향상을 최대화한다.

실험 결과

연구 질문

  • RQ1데이터의 부족함에도 불구하고 기계 학습 예측이 보장되는 경우를 공식적으로 정의할 수 있는가?
  • RQ2모든 가능한 데이터 보정에 걸쳐 테스트 예제가 예측적으로 확실한지(즉, CP 상태인지) 효율적으로 확인할 수 있는가?
  • RQ3불확실한 예제의 각 예측 레이블을 지지하는 가능한 분류기의 수를 효율적으로 세는 것이 가능한가?
  • RQ4CP 기반 데이터 정제가 정확도와 노력 측면에서 무작위 또는 히ュ리스틱 기반 정제 전략보다 뛰어나게 성능을 발휘할 수 있는가?

주요 결과

  • Supreme 데이터셋에서 CPClean은 전체 검증 예제를 CP 상태로 만들기 위해 훈련 예제의 약 15%만 정제하면 되지만, RandomClean은 거의 모든 예제가 필요하다.
  • Bank 데이터셋에서 50%의 데이터를 정제했을 때 CPClean은 정확도 격차의 거의 100%를 메우지만, RandomClean은 약 65%만 메운다.
  • 검증 세트의 크기는 정제 효율성과 정확도 격차 메우기 능력에 영향을 미치지만, 1,000개의 검증 세트로도 안정적인 성능을 달성하는 데 충분하다.
  • 제안된 CP 프레임워크는 지수적으로 많은 가능한 세계에서 근접 이웃 분류기의 부분 데이터 영향을 효율적이고 확장 가능하게 분석할 수 있게 하며, 다항 시간 해법을 제공한다.
  • 동일한 수리 공간에서 BoostClean과 ActiveClean에 비해 CP 기반 정제 접근법이 정확도 향상 측면에서 뛰어나며, 더 적은 수동 노력으로도 뛰어난 성능을 발휘한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.