Skip to main content
QUICK REVIEW

[논문 리뷰] GLISTER: Generalization based Data Subset Selection for Efficient and Robust Learning

Krishnateja Killamsetty, Durga Sivasubramanian|arXiv (Cornell University)|2020. 12. 19.
Machine Learning and Algorithms인용 수 20
한 줄 요약

GLISTER는 검증 로그우도를 최대화하기 위해 혼합 이산-연속 이중 최적화를 사용하여 데이터 부분집합을 선택하는 효율적이고 강력한 기계학습 프레임워크이다. 이는 데이터 선택과 모델 파라미터를 동시에 최적화하는 반복적 알고리즘인 Glister-Online을 도입하여, 다양한 모델과 데이터셋에서 훈련 효율성, 레이블 노이즈에 대한 강건성, 그리고 활성 학습에서 최신 기술 수준의 성능을 달성한다. 정확도 저하가 최소화되는 조건에서 뛰어난 성능을 발휘한다.

ABSTRACT

Large scale machine learning and deep models are extremely data-hungry. Unfortunately, obtaining large amounts of labeled data is expensive, and training state-of-the-art models (with hyperparameter tuning) requires significant computing resources and time. Secondly, real-world data is noisy and imbalanced. As a result, several recent papers try to make the training process more efficient and robust. However, most existing work either focuses on robustness or efficiency, but not both. In this work, we introduce Glister, a GeneraLIzation based data Subset selecTion for Efficient and Robust learning framework. We formulate Glister as a mixed discrete-continuous bi-level optimization problem to select a subset of the training data, which maximizes the log-likelihood on a held-out validation set. Next, we propose an iterative online algorithm Glister-Online, which performs data selection iteratively along with the parameter updates and can be applied to any loss-based learning algorithm. We then show that for a rich class of loss functions including cross-entropy, hinge-loss, squared-loss, and logistic-loss, the inner discrete data selection is an instance of (weakly) submodular optimization, and we analyze conditions for which Glister-Online reduces the validation loss and converges. Finally, we propose Glister-Active, an extension to batch active learning, and we empirically demonstrate the performance of Glister on a wide range of tasks including, (a) data selection to reduce training time, (b) robust learning under label noise and imbalance settings, and (c) batch-active learning with several deep and shallow models. We show that our framework improves upon state of the art both in efficiency and accuracy (in cases (a) and (c)) and is more efficient compared to other state-of-the-art robust learning algorithms in case (b).

연구 동기 및 목표

  • 대규모 기계학습에서 훈련 시간을 단축하고 레이블 노이즈 및 클래스 불균형에 대한 강건성을 향상시키는 이중 과제를 해결한다.
  • 데이터 효율성과 모델 일반화를 동시에 최적화하는 통합 프레임워크를 개발한다.
  • 레이블링 비용을 줄이고 수렴성을 향상시키기 위해 훈련 중에 반복적으로 데이터 부분집합을 선택할 수 있도록 한다.
  • 선택 과정에서 검증 데이터를 활용하여 분포 이탈 상황에서도 강건성을 확보한다.
  • 효율적인 인간-인간 라벨링을 위한 배치 기반 활성 학습으로 프레임워크를 확장한다.

제안 방법

  • 검증 로그우도를 최대화하기 위해 데이터 부분집합 선택을 혼합 이산-연속 이중 최적화 문제로 공식화한다.
  • 모델 파라미터 갱신과 데이터 부분집합 선택을 번갈아 수행하는 반복적 온라인 알고리즘인 Glister-Online을 제안한다.
  • 일반적인 손실 함수, 즉 교차 엔트로피, 힌지 손실, 제곱 손실에 대해 내부 이산적 데이터 선택 문제의 약한 부분모듈성(weakly submodular)임을 증명한다.
  • 부분모듈성 최적화 이론을 활용해 온건한 조건 하에 이론적 수렴성과 검증 손실 감소를 보장한다.
  • 불확실성과 다양성을 부분모듈성 함수를 통해 통합한 배치 기반 활성 학습을 위한 확장인 Glister-Active를 도입한다.
  • 일반화의 Proxy로 검증 데이터를 활용하여 결정 경계 근처의 샘플을 선택함으로써 강건성을 향상시킨다.

실험 결과

연구 질문

  • RQ1통합 프레임워크가 동시에 훈련 효율성과 레이블 노이즈 및 클래스 불균형에 대한 강건성을 향상시킬 수 있는가?
  • RQ2훈련 중 반복적인 데이터 부분집합 선택이 모델 수렴성과 일반화에 어떤 영향을 미치는가?
  • RQ3결정 경계 근처의 데이터를 선택할 경우 분포 이탈 상황에서 성능 향상 정도는 어느 정도인가?
  • RQ4교차 엔트로피, 힌지 손실, 제곱 손실, 로지스틱 손실 등 광범위한 손실 함수 클래스에 대해 부분모듈성에 기반한 데이터 선택 과정의 이론적 정당성이 있는가?
  • RQ5GLISTER는 데이터 선택, 강건 학습, 활성 학습 분야에서 최신 기술 대비 어떻게 비교되는가?

주요 결과

  • GLISTER-Online은 특히 $ r = 0.03K $ 조건에서 기준 방법 대비 더 빠른 수렴과 낮은 검증 손실을 달성하며 안정성과 효율성을 균형 있게 확보한다.
  • CRAIG, 무작위 선택, KNN-부분모듈성 선택 방법과 비교해 경계 관련 샘플을 더 잘 선택함을 입증했으며, 특히 공변수 이탈 상황에서 뛰어난 성능을 보였다.
  • 합성 데이터셋에서 GLISTER-Online은 결정 경계 근처의 점들을 선택하는 반면, 다른 방법들은 전체 데이터 분포에 걸쳐 대표성 있는 점들을 선택한다.
  • 실제 응용 벤치마크에서 GLISTER는 데이터 선택 및 활성 학습에서 훈련 효율성과 정확도 향상을 이끌었으며, 레이블 노이즈 상황에서도 오차를 감소시켰다.
  • 이론적 분석을 통해 교차 엔트로피, 힌지 손실, 제곱 손실, 로지스틱 손실에 대해 내부 데이터 선택 문제의 약한 부분모듈성이 확인되었다.
  • 실험 결과, GLISTER-Active는 샘플 다양성 향상과 예측 불확실성 처리 능력 향상으로 인해 배치 기반 활성 학습에서 경쟁력 있는 성능을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.