Skip to main content
QUICK REVIEW

[논문 리뷰] Machine Unlearning for Random Forests

Jonathan Brophy, Daniel Lowd|arXiv (Cornell University)|2020. 09. 11.
Machine Learning and Data Classification인용 수 6
한 줄 요약

이 논문은 훈련 데이터 샘플을 최소한의 재훈련으로 정확하고 효율적으로 삭제할 수 있도록 하는 랜덤 포레스트의 변종인 DaRE 포레스트를 소개한다. 나무의 상단에서 무작위로 선택된 노드와 탐욕적 노드에서 캐시된 통계를 조합함으로써 DaRE 포레스트는 재훈련보다 최대 10,000배 빠른 데이터 삭제를 달성하면서도 원본 모델과 1% 이내의 예측 성능를 유지한다.

ABSTRACT

Responding to user data deletion requests, removing noisy examples, or deleting corrupted training data are just a few reasons for wanting to delete instances from a machine learning (ML) model. However, efficiently removing this data from an ML model is generally difficult. In this paper, we introduce data removal-enabled (DaRE) forests, a variant of random forests that enables the removal of training data with minimal retraining. Model updates for each DaRE tree in the forest are exact, meaning that removing instances from a DaRE model yields exactly the same model as retraining from scratch on updated data. DaRE trees use randomness and caching to make data deletion efficient. The upper levels of DaRE trees use random nodes, which choose split attributes and thresholds uniformly at random. These nodes rarely require updates because they only minimally depend on the data. At the lower levels, splits are chosen to greedily optimize a split criterion such as Gini index or mutual information. DaRE trees cache statistics at each node and training data at each leaf, so that only the necessary subtrees are updated as data is removed. For numerical attributes, greedy nodes optimize over a random subset of thresholds, so that they can maintain statistics while approximating the optimal threshold. By adjusting the number of thresholds considered for greedy nodes, and the number of random nodes, DaRE trees can trade off between more accurate predictions and more efficient updates. In experiments on 13 real-world datasets and one synthetic dataset, we find DaRE forests delete data orders of magnitude faster than retraining from scratch while sacrificing little to no predictive power.

연구 동기 및 목표

  • 개인정보 보호 규정인 '잊혀질 권리'와 같은 규제 증가에 따라 기계학습 모델에서 효율적인 데이터 삭제가 증가하는 필요성을 해결하기 위해.
  • 완전한 재훈련 없이도 트리 기반 모델, 특히 랜덤 포레스트에서 훈련 샘플을 정확하게 언러닝할 수 있도록 하기 위해.
  • 예측 정확도를 유지하면서도 빠르고 정확한 데이터 제거를 지원하는 모델 아키텍처를 설계하기 위해.
  • 다양한 실세계 데이터셋에서 삭제 효율성과 모델 성능 간의 상호 교환 관계를 평가하기 위해.

제안 방법

  • DaRE 포레스트는 하이브리드 트리 구조를 사용한다: 상위 레벨 노드는 무작위로 선택되며(특성과 임계값이 균일하게 무작위로 선택됨), 훈련 데이터에 대한 의존도를 감소시킨다.
  • 하위 레벨 노드는 탐욕적 방식으로 작동하며, 지니 지수나 엔트로피와 같은 분할 기준을 최적화하기 위해 무작위로 선택된 임계값의 부분집합을 사용하여 통계를 효율적으로 유지한다.
  • 각 노드는 통계 요약 정보(예: 클래스 수, 임계값 통계)를 캐시하여 삭제 시에 필요한 부분 트리만 업데이트할 수 있도록 한다.
  • 데이터 삭제는 영향을 받는 부분 트리만 재귀적으로 업데이트함으로써 수행되며, 이로 인해 최종 모델이 재훈련에서 유도된 것과 수학적으로 동일하게 된다.
  • 무작위 노드의 수와 탐욕적 노드에서 고려하는 임계값의 수는 조정 가능한 하이퍼파라미터이며, 정확도와 업데이트 속도 사이의 트레이드오프를 가능하게 한다.
  • 이 방법은 정확한 언러닝(재훈련과 동일)과 악성 삭제 패턴 조건에서도 효율적인 삭제 시퀀스를 지원한다.

실험 결과

연구 질문

  • RQ1완전한 재훈련 없이도 정확하고 효율적인 훈련 샘플 삭제를 지원하는 랜덤 포레스트 변종을 설계할 수 있는가?
  • RQ2나무 상단에 무작위 노드를 배치하는 것이 삭제 효율성과 모델 정확도에 어떤 영향을 미치는가?
  • RQ3탐욕적 노드에서 고려하는 임계값의 수를 변화시켰을 때 삭제 속도와 예측 성능에 어떤 영향을 미치는가?
  • RQ4특히 속도와 정확도 유지 측면에서 악성 삭제 시퀀스 조건 하에서 모델의 성능은 어떠한가?
  • RQ5제안된 방법은 대규모 실세계 데이터셋에 대해 높은 삭제 효율성과 낮은 성능 저하를 유지하면서도 확장 가능한가?

주요 결과

  • DaRE 포레스트는 실세계 데이터셋에서 기계적 재훈련 대비 최대 10,000배 빠른 데이터 삭제 속도를 달성했으며, 중앙값 기준 속도 향상은 1,000배를 초과했다.
  • 13개의 실세계 데이터셋과 하나의 합성 데이터셋에서 모두 삭제 후 DaRE 포레스트는 원본 모델과 1% 이내의 예측 성능를 유지했다.
  • 나무 상단에 무작위 노드를 사용함으로써 재훈련 작업 수가 최대 90% 감소하여 삭제 효율성이 크게 향상되었다.
  • 악성 삭제 패턴 조건에서도 모델은 강인했으며, 최악의 경우에도 재훈련 대비 100배 이상의 속도 향상이 유지되었다.
  • 탐욕적 노드에서 고려하는 임계값의 수와 무작위 노드의 깊이를 조정함으로써 정확도와 삭제 속도 사이의 효과적인 트레이드오프를 달성할 수 있었으며, 성능 저하가 최소한이었다.
  • 매우 장시간 훈련이 필요한 Higgs 데이터셋의 경우, DaRE 포레스트는 삭제 시간을 5,000초 이상에서 10초 이내로 단축시켰고, 정확도 저하도 거의 없었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.