[논문 리뷰] Exact Distributed Training: Random Forest with Billions of Examples
이 논문은 약 180억 개의 예제를 가진 데이터셋에서 근사 없이 정확한 랜덤 포레스트 학습을 위한 분산 알고리즘 DRF를 제안한다. 깊이 수준 기반의 워커 기반 아키텍처를 사용하여 메모리, 디스크, 네트워크 오버헤드를 최소화한다. 이 알고리즘은 최신 기술 수준의 확장성을 달성하며, 173억 개의 예제로 구성된 트리를 22시간 내에 학습시켰고, 이는 10억 개 예제 수준을 초월한 대규모 데이터셋에서도 모델 성능이 계속 향상됨을 보여준다.
We introduce an exact distributed algorithm to train Random Forest models as well as other decision forest models without relying on approximating best split search. We explain the proposed algorithm and compare it to related approaches for various complexity measures (time, ram, disk, and network complexity analysis). We report its running performances on artificial and real-world datasets of up to 18 billions examples. This figure is several orders of magnitude larger than datasets tackled in the existing literature. Finally, we empirically show that Random Forest benefits from being trained on more data, even in the case of already gigantic datasets. Given a dataset with 17.3B examples with 82 features (3 numerical, other categorical with high arity), our implementation trains a tree in 22h.
연구 동기 및 목표
- 분할 선택 시 근사 없이 정확한 랜덤 포레스트 학습을 위한 분산 알고리즘 개발
- 기존 정확한 및 근사 방법을 초월해 100억 개 이상의 예제를 가진 데이터셋으로 랜덤 포레스트 학습을 확장
- 분산 학습 중 RAM, 디스크 I/O, 네트워크 트래픽, CPU 사용량 측면에서 계산 복잡도 최소화
- 랜덤 포레스트가 100억 개 수준의 데이터에서조차 더 많은 데이터를 통해 성능 향상을 얻을 수 있음을 경험적으로 검증
- 분산 기반의 특성 중요도 계산 및 기울기 부스팅 트리와 같은 공존하는 트리 모델 지원
제안 방법
- 알고리즘은 트리의 각 레벨을 순차적으로 처리하며, 데이터셋의 열을 워커들 간에 분산 배분해 전역 데이터 접근을 방지한다.
- 워커들은 네트워크 통신 없이도 동일한 의사 난수 생성기를 사용해 각 노드 간에 백업 샘플을 동기화한다.
- 각 샘플에 대해 활성 리프 수 ℓ에 비례해 ⌈log₂ℓ⌉ 비트만 사용하는 비트맵 매핑을 통해 샘플에서 리프로의 할당을 추적한다.
- 스플릿 후보는 각각 일부 특성만 처리하는 스플리터 워커들이 병렬로 평가하며, 트리 빌더들이 노드 스플릿과 트리 구조를 조율한다.
- 매니저는 트리 빌더들을 조율하고 최종 모델을 집계하여 표준 랜덤 포레스트와 정확히 동일한 결과를 보장한다.
- 대규모 데이터셋의 수치형 특성 처리를 위해 외부 정렬을 사용하며, 데이터는 워커들 간에 분할되어 순차적 접근이 가능하도록 한다.
실험 결과
연구 질문
- RQ1정확한 분산 랜덤 포레스트 알고리즘이 근사 없이 100억 개 이상의 예제를 가진 데이터셋으로 확장 가능한가?
- RQ2더 큰 데이터셋(예: 173억 개 예제)에서 학습하면 더 작은 스케일에서 관찰된 것보다 모델 성능이 향상되는가?
- RQ3메모리, 디스크, 네트워크 복잡도 측면에서 기존 정확한 방법(Sliq, Sprint)과 비교해 제안된 DRF 알고리즘이 어떻게 성능을 냈는가?
- RQ4AUC와 같은 모델 지표가 데이터셋 크기와 트리 깊이가 증가함에 따라 얼마나 더 향상되는가?
- RQ5정확한 프레임워크 내에서 분산 기반의 특성 중요도 계산과 공존하는 트리 학습(예: XGBoost 방식)을 효율적으로 지원할 수 있는가?
주요 결과
- DRF는 82개의 특성(3개의 수치형, 나머지 고차원 범주형)을 가진 173억 개의 예제를 22시간 내에 정확하게 학습시켜 새로운 스케일 기록을 수립했다.
- 173억 개의 전체 데이터셋에서 AUC가 0.847에 도달했으며, 깊이 20에서 성능이 여전히 향상되고 있어 학습 능력에 정체가 없음을 시사한다.
- 깊이 20에서 173억 개 데이터셋의 96.9%가 열린 리프에 남아 있어, 프리닝이 상당한 속도 향상 효과를 줄 수 없음을 보여준다.
- 개별 트리에서 1%의 데이터에 대해 오버피팅은 깊이 13에서 시작되었지만, 100%의 데이터에선 깊이 17에서야 발생하여 대규모 스케일에서 더 깊은 트리가 가능함을 나타낸다.
- 깊이 20에서 노드 밀도(0.415)와 샘플 밀도(0.969)가 유지되어 트리의 구조가 고도의 깊이에서도 효율적이고 데이터 기반임을 보여준다.
- 공간, 디스크, 네트워크 복잡도 측면에서 이전의 정확한 접근법을 능가하며, 분산 기반의 특성 중요도 계산도 지원한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.