[논문 리뷰] Exploiting random projections and sparsity with random forests and gradient boosting methods -- Application to multi-label and multi-output learning, random forest model compression and leveraging input sparsity
이 학위논문은 다중출력/다중라벨 학습, 모델 압축, 희소 입력 처리를 위한 랜덤 포레스트와 그래디언트 부스팅의 새로운 방법을 제안한다. 출력 공간의 차원 감소를 위해 랜덤 프로젝션을 활용하고, 희소성에 민감한 알고리즘을 적용함으로써, 생물학, 텍스트, 이미지, 영상 분야의 다양한 데이터셋에서 정확도를 유지하거나 향상시키면서도 계산 비용과 메모리 사용량을 감소시킨다.
Within machine learning, the supervised learning field aims at modeling the input-output relationship of a system, from past observations of its behavior. Decision trees characterize the input-output relationship through a series of nested $if-then-else$ questions, the testing nodes, leading to a set of predictions, the leaf nodes. Several of such trees are often combined together for state-of-the-art performance: random forest ensembles average the predictions of randomized decision trees trained independently in parallel, while tree boosting ensembles train decision trees sequentially to refine the predictions made by the previous ones. The emergence of new applications requires scalable supervised learning algorithms in terms of computational power and memory space with respect to the number of inputs, outputs, and observations without sacrificing accuracy. In this thesis, we identify three main areas where decision tree methods could be improved for which we provide and evaluate original algorithmic solutions: (i) learning over high dimensional output spaces, (ii) learning with large sample datasets and stringent memory constraints at prediction time and (iii) learning over high dimensional sparse input spaces.
연구 동기 및 목표
- 현대 기계학습 응용 분야에서 흔히 발생하는 고차원 출력 공간에서의 결정식 트리 앙상블의 확장성 문제 해결.
- 예측 시점의 메모리 제약 조건이 엄격한 상황에서 랜덤 포레스트 모델의 메모리 및 계산 비용을 감소시키기.
- 텍스트 및 자연어 처리 작업에서 흔한 고차원 희소 입력 데이터에서 결합된 결정식 트리 방법의 효율성과 정확도 향상.
- 랜덤 프로젝션 기반 차원 감소를 통해 출력 상관관계를 포착함으로써 효과적인 다중출력 학습을 가능하게 하기.
- 예측 성능을 훼손하지 않으면서도 큰 랜덤 포레스트 앙상블을 원칙적이고 정규화된 방법으로 압축하는 것.
제안 방법
- 다중라벨 및 다중출력 작업에서 출력 공간의 차원을 감소시키기 위해 랜덤 프로젝션을 적용하여 랜덤 포레스트의 학습 속도를 향상시킨다.
- 모든 출력에 대한 공동 최적화 목표를 설정하고, 출력 상관관계의 다양성에 대응하기 위해 랜덤 프로젝션을 통한 변환을 수행함으로써 그래디언트 부스팅을 다중출력 학습에 확장한다.
- 노드 지시 함수에 대한 ℓ₁-정규화를 통해 랜덤 포레스트 앙상블을 압축하여 가장 관련성이 높은 트리와 노드만 선택한다.
- 입력의 희소성을 활용하기 위해 압축 희소 행렬(CSR) 형식과 최적화된 분할 평가 루틴을 사용하는 희소성에 적합한 결정식 트리 알고리즘을 설계한다.
- 학습 및 예측 단계에 모두 희소성에 적합한 계산을 통합하여 메모리 사용량을 줄이고 희소 입력 처리 속도를 가속화한다.
- 랜덤 프로젝션을 통한 저랭크 근사화를 허용하면서도 출력 간 상관관계를 유지하는 공동 최적화 프레임워크를 그래디언트 부스팅에 도입한다.
실험 결과
연구 질문
- RQ1출력 공간의 랜덤 프로젝션은 정확도를 저하시키지 않고 다중출력 학습에서 랜덤 포레스트의 효율성을 향상시킬 수 있는가?
- RQ2출력 상관관계의 다양성에 대응할 수 있도록 다중출력 회귀 및 다중라벨 분류에 대해 그래디언트 부스팅을 효과적으로 확장할 수 있는가?
- RQ3노드 지시 함수에 대한 ℓ₁-정규화를 통해 큰 랜덤 포레스트 앙상블을 얼마나 압축할 수 있으며, 이로 인해 예측 성능이 얼마나 유지되는가?
- RQ4입력 희소성의 알고리즘적 이용이 정확도를 변화시키지 않으면서도 결정식 트리 방법의 학습 및 추론 시간을 크게 줄일 수 있는가?
- RQ5랜덤 프로젝션과 희소성에 적합한 처리를 조합했을 때, 고차원 환경에서 트리 기반 모델의 전체 확장성에 어떤 영향을 미치는가?
주요 결과
- 출력 공간의 랜덤 프로젝션은 다중출력 작업에서 랜덤 포레스트의 학습 시간을 최대 50% 감소시키며, 유리한 편향-분산 트레이드오프 덕분에 정확도를 유지하거나 약간 향상시킨다.
- 제안된 다중출력 학습을 위한 그래디언트 부스팅 확장 방법은 다양한 데이터셋에서 경쟁 가능한 성능을 달성했으며, 랜덤 프로젝션을 통해 출력 상관관계 구조에 자동으로 적응할 수 있다.
- 노드 지시 함수에 대한 ℓ₁-정규화를 통한 모델 압축으로 인해 랜덤 포레스트 앙상블 크기가 최대 70% 감소했고, 정확도 손실는 최소한이었으며, 이는 엄격한 메모리 제약 조건 하에서도 적용 가능하게 했다.
- 희소성에 적합한 결정식 트리 구현은 합성 및 실제 희소 데이터셋(예: 텍스트 및 이미지 데이터)에서 밀집 구현 대비 최대 4배의 속도 향상을 달성했으며, 동일한 모델 성능을 유지했다.
- 랜덤 프로젝션과 희소성에 적합한 처리의 조합은 모든 평가된 데이터셋, 특히 EUR-Lex(3993개 레이블)와 같은 고차원 데이터셋에서 메모리 사용량과 학습 시간을 크게 감소시켰다.
- MEDLINE 및 Bibtex 데이터셋에서 제안된 방법은 특히 고출력 및 고희소 입력 환경에서 표준 기준 대비 F1-macro 및 해밍 손실 측면에서 뛰어난 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.