Skip to main content
QUICK REVIEW

[논문 리뷰] Training Logistic Regression and SVM on 200GB Data Using b-Bit Minwise Hashing and Comparisons with Vowpal Wabbit (VW)

Ping Li, Anshumali Shrivastava|arXiv (Cornell University)|2011. 08. 15.
Face and Expression Recognition참고 문헌 31인용 수 3
한 줄 요약

이 논문은 대규모 데이터셋에서 로지스틱 회귀 및 SVM을 훈련시키는 데 매우 효율적인 방법으로 b비트 미니웨이즈 해싱을 제안하며, 저장 비용을 크게 낮추면서도 Vowpal Wabbit(VW) 해싱보다 뛰어난 정확도를 달성함을 입증한다. 200GB 확장된 rcv1 데이터셋을 사용하여 저자가 보여준 lin은, b비트 해싱을 사용할 경우 예측값 30개만으로도 VW가 16,384개의 값을 사용할 때와 동일한 성능을 달성하며, 사전 처리 비용은 관리 가능하고 GPU 가속이 가능하다.

ABSTRACT

We generated a dataset of 200 GB with 10^9 features, to test our recent b-bit minwise hashing algorithms for training very large-scale logistic regression and SVM. The results confirm our prior work that, compared with the VW hashing algorithm (which has the same variance as random projections), b-bit minwise hashing is substantially more accurate at the same storage. For example, with merely 30 hashed values per data point, b-bit minwise hashing can achieve similar accuracies as VW with 2^14 hashed values per data point. We demonstrate that the preprocessing cost of b-bit minwise hashing is roughly on the same order of magnitude as the data loading time. Furthermore, by using a GPU, the preprocessing cost can be reduced to a small fraction of the data loading time. Minwise hashing has been widely used in industry, at least in the context of search. One reason for its popularity is that one can efficiently simulate permutations by (e.g.,) universal hashing. In other words, there is no need to store the permutation matrix. In this paper, we empirically verify this practice, by demonstrating that even using the simplest 2-universal hashing does not degrade the learning performance.

연구 동기 및 목표

  • 대규모 데이터셋(200GB 확장된 rcv1)에서 b비트 미니웨이즈 해싱을 평가하여 실제 기계학습 시나리오에서의 성능을 분석하는 것.
  • b비트 미니웨이즈 해싱을 Vowpal Wabbit(VW) 해싱과 직접 비교하여 테스트 정확도 및 저장 효율성 측면에서 성능을 평가하는 것.
  • 2-유니버설 해싱을 사용하는 것이 미니웨이즈 해싱에서 전체 순열을 저장하는 것과 비교해 실용적이고 효과적인 대안이 되는지 검증하는 것.
  • b비트 미니웨이즈 해싱의 사전 처리 비용이 실제로 무시할 만큼 작으며, 다수의 훈련 런에 걸쳐 분산될 경우 더욱 그렇다는 것을 보여주는 것.
  • LIBLINEAR와 해싱된 데이터를 사용하여 재현 가능한 실험 설정을 제공함으로써 다른 연구자들이 쉽게 검증할 수 있도록 하는 것.

제안 방법

  • 저자는 rcv1 데이터셋을 확장하여 원본 특징, 모든 쌍별 조합, 그리고 3개 조합의 1/30을 포함시켜 LibSVM 형식의 200GB 데이터셋을 생성하였다.
  • 2-유니버설 해싱 함수를 사용하여 b비트 미니웨이즈 해싱을 적용하여 순열을 시뮬레이션하고, 전체 순열 매핑을 저장할 필요 없이 대체하였다.
  • 해싱 과정은 선형 동치 함수를 사용하여 각 비영 특징 인덱스를 새로운 위치로 매핑한다: $ h_j(t) = \{c_{1,j} + c_{2,j} \cdot t\ \text{mod}\ p\}\ \text{mod}\ D $, 여기서 $ p > D $ 는 소수이다.
  • 각 데이터 포인트에 대해 $ k $개의 순열에 걸쳐 최소 해싱 값을 기록하여 압축된 $ k $-차원 표현을 형성한다.
  • 해당 해싱된 데이터는 대규모 선형 모델을 위한 널리 사용되는 솔버인 LIBLINEAR를 사용하여 로지스틱 회귀 및 SVM 모델을 훈련하는 데 사용되었다.
  • 성능 평가는 테스트 정확도를 기준으로 하였으며, b비트 미니웨이즈 해싱과 VW 해싱 간에 다양한 수의 해싱 값($ k $)을 비교하였다.

실험 결과

연구 질문

  • RQ1b비트 미니웨이즈 해싱이 훨씬 적은 수의 해싱 값으로도 Vowpal Wabbit 해싱과 동일하거나 더 높은 테스트 정확도를 달성할 수 있는가?
  • RQ2완벽한 순열 대신 2-유니버설 해싱을 사용할 경우 b비트 미니웨이즈 해싱의 학습 성능에 어떤 영향을 미치는가?
  • RQ3대규모 학습 파이프라인에서 사전 처리 시간과 데이터 로딩 시간은 어떻게 비교되며, 사전 처리가 성능 저하 요인인가?
  • RQ4b비트 미니웨이즈 해싱은 200GB 크기의 데이터셋에서 표준 솔버인 LIBLINEAR와 함께 효과적으로 사용될 수 있는가?
  • RQ5b비트 미니웨이즈 해싱의 일회성 사전 처리 비용은 다수의 훈련 실험 및 하이퍼파라미터 튜닝 작업에서의 재사용성으로 인해 정당화될 수 있는가?

주요 결과

  • 각 데이터 포인트에 대해 단지 30개의 해싱 값만 사용해도 b비트 미니웨이즈 해싱이 VW 해싱이 16,384개의 값을 사용할 때와 동일한 테스트 정확도를 달성하였다.
  • GPU 가속 없이도 b비트 미니웨이즈 해싱의 사전 처리 비용은 200GB 데이터셋의 데이터 로딩 시간과 비슷한 수준이었다.
  • GPU를 사용할 경우 사전 처리 시간은 데이터 로딩 시간의 1/7 이하로 감소하여 부가적인 성능 저하 요인으로서의 영향이 미미해졌다.
  • 2-유니버설 해싱을 사용하더라도 모델 성능이 떨어지지 않았으며, webspam 데이터셋에서 순열과 2-유니버설 해싱 간의 테스트 정확도 곡선이 겹침으로써 이를 입증하였다.
  • 동일한 사전 처리된 데이터는 다수의 훈련 런, 예를 들어 다양한 C 값 또는 데이터 분할을 포함한 교차 검증에서도 재사용 가능하여 전체 계산 비용을 크게 감소시켰다.
  • b비트 미니웨이즈 해싱은 랜덤 프로젝션을 모방하는 VW 해싱보다 분산이 낮다는 이론적 기대에 부합하여 분산 감소 측면에서 VW 해싱을 능가함을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.