Skip to main content
QUICK REVIEW

[논문 리뷰] A Distributed Algorithm for Training Nonlinear Kernel Machines

Dhruv Mahajan, S. Sathiya Keerthi|arXiv (Cornell University)|2014. 05. 18.
Neural Networks and Applications참고 문헌 27인용 수 4
한 줄 요약

이 논문은 비선형 커널 머신을 훈련하기 위한 분산 알고리즘을 제안한다. 재구성된 노이스트롬 근사법을 사용하여 커널 행렬의 의사역행렬을 계산하지 않도록 한다. Hadoop에서 AllReduce 기반 통신을 활용한 기울기 기반 최적화를 통해 효율적이고 확장 가능한 훈련을 달성하였으며, 200개의 노드를 사용하여 MNIST8m에서 P-packsvm보다 빠른 8779초(12880초 대비)의 훈련 시간과 더 높은 정확도를 기록하였다.

ABSTRACT

This paper concerns the distributed training of nonlinear kernel machines on Map-Reduce. We show that a re-formulation of Nyström approximation based solution which is solved using gradient based techniques is well suited for this, especially when it is necessary to work with a large number of basis points. The main advantages of this approach are: avoidance of computing the pseudo-inverse of the kernel sub-matrix corresponding to the basis points; simplicity and efficiency of the distributed part of the computations; and, friendliness to stage-wise addition of basis points. We implement the method using an AllReduce tree on Hadoop and demonstrate its value on a few large benchmark datasets.

연구 동기 및 목표

  • Map-Reduce 환경을 활용한 일반적인 클러스터에서 비선형 커널 머신의 확장성 있고 효율적인 분산 훈련을 가능하게 하기 위해.
  • 대규모 커널 방법에서 정확한 커널 행렬 계산의 높은 계산 및 저장 비용 문제를 해결하기 위해.
  • 비용이 많이 드는 의사역행렬 계산을 피하고 기저 점의 점진적 추가를 지원하는 방법을 개발하기 위해.
  • Hadoop의 AllReduce와 호환되는 통신 효율적인 반복 최적화 프레임워크를 설계하기 위해.
  • 기존의 병렬 솔버(P-packsvm 등)와 비교해 벤치마크 데이터셋에서 뛰어난 성능을 보여주기 위해.

제안 방법

  • 기저 커널 행렬의 의사역행렬 계산을 피하기 위해 커널 머신을 위한 재구성된 노이스트롬 근사법을 제안한다.
  • 함수, 기울기, 헤시안을 분산 행렬-벡터 곱으로 계산하는 기울기 기반 최적화(예: L-BFGS)를 사용하여 모델을 훈련한다.
  • 반복 과정에서 통신 오버헤드를 최소화하기 위해 Hadoop에서 AllReduce 트리를 사용하여 최적화를 구현한다.
  • 기저 점의 수가 적을 경우 분산 K-평균 클러스터링을, 그렇지 않을 경우 무작위 샘플링을 사용하여 기저 점을 선정한다.
  • 단계별로 기저 점을 추가할 수 있도록 최적화를 구조화하여, 전체 재학습 없이도 점진적인 모델 개선을 가능하게 한다.
  • 최적화를 통계적 질의 모델에 매핑하여 반복적 Map-Reduce 프레임워크와의 호환성을 확보한다.

실험 결과

연구 질문

  • RQ1재구성된 노이스트롬 근사법은 분산 환경에서 비선형 커널 머신의 효율적이고 확장 가능한 훈련을 가능하게 할 수 있는가?
  • RQ2기저 점을 사용한 커널 머신 훈련에서 의사역행렬 연산의 계산 비용을 어떻게 피할 수 있는가?
  • RQ3AllReduce 기반 통신을 사용한 기울기 기반 최적화는 대규모 데이터셋에서 기존 반복 솔버보다 더 뛰어난 성능을 낼 수 있는가?
  • RQ4제안된 방법은 대규모 데이터셋에서 훈련 시간과 테스트 정확도 측면에서 P-packsvm과 비교해 어떻게 성능을 내는가?
  • RQ5기본 점을 다시 학습 없이 단계별로 적응적으로 추가할 수 있는 정도는 어느 정도인가?

주요 결과

  • 제안된 방법은 200개의 노드를 사용하여 800만 개의 예제를 가진 MNIST8m 데이터셋에서 테스트 정확도 0.9963을 달성하였으며, 정확도와 속도 모두 P-packsvm을 뛰어넘었다.
  • Hadoop에서 AllReduce를 사용한 훈련 시간은 8779초로, 512개의 노드를 사용한 MPI 클러스터에서 P-packsvm이 사용한 12880초보다 빠르게 감소하였다.
  • 기타 저랭크 커널 근사 방법에서 요구하는 계산 비용이 큰 SVD 연산을 피함으로써, 대규모 문제에 대해 더 확장 가능해졌다.
  • AllReduce 기반 구현은 반복 최적화에서 지연을 최소화하기 위해 오직 행렬-벡터 곱만을 사용하여 효율적인 통신을 가능하게 하였다.
  • 기본 점의 점진적 추가를 지원하여, 전체 재학습 없이도 효율적인 모델 적응이 가능해졌다.
  • 총 훈련 시간에서 거의 선형적인 속도 향상을 보이며, 효과적인 로드 밸런싱과 낮은 통신 병목 현상을 시사하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.