Skip to main content
QUICK REVIEW

[논문 리뷰] Massive-scale Online Feature Selection for Sparse Ultra-high Dimensional Data.

Yue Wu, Steven C. H. Hoi|arXiv (Cornell University)|2014. 09. 27.
Face and Expression Recognition참고 문헌 24인용 수 10
한 줄 요약

이 논문은 초고차원적이고 희박한 데이터에서 높은 정확도와 극도로 빠른 처리 속도를 달성하기 위해 최적화된 계산을 활용하는 이阶 온라인 특성 선택 방법을 제안한다. 단일 머신에서 빌리언 스케일의 특성 데이터셋을 몇 분 내로 처리하며, 속도 면에서 배치 및 온라인 방법을 모두 앞서며 최신 기술 수준의 정확도를 확보한다.

ABSTRACT

Abstract—Feature Selection is an important technique in machine learning and pattern classification, especially for handling high-dimensional data. Most existing studies have been restricted to batch learning, which is often inefficient and poorly scalable when handling big data in real world, especially when data arrives sequentially. Recent years have witnessed some emerging feature selection techniques using online learning. Despite enjoying significant advantages in efficiency and scalability, the existing online feature selection methods are not always accurate enough, and still not sufficiently fast when handling massive-scale data with ultra-high dimensionality. To address the limitations, we propose a novel online feature selection method by exploiting second-order information with optimized implementations, which not only improves the learning efficacy, but also significantly enhances computational efficiency. We conduct extensive experiments for evaluating both learning accuracy and time cost of different algorithms on massive-scale synthetic and real-world datasets, including a dataset with billion-scale features. Our results show that our technique achieves highly competitive accuracy as compared with state-of-the-art batch feature selection methods, but consumes significantly low computational cost that is orders of magnitude lower than both state-of-the-art batch and online feature selection methods. On a billion-scale synthetic dataset (1-billion dimensions, 1-billion nonzero features, and 1-million samples), our algorithm took only eight minutes with a normal single machine. Index Terms—Feature selection, online learning, sparsity, second-order online learning, ultra-high dimensionality F 1

연구 동기 및 목표

  • 초고차원적이고 거대 규모의 데이터에서 기존의 배치 및 온라인 특성 선택 방법의 비효율성과 확장성 한계를 해결하기 위해.
  • 희박한 고차원 데이터셋에서 온라인 특성 선택의 학습 정확도와 계산 효율성을 향상시키기 위해.
  • 최대 빌리언 차원의 특성 공간을 가진 데이터에서 실시간으로 확장 가능한 특성 선택을 가능하게 하기 위해.
  • 희박한 데이터 구조를 고려해 이阶 온라인 학습 기법을 최적화하여 정확도를 유지하면서도 계산 비용을 감소시키기 위해.

제안 방법

  • 이 방법은 손실 곡면의 곡률 정보를 포착하기 위해 이阶 온라인 학습을 활용하여 일阶 방법보다 수렴성과 정확도를 향상시킨다.
  • 희박한 데이터 구조에 맞게 최적화된 구현을 통합하여 메모리 접근과 계산 오버헤드를 줄인다.
  • 특성은 순차적으로 처리되며, 학습 안정성을 향상시키기 위해 헤시안 기반 근사치를 사용해 특성 가중치를 점진적으로 갱신한다.
  • 저장 및 계산을 최소화하기 위해 특성 가중치와 기울기의 압축된 희박한 표현을 유지한다.
  • 데이터 스트림에서의 증분 학습을 지원하여 실제 동적 데이터 환경에 적합하다.
  • 초고차원 문제에서 분산 시스템을 피하고도 단일 머신에서 효율적으로 확장되도록 설계되어 있다.

실험 결과

연구 질문

  • RQ1일阶 온라인 방법과 비교해 이阶 온라인 학습이 초고차원적이고 희박한 데이터에서 특성 선택 정확도를 향상시킬 수 있는가?
  • RQ2최대 10억 개의 특성을 가진 데이터셋을 처리할 때 제안된 방법의 시간 및 메모리 사용량은 어떻게 스케일링되는가?
  • RQ3최신 기술 수준의 배치 방법과 비교해도 정확도를 유지하면서, 최적화된 이阶 온라인 학습이 얼마나 계산 비용을 감소시킬 수 있는가?
  • RQ4극도의 희박성과 고차원성을 가진 실제 및 합성 데이터셋에서 이 방법은 어떤 성능을 보이는가?

주요 결과

  • 10억 차원, 100만 개의 샘플, 10억 개의 비영 특성 요소를 가진 빌리언 스케일의 합성 데이터셋에서, 알고리즘은 단일 머신에서 단 8분 만에 특성 선택을 완료했다.
  • 제안된 방법은 온라인 특성 선택임에도 불구하고 최신 기술 수준의 배치 특성 선택 방법과 경쟁 가능한 학습 정확도를 달성했다.
  • 계산 비용은 최신 기술 수준의 배치 및 온라인 특성 선택 방법보다 수개의 주기 차이로 훨씬 낮았다.
  • 희박하고 초고차원적 데이터에서 강력한 확장성과 효율성을 보이며, 시간 효율성 면에서 기존 접근 방식을 모두 능가했다.
  • 최적화된 구현으로 인해 메모리 접근과 계산 시간이 크게 감소하여 거대 규모 데이터의 실시간 처리가 가능해졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.