Skip to main content
QUICK REVIEW

[논문 리뷰] Large Scale Empirical Risk Minimization via Truncated Adaptive Newton Method

Mark Eisen, Aryan Mokhtari|arXiv (Cornell University)|2017. 05. 22.
Statistical Methods and Inference인용 수 12
한 줄 요약

이 논문은 대규모 경험 리스크 최소화(ERM)를 위한 이차 최적화 알고리즘인 k-절단 적응형 뉴턴(k-Truncated Adaptive Newton, k-TAN) 방법을 제안한다. 이 방법은 적응형 샘플 크기와 절단된 헤시안 역행렬을 사용한다. 데이터에 대해 약 두 번의 전체 런을 수행하면서 훈련 세트 크기를 기하급수적으로 증가시키고, 각 하위문제를 단일 절단 뉴턴 단계로 해결함으로써 통계 정확도에 도달하며, 불량 조건 문제에서 수렴 속도가 더 빠른 확률적 일阶 방법보다 뛰어난 성능을 보인다.

ABSTRACT

We consider large scale empirical risk minimization (ERM) problems, where both the problem dimension and variable size is large. In these cases, most second order methods are infeasible due to the high cost in both computing the Hessian over all samples and computing its inverse in high dimensions. In this paper, we propose a novel adaptive sample size second-order method, which reduces the cost of computing the Hessian by solving a sequence of ERM problems corresponding to a subset of samples and lowers the cost of computing the Hessian inverse using a truncated eigenvalue decomposition. We show that while we geometrically increase the size of the training set at each stage, a single iteration of the truncated Newton method is sufficient to solve the new ERM within its statistical accuracy. Moreover, for a large number of samples we are allowed to double the size of the training set at each stage, and the proposed method subsequently reaches the statistical accuracy of the full training set approximately after two effective passes. In addition to this theoretical result, we show empirically on a number of well known data sets that the proposed truncated adaptive sample size algorithm outperforms stochastic alternatives for solving ERM problems.

연구 동기 및 목표

  • 고차원 데이터와 대규모 데이터셋을 가진 대규모 경험 리스크 최소화(ERM)에서 이차 최적화 방법의 높은 계산 비용을 해결하기 위해.
  • 고차원 및 대규모 샘플 세트에서 전체 헤시안 행렬을 계산하고 역행렬하는 데 드는 금지적인 비용을 극복하기 위해.
  • 통계 정확도 경계를 활용하여 계산 복잡도를 감소시키면서도 해의 품질을 손상시키지 않는 근사화를 정당화하기 위해.
  • 통계 정확도를 유지하면서 기하급수적으로 증가하는 훈련 세트 크기를 갖는 적응형 샘플 크기 전략을 개발하기 위해.
  • 각 하위문제를 효율적으로 해결하기 위해 저랭크 헤시안 근사를 사용하는 절단 뉴턴 방법을 설계하기 위해.

제안 방법

  • 대규모 ERM에 대해 적응형 샘플 크기 선택과 절단된 헤시안 역행렬을 결합한 k-Truncated Adaptive Newton(k-TAN) 방법을 제안한다.
  • 샘플 크기가 단계별로 두 배로 증가하는 증가하는 데이터 부분집합에 대한 ERM 문제의 시퀀스를 사용한다.
  • 헤시안의 상위-k 고유값만을 사용하여 절단된 고유값 분해를 적용함으로써 저비용으로 헤시안 역행렬을 근사한다.
  • 각 하위문제에 대해 단일 절단 뉴턴 단계를 적용하여 현재 하위문제의 통계 정확도 내에서 수렴을 보장한다.
  • 뉴턴 감소와 곡률 정보를 사용하여 반복값이 각 하위문제의 이차 수렴 영역 내에 유지되도록 한다.
  • 하위문제의 부적합도와 절단 오차에 대한 경계를 유도하여 각 하위문제의 해가 전체 ERM 해의 통계 정확도 내에 유지됨을 보장한다.

실험 결과

연구 질문

  • RQ1헤시안 계산 및 역행렬 비용을 줄임으로써 이차 최적화 방법을 대규모 ERM 문제에 대해 확장 가능하게 만들 수 있는가?
  • RQ2각 하위문제를 단일 절단 뉴턴 단계로 해결하면서 훈련 세트 크기를 기하급수적으로 증가시키면 통계 정확도 내에서 수렴하는가?
  • RQ3저랭크 근사를 사용한 헤시안 역행렬의 절단이 수렴 속도를 유지하면서 계산 비용을 줄일 수 있는가?
  • RQ4k-TAN 반복값의 부적합도가 현재 데이터 부분집합의 통계 정확도에 의해 유계가 되어 전체 해 품질을 보장하는가?
  • RQ5이 방법이 전체 데이터의 통계 정확도에 약 두 번의 유효한 데이터 런을 통해 수렴할 수 있는가?

주요 결과

  • k-TAN 방법은 절단된 헤시안 근사를 사용하고 있음에도 불구하고, 전체 훈련 세트의 통계 정확도에 약 두 번의 유효한 데이터 런을 통해 도달한다.
  • 적응형 샘플링을 통해 이차 수렴 영역에 진입하기 때문에, 각 하위문제에 대해 단일 절단 뉴턴 단계만으로도 각 ERM 인스턴스를 그 통계 정확도 내에서 해결하는 데 충분하다.
  • k-TAN 반복값의 부적합도는 통계 정확도 $V_m = \tilde{O}(1/m)$와 절단 오차 $ ho c V_n$에 대한 함수로 유계가 되며, 이는 목표 정밀도 내 수렴을 보장한다.
  • 각 하위문제에 대해 효과적으로 이차 수렴 속도를 달성하며, 절단 오차 $ ho$는 추가 오차가 통계 정확도에 비해 무시할 만큼 작게 유지된다.
  • 실험 결과에 따르면, k-TAN은 잘 알려진 데이터셋에서 확률적 일阶 방법보다 뛰어나며, 특히 일阶 방법이 느리게 수렴하는 불량 조건 문제에서 두각을 나타낸다.
  • 이론적 분석은 헤시안의 $(k+1)$-번째 고유값 $ u_{k+1} \triangleq \rho c V_n$이 만족할 경우, 하위문제의 부적합도 $S_n(\textbf{x}_n)$가 $V_n$ 이내로 유계가 되며, 이는 전체 ERM 문제의 통계 정확도 내에 해가 존재함을 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.