Skip to main content
QUICK REVIEW

[논문 리뷰] Optimal Rates of Distributed Regression with Imperfect Kernels

Hongwei Sun, Qiang Wu|arXiv (Cornell University)|2020. 06. 30.
Sparse and Compressive Sensing Techniques참고 문헌 27인용 수 8
한 줄 요약

이 논문은 커널이 완벽하지 않은 경우—즉, 진짜 회귀 함수가 재생 커널 힐버트 공간에 정확히 포함되지 않을 때조차도 분산 커널 회귀에서 용량에 독립적인 최적의 학습률을 확립한다. 저자들은 반응 가중치 기반 알고리즘 프레임워크를 도입하고 엄밀한 한 개 제외 분석을 수행하여 설명되지 않은 반응 분산을 고려한 날카운 오차 한계를 도출함으로써, 불완전한 커널 하에서 최적의 수렴 속도를 가능하게 한다.

ABSTRACT

Distributed machine learning systems have been receiving increasing attentions for their efficiency to process large scale data. Many distributed frameworks have been proposed for different machine learning tasks. In this paper, we study the distributed kernel regression via the divide and conquer approach. This approach has been proved asymptotically minimax optimal if the kernel is perfectly selected so that the true regression function lies in the associated reproducing kernel Hilbert space. However, this is usually, if not always, impractical because kernels that can only be selected via prior knowledge or a tuning process are hardly perfect. Instead it is more common that the kernel is good enough but imperfect in the sense that the true regression can be well approximated by but does not lie exactly in the kernel space. We show distributed kernel regression can still achieves capacity independent optimal rate in this case. To this end, we first establish a general framework that allows to analyze distributed regression with response weighted base algorithms by bounding the error of such algorithms on a single data set, provided that the error bounds has factored the impact of the unexplained variance of the response variable. Then we perform a leave one out analysis of the kernel ridge regression and bias corrected kernel ridge regression, which in combination with the aforementioned framework allows us to derive sharp error bounds and capacity independent optimal rates for the associated distributed kernel regression algorithms. As a byproduct of the thorough analysis, we also prove the kernel ridge regression can achieve rates faster than $N^{-1}$ (where $N$ is the sample size) in the noise free setting which, to our best knowledge, are first observed and novel in regression learning.

연구 동기 및 목표

  • 실제 응용에서 커널이 거의 완벽하지 않다는 실용적 제약을 다루기 위해, 즉 진짜 회귀 함수가 관련 재생 커널 힐버트 공간에 정확히 포함되지 않을 경우를 고려한다.
  • 완벽한 커널의 이상적인 경우에 한정되었던 분산 커널 회귀의 이론적 최적성 결과를 더 현실적인 불완전하지만 충분히 좋은 커널의 경우로 확장한다.
  • 응답 변수의 설명되지 않은 분산의 영향을 고려한 분산 회귀 분석을 위한 일반적 프레임워크를 개발한다.
  • 불완전한 커널 하에서 분산 KRR와 BCKRR에 대해 날카운 오차 한계와 용량에 독립적인 최적 학습률을 도출한다.
  • 노이즈가 없는 회귀 설정에서 $O(N^{-1})$ 보다 빠른 초고속 학습률이 달성 가능하다는 것을 보여주며, 이는 회귀 학습 분야에서 새로운 발견이다.

제안 방법

  • 응답 가중치 기반 분산 회귀 알고리즘 분석을 위한 일반적 프레임워크를 제안하여, 단일 데이터셋에서의 성능이 전체 분산 학습률을 결정함을 보장한다.
  • 응답 변수의 설명되지 않은 분산을 명시적으로 고려한 오차 한계를 도출하기 위해 커널 리지 회귀(KRR)에 대한 한 개 제외 분석을 도입한다.
  • 비편향 보정 KRR(BCKRR)에도 동일한 한 개 제외 분석을 적용하여, 불완전한 커널 하에서도 날카운 오차 한계를 가능하게 한다.
  • BCKRR를 잔차 적합 및 재중심화 정규화라는 두 가지 다른 시각으로 재구성하여 이론적 분석과 더 넓은 적용 가능성을 향상시킨다.
  • 응답 가중치 프레임워크와 도출된 오차 한계를 조합하여, 분산 KRR와 BCKRR에 대해 용량에 독립적인 최적 학습률을 확립한다.
  • 이 프레임워크를 활용하여 노이즈가 없는 회귀 설정에서 $O(N^{-1})$ 보다 빠른 학습률이 가능하다는 것을 보여주며, 이는 이전에 관측되지 않은 현상이다.

실험 결과

연구 질문

  • RQ1커널이 불완전할 경우—즉, 진짜 회귀 함수가 재생 커널 힐버트 공간에 포함되지 않을 경우, 분산 커널 회귀가 최적의 학습률을 달성할 수 있는가?
  • RQ2응답 변수의 설명되지 않은 분산의 영향을 분산 회귀 알고리즘의 오차 한계에 공식적으로 통합할 수 있는가?
  • RQ3불완전한 커널 하에서 분산 KRR와 BCKRR의 이론적 성능은 어떠한가? 용량에 독립적인 최적의 학습률을 달성할 수 있는가?
  • RQ4회귀 학습에서 $O(N^{-1})$ 보다 빠른 초고속 학습률은 가능할 수 있는가, 특히 노이즈가 없는 설정에서?
  • RQ5BCKRR 알고리즘은 명시적 연산자 표현을 넘어서 더 넓은 이론적 분석과 적용 가능성을 지원하는 다른 형태로 재해석될 수 있는가?

주요 결과

  • 제안된 반응 가중치 프레임워크는 설명되지 않은 분산을 고려할 경우, 분산 회귀 분석을 단일 데이터셋에서의 기본 알고리즘 성능 분석으로 환원시킬 수 있다.
  • 엄밀한 한 개 제외 분석을 통해 설명되지 않은 반응 분산을 고려한 KRR에 대한 날카운 오차 한계가 도출되었으며, 이는 더 탄탄하고 현실적인 성능 추정을 가능하게 한다.
  • 불완전한 커널 하에서도 분산 KRR와 BCKRR는 용량에 독립적인 최적의 학습률을 달성하며, 이는 이전에 완벽한 커널에 국한된 결과를 확장한 것이다.
  • 이 논문은 노이즈가 없는 설정에서 $O(N^{-1})$ 보다 빠른 초고속 학습률이 가능하다는 첫 번째 알려진 결과를 확립하였으며, 이는 문헌에 새로운 기여이다.
  • BCKRR에 대해 잔차 적합 및 재중심화 정규화라는 두 가지 새로운 시각이 도입되었으며, 이는 KRR의 명시적 연산자 형태를 넘어서 일반화 성능 향상에 이론적·실용적 이점을 제공한다.
  • 이론적 프레임워크와 오차 한계가 국소 노드 수에 대해 강건함을 입증하여, 이전에 분산 학습에서 분할 수에 대한 제약 조건을 완화시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.