Skip to main content
QUICK REVIEW

[논문 리뷰] Optimal Rates for Regularized Conditional Mean Embedding Learning

Zhu Li, Dimitri Meunier|arXiv (Cornell University)|2022. 08. 02.
Statistical Methods and Inference인용 수 9
한 줄 요약

이 논문은 텐서곱 구조를 통한 새로운 벡터-값 함수 보간 공간을 도입하여 오차가 있는 설정에서 정규화된 조건부 평균 임bedding(CME)에 대한 최적의 학습률을 확립한다. 이는 처음으로 일치하는 하한을 증명하고, 유한 차원의 목표 RKHS를 가정하지 않아도 최적의 O(log n / n) 수렴 속도를 달성함으로써, 일반 조건 하에서 CME 일致성 이론의 오랜 격차를 해결한다.

ABSTRACT

We address the consistency of a kernel ridge regression estimate of the conditional mean embedding (CME), which is an embedding of the conditional distribution of $Y$ given $X$ into a target reproducing kernel Hilbert space $\mathcal{H}_Y$. The CME allows us to take conditional expectations of target RKHS functions, and has been employed in nonparametric causal and Bayesian inference. We address the misspecified setting, where the target CME is in the space of Hilbert-Schmidt operators acting from an input interpolation space between $\mathcal{H}_X$ and $L_2$, to $\mathcal{H}_Y$. This space of operators is shown to be isomorphic to a newly defined vector-valued interpolation space. Using this isomorphism, we derive a novel and adaptive statistical learning rate for the empirical CME estimator under the misspecified setting. Our analysis reveals that our rates match the optimal $O(\log n / n)$ rates without assuming $\mathcal{H}_Y$ to be finite dimensional. We further establish a lower bound on the learning rate, which shows that the obtained upper bound is optimal.

연구 동기 및 목표

  • 목표 RKHS가 무한 차원일 경우에도 CME 추정기의 최적 학습률 부족 문제를 해결하기 위해.
  • E[g(Y)|X=·] ∈ HX와 같은 제약 조건이 없는 원칙적인 프레임워크를 개발하여 CME를 정의하기 위해.
  • 일반적인 부드러움과 정규성 조건 하에서 경험적 CME 추정기의 일치성과 수렴 속도를 확립하기 위해.
  • 학습률에 대한 일치하는 하한을 증명하여 유도된 상한이 최적이 됨을 입증하기 위해.

제안 방법

  • 입력 및 출력 RKHS 간의 텐서곱 구조를 통한 새로운 벡터-값 함수 보간 공간을 도입하여 CME의 더 일반적인 특성화를 가능하게 한다.
  • 힐베르트-슈미트 연산자 공간과 이 새로운 벡터-값 보간 공간 사이의 동형사상(이sovorphism)을 확립하여, 연산자 이론적 정의와 측도 이론적 정의를 연결한다.
  • 정규화를 적용한 커널 리지 회귀를 사용하여 CME를 추정하고, 보간 공간을 활용해 수렴 속도를 유도한다.
  • 베르누이의 부등식과 고유값 감쇠 가정(EVD)을 적용하여 경험적 리스크와 일반화 오차를 통제한다.
  • f ∈ [H]β_X로 매개변수화된 조건부 분포의 가족을 사용한 새로운 하한 구축 기법을 활용하여, 상한 속도를 더 이상 향상시킬 수 없음을 보여준다.
  • 논문 [29, 26, 40, 11]의 이론적 도구를 통합하여 측도 이론적 CME 정의와 보간 공간 이론을 통합하여 강력한 분석을 가능하게 한다.

실험 결과

연구 질문

  • RQ1목표 RKHS가 유한 차원이 아니라는 가정 없이, 오차가 있는 설정에서 CME 추정기의 최적 학습률을 달성할 수 있는가?
  • RQ2약한 가정 하에서 연산자 이론적 정의와 측도 이론적 정의를 통합하는 일반적 프레임워크가 존재하는가?
  • RQ3유도된 상한이 최적이 됨을 확인하기 위해 일치하는 하한을 유도할 수 있는가?
  • RQ4제안된 보간 공간 프레임워크는 진정한 CME가 가설 공간 외부에 있을 경우에도 일관된 추정을 가능하게 하는가?

주요 결과

  • 논문은 목표 RKHS가 무한 차원일지라도 오차가 있는 설정에서 정규화된 CME 추정기의 최적 학습률인 O(log n / n)을 확립한다.
  • 유도된 상한이 이론적 하한과 일치함을 입증하여, 주어진 가정 하에서 이 속도를 더 이상 향상시킬 수 없음을 보여준다.
  • 제안된 벡터-값 보간 공간은 이전 연구에서 요구된 단사성과 고유값 감쇠 가정을 피하는 엄밀하고 일반적인 프레임워크를 제공한다.
  • 힐베르트-슈미트 연산자와 새로운 보간 공간 사이의 동형사상은 연산자 기반 정의와 함수 기반 정의 사이의 깔끔한 이론적 연결을 가능하게 한다.
  • 분석 결과, 진짜 조건부 평균이 가설 공간에 포함되어 있지 않더라도, 보간 공간에 속해 있다면 CME는 여전히 일관되게 추정될 수 있음을 보여준다.
  • 하한 구축은 f ∈ [H]β_X로 매개변수화된 조건부 분포의 가족을 사용하여, 주어진 부드러움 조건 하에서 더 빠른 속도가 불가능함을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.