[논문 리뷰] No fast exponential deviation inequalities for the progressive mixture rule
이 논문은 점진적 혼합 규칙가 최적의 $ O(1/n) $ 기대 위험률을 달성하지만, 표준 가정인 지수-볼록성과 대칭 손실 하에서도 빠른 지수적 편차 부등식을 허용하지 않음을 보여준다. 이는 편차 상한이 여전히 $ O(1/\sqrt{n}) $ 수준이라는 것을 의미하며, 기대 기반 보장 대비 높은 확률 성능이 열등함을 시사한다.
We consider the learning task consisting in predicting as well as the best function in a finite reference set G up to the smallest possible additive term. If R(g) denotes the generalization error of a prediction function g, under reasonable assumptions on the loss function (typically satisfied by the least square loss when the output is bounded), it is known that the progressive mixture rule g_n satisfies E R(g_n) < min_{g in G} R(g) + C (log|G|)/n where n denotes the size of the training set, E denotes the expectation w.r.t. the training set distribution and C denotes a positive constant. This work mainly shows that for any training set size n, there exist a>0, a reference set G and a probability distribution generating the data such that with probability at least a R(g_n) > min_{g in G} R(g) + c sqrt{[log(|G|/a)]/n}, where c is a positive constant. In other words, surprisingly, for appropriate reference set G, the deviation convergence rate of the progressive mixture rule is only of order 1/sqrt{n} while its expectation convergence rate is of order 1/n. The same conclusion holds for the progressive indirect mixture rule. This work also emphasizes on the suboptimality of algorithms based on penalized empirical risk minimization on G.
연구 동기 및 목표
- 점진적 혼합 규칙가 최적의 기대 위험률을 달성하는 것으로 알려져 있지만, 이와 동시에 빠른 지수적 편차 부등식을 확보하는지 조사하기 위해.
- 표준 손실 가정 하에서 점진적 혼합 규칙 및 그 간접 변형의 편차 행동을 분석하기 위해.
- 좋은 기대 성능이 강력한 높은 확률 상한을 암시한다는 일반적인 가정을 도전하기 위해.
- 패널티를 부여한 경험 위험 최소화가 빠른 편차 속도를 달성하는 데에 하위최적임을 부각하기 위해.
제안 방법
- 편차 확률의 하한을 도출하기 위해 특정 데이터 생성 분포와 기준 집합 $ \mathcal{G} $ 를 구성하는 분석을 수행한다.
- Hoeffding의 부등식과 모멘트 생성 함수 기법을 사용하여 경험 위험 최소화자의 기대 위험을 상한으로 제시한다.
- 최적화된 모 bord 차이를 가진 초입방체를 통한 Assouad 유형의 하한을 적용한다.
- 점진적 혼합 규칙를 누적 손실 기반으로 순차적으로 업데이트되는 사후 가중치의 시간 평균 예측으로 정의한다.
- 핵심 부등식은 $ \mathcal{G} $ 내 최적 함수를 초월하는 위험 초과를 모 bord 차이 $ d_{\textnormal{I}} $ 와 정규화된 편차 항을 사용하여 상한으로 제시한다.
- 손실 함수의 대칭성과 적합성 조건을 활용하여 양의 모 bord 차이를 보장함으로써 비어 있지 않은 하한을 확보한다.
실험 결과
연구 질문
- RQ1표준 지수-볼록성 및 대칭 손실 가정 하에서 점진적 혼합 규칙가 빠른 지수적 편차 부등식을 달성할 수 있는가?
- RQ2점진적 혼합 규칙의 $ O(1/n) $ 기대 위험률이 해당하는 $ O(1/n) $ 편차 속도로도 일치하는가?
- RQ3점진적 혼합 규칙의 최소 가능한 편차 속도는 $ n $ 과 $ |\mathcal{G}| $ 에 대해 어떻게 표현될 수 있는가?
- RQ4왜 패널티를 부여한 경험 위험 최소화 방법은 이 설정에서 빠른 편차 속도를 달성하지 못하는가?
주요 결과
- 모든 $ n $ 에 대해, 확률 적으로 $ \epsilon > 0 $ 이상일 때, 점진적 혼합 규칙의 위험 초과가 적어도 $ c\sqrt{\frac{\log(|\mathcal{G}|\epsilon^{-1})}{n}} $ 이상이 되는 분포와 기준 집합 $ \mathcal{G} $ 가 존재한다.
- 기대 속도는 $ O(1/n) $ 이지만, 편차 수렴 속도는 오직 $ O(1/\sqrt{n}) $ 수준이므로, 높은 확률 성능에서의 근본적인 격차가 존재함을 시사한다.
- 동일한 하위최적의 편차 속도는 점진적 간접 혼합 규칙에도 적용된다.
- 손실 함수의 '중앙에서 잘 동작한다'는 조건과 적합성 조건 덕분에 모 bord 차이 $ d_{\textnormal{I}} $ 는 엄밀히 양수이며, 이는 비어 있지 않은 하한을 가능하게 한다.
- 하한은 $ \tilde{d}_{\textnormal{II}} = \min\left(\frac{\tilde{m}}{4n}, 1\right) $ 로 설정함으로써 최적화되며, 이로 인해 기재된 편차 속도가 도출된다.
- 결과적으로, 패널티를 부여한 경험 위험 최소화가 빠른 편차 속도를 달성하는 데에 하위최적임을 보여준다. 기대 속도가 최적이더라도 그렇다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.