Skip to main content
QUICK REVIEW

[论文解读] Bagging Provides Assumption-free Stability

Jake A. Soloff, Rina Foygel Barber|arXiv (Cornell University)|Jan 30, 2023
Explainable Artificial Intelligence (XAI)被引用 5
一句话总结

本文為監督學習中的套袋法(bagging)建立了有限樣本、無假設的穩定性保障,證明了子套袋模型(subbagged models)在不論基礎演算法、資料分佈或共變數維度的情況下均具有本質上的穩定性。主要結果顯示,即使在極端不穩定的基礎學習器下,僅需極少條件即可確保穩定性,且邊界僅相差常數因子,達最佳水準。

ABSTRACT

Bagging is an important technique for stabilizing machine learning models. In this paper, we derive a finite-sample guarantee on the stability of bagging for any model. Our result places no assumptions on the distribution of the data, on the properties of the base algorithm, or on the dimensionality of the covariates. Our guarantee applies to many variants of bagging and is optimal up to a constant. Empirical results validate our findings, showing that bagging successfully stabilizes even highly unstable base algorithms.

研究动机与目标

  • 在不對資料分佈、基礎演算法或共變數維度做任何假設的情況下,提供套袋法的有限樣本穩定性保障。
  • 建立套袋法可穩定任何基礎演算法(即使極度不穩定)的理論基礎,僅需極少條件。
  • 透過自適應截斷(adaptive clipping)與有限集合規模,將穩定性結果延伸至無界輸出。
  • 提供確定性、適用於分布外(out-of-distribution)樣本的穩定性邊界,且邊界僅相差常數因子。

提出的方法

  • 提出一種新的演算法穩定性定義,基於移除訓練點後導致預測變化超過閾值 ε 的樣本比例。
  • 運用霍夫丁不等式(Hoeffding’s inequality)與集中不等式,控制套袋預測與其無限樣本極限之間的偏差。
  • 採用耦合論證(coupling argument)比較完整資料與留一法(leave-one-out)模型,以邊界化大預測偏移的機率。
  • 透過尾機率的積分推導穩定性邊界,得出子套袋法(subbagging)在 m = pn 樣本下,形式為 δε² ≳ 1/n · p/(1−p) 的邊界。
  • 透過自適應截斷與有限集合規模 B,將結果延伸至無界輸出,引入一個穩健性項 R(𝒟,x) 以控制極端值。
  • 採用隨機重採樣機制(透過均勻隨機排列)來模擬自助抽樣(bootstrap sampling),並推導出確定性邊界。
Figure 1: Distribution of leave-one-out perturbations for logistic regression (red) and subbagged logistic regression (blue), with $n=500$ and $d=250$ . (See Section 6 for details on this simulation.)
Figure 1: Distribution of leave-one-out perturbations for logistic regression (red) and subbagged logistic regression (blue), with $n=500$ and $d=250$ . (See Section 6 for details on this simulation.)

实验结果

研究问题

  • RQ1套袋法是否能在不對資料或演算法做任何假設的情況下,穩定任何基礎學習演算法?
  • RQ2在極少條件下,能否為套袋法推導出有限樣本的穩定性保障?
  • RQ3套袋法的穩定性如何隨樣本大小與子樣本大小 m 在子套袋法(subbagging)中變化?
  • RQ4是否能透過自適應截斷與有限 B,確保無界輸出的穩定性?
  • RQ5所推導的穩定性邊界是否僅相差常數因子,即達到最佳水準?

主要发现

  • 對於輸出有界的任何基礎演算法,套袋法可達成 (ε,δ)-穩定性,其中 δε² ≳ 1/n · p/(1−p),p = m/n。
  • 此穩定性保障對任何資料分佈、任何基礎演算法與任何測試點(包括分布外點)均為確定性成立。
  • 邊界僅相差常數因子,如分析中所示的匹配下界所證實。
  • 對於無界輸出,自適應截斷的套袋法達成 (ε + √(2/B log(4/δ′)), δ_I + δ + δ′, R)-穩定性,其中 R 用以捕捉輸出範圍。
  • 實驗結果確認,套袋法顯著降低預測變異性,並能穩定極度不穩定的基礎模型(如邏輯回歸)。
  • 結果可延伸至多種套袋變體,包括子套袋法與有限 B 結構,且對重採樣機制的假設極為有限。
Figure 2: Phase diagram comparing Theorems 8 and 10 .
Figure 2: Phase diagram comparing Theorems 8 and 10 .

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。