Skip to main content
QUICK REVIEW

[论文解读] The Onset of Variance-Limited Behavior for Networks in the Lazy and Rich Regimes

Alexander Atanasov, Blake Bordelon|arXiv (Cornell University)|Dec 23, 2022
Model Reduction and Neural Networks被引用 4
一句话总结

本文識別出寬度神經網絡中方差限制泛化現象的起始點,顯示有限寬度效應在訓練集規模 $ P^* \sim \sqrt{N} $ 時變得顯著,此時泛化性能低於無限寬度下的表現。作者將此現象與最終神經正切核(NTK)的波動聯繫起來,證明特徵學習與集成平均可抑制方差,進而提升泛化性能,超越臨界點 $ P^* $。

ABSTRACT

For small training set sizes $P$, the generalization error of wide neural networks is well-approximated by the error of an infinite width neural network (NN), either in the kernel or mean-field/feature-learning regime. However, after a critical sample size $P^*$, we empirically find the finite-width network generalization becomes worse than that of the infinite width network. In this work, we empirically study the transition from infinite-width behavior to this variance limited regime as a function of sample size $P$ and network width $N$. We find that finite-size effects can become relevant for very small dataset sizes on the order of $P^* \sim \sqrt{N}$ for polynomial regression with ReLU networks. We discuss the source of these effects using an argument based on the variance of the NN's final neural tangent kernel (NTK). This transition can be pushed to larger $P$ by enhancing feature learning or by ensemble averaging the networks. We find that the learning curve for regression with the final NTK is an accurate approximation of the NN learning curve. Using this, we provide a toy model which also exhibits $P^* \sim \sqrt{N}$ scaling and has $P$-dependent benefits from feature learning.

研究动机与目标

  • 識別有限寬度神經網絡開始劣於無限寬度網絡泛化性能的臨界訓練集規模 $ P^* $。
  • 理解神經正切核(NTK)方差在引發有限寬度泛化誤差中的作用。
  • 研究特徵學習與集成平均如何緩解有限寬度網絡中的方差限制行為。
  • 驗證神經網絡學習曲線與使用最終經驗 NTK(eNTK f)的核回歸之間的對應關係。
  • 構建一個簡化的隨機特徵模型,以重現真實網絡中觀察到的關鍵尺度行為。

提出的方法

  • 透過在多項式回歸任務上對 ReLU 網絡進行實驗,系統研究不同寬度 $ N $、訓練集規模 $ P $ 和輸出縮放 $ \alpha $ 下的表現,以調節網絡處於懶惰與豐富兩種模式之間。
  • 利用最終經驗 NTK(eNTK f)近似神經網絡的泛化誤差,並顯示其與實際學習曲線具有強烈對應關係。
  • 分析不同隨機初始化下最終 NTK 的方差,以量化有限寬度下的波動效應。
  • 透過模型平均與數據增強實施集成平均,以減少由方差引起的誤差。
  • 引入一個帶噪聲的隨機特徵模型,以解析方式重現 $ P^* \sim \sqrt{N} $ 的尺度關係,以及特徵學習帶來的對齊改進。
  • 比較不同網絡深度、輸入維度與中心化方法下的泛化誤差與方差,以分離架構效應。

实验结果

研究问题

  • RQ1在何種訓練集規模 $ P $ 時,有限寬度神經網絡開始劣於無限寬度網絡的泛化性能?
  • RQ2最終神經正切核(NTK)的方差如何驅動有限寬度泛化誤差?
  • RQ3特徵學習與集成平均在多大程度上能抑制有限寬度網絡中的方差限制行為?
  • RQ4使用最終經驗 NTK(eNTK f)的核回歸在多大程度上能近似真實神經網絡的學習曲線?
  • RQ5簡單的隨機特徵模型能否重現觀察到的 $ P^* \sim \sqrt{N} $ 標度關係與特徵學習帶來的優勢?

主要发现

  • 對於多項式回歸中的 ReLU 網絡,有限寬度網絡表現劣於無限寬度網絡的臨界樣本數 $ P^* $,其尺度關係為 $ P^* \sim \sqrt{N} $。
  • 有限寬度網絡中的泛化誤差主要由隨機初始化引起的方差所主導,特別是在懶惰模式下,這定義了方差限制的泛化區域。
  • 集成平均顯著降低方差並改善泛化性能,尤其在方差限制的區域效果更為顯著。
  • 特徵學習——由小輸出縮放 $ \alpha $ 或更高次多項式任務所引發——在 $ P^* $ 之前與之後均能提升泛化性能,主要機制是增強最終 NTK 與目標函數之間的對齊程度。
  • 神經網絡的學習曲線可被使用最終經驗 NTK(eNTK f)的核回歸良好近似,驗證了其作為網絡行為代理的有效性。
  • 簡化的隨機特徵模型成功重現了 $ P^* \sim \sqrt{N} $ 的尺度關係與特徵學習帶來的對齊優勢,確認了所觀察現象背後的作用機制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。