[论文解读] Functional Regularization for Representation Learning: A Unified Theoretical Perspective
本文提出了一种通过函数正则化实现表示学习的统一理论框架,其中在无标签数据上进行的无监督或自监督辅助任务可作为可学习的正则化器,用于剪枝表示的假设空间。该框架表明,此类正则化通过约束模型容量,减少了对有标签数据的需求,实证验证显示,即使在有标签数据有限的情况下,微调后的 BERT 也优于随机初始化的 BERT。
Unsupervised and self-supervised learning approaches have become a crucial tool to learn representations for downstream prediction tasks. While these approaches are widely used in practice and achieve impressive empirical gains, their theoretical understanding largely lags behind. Towards bridging this gap, we present a unifying perspective where several such approaches can be viewed as imposing a regularization on the representation via a learnable function using unlabeled data. We propose a discriminative theoretical framework for analyzing the sample complexity of these approaches, which generalizes the framework of (Balcan and Blum, 2010) to allow learnable regularization functions. Our sample complexity bounds show that, with carefully chosen hypothesis classes to exploit the structure in the data, these learnable regularization functions can prune the hypothesis space, and help reduce the amount of labeled data needed. We then provide two concrete examples of functional regularization, one using auto-encoders and the other using masked self-supervision, and apply our framework to quantify the reduction in the sample complexity bound of labeled data. We also provide complementary empirical results to support our analysis.
研究动机与目标
- 为尽管在实证上取得成功但缺乏理论理解的无监督和自监督表示学习方法提供理论解释。
- 将多种表示学习方法(如自编码器和掩码自监督)统一在函数正则化的共同理论视角之下。
- 在该框架下分析有标签数据的样本复杂度,识别出无标签数据显著减少有标签数据需求的条件。
- 提供一种判别式 PAC 风格的理论框架,通过允许可学习的正则化函数而非固定函数,推广先前的工作。
- 通过在合成数据和真实数据上进行消融研究,利用预训练 BERT 对理论主张进行实证验证。
提出的方法
- 提出一种判别式 PAC 风格的框架,用于界定表示学习中对有标签和无标签数据的样本复杂度。
- 将表示学习建模为:从无标签数据中学习一个可学习的正则化函数,并将其应用于约束表示的假设空间。
- 通过允许正则化函数被学习而非固定,推广先前的半监督学习框架,从而更广泛地适用于自监督方法。
- 将该框架应用于两个具体实例:自编码器和掩码自监督(例如,BERT 风格的预训练),推导出明确的样本复杂度边界。
- 通过假设类剪枝的论证,表明函数正则化可减少有效模型容量,从而降低泛化所需的有标签数据量。
- 在合成数据和真实世界数据上进行实证评估,包括微调预训练 BERT 与从随机初始化开始训练(有无表示层的范数惩罚)的对比。
实验结果
研究问题
- RQ1在何种条件下,无标签数据可减少表示学习中对有标签数据的样本复杂度?
- RQ2从无标签数据中学习到的可学习正则化函数如何约束表示的假设空间?
- RQ3来自自监督任务(如掩码预测或重构)的函数正则化在多大程度上可减少对有标签数据的需求?
- RQ4与固定范数惩罚相比,基于大规模无标签数据(如 BERT)的预训练在样本效率方面如何优于随机初始化?
- RQ5是否可以构建一个理论框架,将多种自监督表示学习方法统一在函数正则化这一共同原则上?
主要发现
- 在所有有标签数据规模下,预训练 BERT 的性能均显著优于随机初始化的 BERT,证明了大规模无标签预训练带来的函数正则化优势。
- 在 MRPC 数据集上,微调预训练 BERT 在 3,668 个训练样本下达到 80.3% 的准确率和 85.7% 的 F1 分数,即使加入 L1 或 L2 惩罚,也优于随机初始化模型。
- 当有标签数据量较小时,预训练 BERT 的性能提升微乎其微,表明预训练模型已通过函数正则化剪除了假设空间的大部分冗余。
- 随机初始化模型在加入 L1 或 L2 惩罚后,性能提升有限,表明固定范数惩罚无法与预训练带来的结构化归纳偏置相媲美。
- 当 BERT 权重被冻结而仅微调分类器时,在小数据集上收敛效果差,证实表示空间必须被充分搜索,且来自无标签数据的函数正则化对高效学习至关重要。
- 理论框架表明,函数正则化可减少有效假设类的大小,从而降低有标签样本复杂度,这通过预训练与随机初始化模型之间的性能差距得到了实证验证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。