[论文解读] Self-supervised Learning from a Multi-view Perspective
本文提出了一种信息论框架,通过将输入和自监督信号建模为多视角数据,解释了自监督学习(SSL)如何提取与任务相关的信息并丢弃与任务无关的信息。该框架引入了一个复合的自监督学习目标,结合对比学习与预测学习,并引入反向预测损失以最小化无关信息,从而在视觉和视觉-文本任务中提升泛化能力并减少过拟合。
As a subset of unsupervised representation learning, self-supervised representation learning adopts self-defined signals as supervision and uses the learned representation for downstream tasks, such as object detection and image captioning. Many proposed approaches for self-supervised learning follow naturally a multi-view perspective, where the input (e.g., original images) and the self-supervised signals (e.g., augmented images) can be seen as two redundant views of the data. Building from this multi-view perspective, this paper provides an information-theoretical framework to better understand the properties that encourage successful self-supervised learning. Specifically, we demonstrate that self-supervised learned representations can extract task-relevant information and discard task-irrelevant information. Our theoretical framework paves the way to a larger space of self-supervised learning objective design. In particular, we propose a composite objective that bridges the gap between prior contrastive and predictive learning objectives, and introduce an additional objective term to discard task-irrelevant information. To verify our analysis, we conduct controlled experiments to evaluate the impact of the composite objectives. We also explore our framework's empirical generalization beyond the multi-view perspective, where the cross-view redundancy may not be clearly observed.
研究动机与目标
- 通过将输入和自监督信号建模为多视角数据,理论理解自监督学习(SSL)成功的原因。
- 形式化说明SSL表征如何以潜在损失提取与任务相关的信息,并以固定差距丢弃与任务无关的信息。
- 在统一的信息论框架下整合对比学习与预测学习的SSL目标。
- 设计一种新的反向预测学习目标,以最小化条件熵并抑制无关信息。
- 在多视角和跨模态设置下对框架进行实证评估,其中多视角假设可能不成立。
提出的方法
- 将SSL形式化为多视角学习问题,其中输入X和自监督信号S是同一数据的两个视角,而与任务相关的信息T为未观测变量。
- 利用信息论证明,学习到的表征Z_X可以在有界损失下提取与任务相关的信息,并以固定差距丢弃无关信息。
- 提出一个复合SSL目标,结合对比损失(L_CL)与预测损失(L_FP),并增加反向预测损失(L_IP)以最小化H(Z_X | S),从而抑制无关特征。
- 引入一种反向预测学习目标,以最小化条件熵H(Z_X | S),有效去除两视角之间不共享的信息。
- 使用拉格朗日乘子λ_IP校准复合目标,实证发现当L_IP的尺度为L_CL或L_FP的1/10时性能最优。
- 在视觉和视觉-文本数据集上进行受控实验,评估复合目标对表征质量与泛化能力的影响。
实验结果
研究问题
- RQ1在多视角假设下,自监督表征如何在提取与任务相关的信息的同时丢弃与任务无关的信息?
- RQ2在信息论SSL的背景下,对比学习与预测学习目标之间的理论关系是什么?
- RQ3结合对比学习、预测学习与反向预测学习的复合目标是否能提升表征质量与泛化能力?
- RQ4当多视角假设不成立时(如在跨模态设置中),所提出的框架泛化能力如何?
- RQ5反向预测损失相对于其他目标的最优缩放比例是多少,才能实现最佳性能?
主要发现
- 所提出的复合目标(结合对比学习、预测学习与反向预测学习)在性能上优于单独使用对比学习或预测学习目标,且过拟合程度更低。
- 实证结果表明,反向预测损失(L_IP)通过最小化H(Z_X | S)有效降低了表征对无关信息的依赖。
- 在受控实验中,L_IP的最优缩放比例被确定为L_CL或L_FP的十分之一,表明存在稳定且可泛化的超参数区域。
- 该框架超越了多视角视角的限制:即使在跨模态设置(如图像与文本)中,复合目标仍能保持优异性能,表明其对视角冗余假设具有鲁棒性。
- 理论分析证实,自监督表征可在有界损失下提取与任务相关的信息,并以固定差距丢弃无关信息,为SSL的成功提供了形式化依据。
- 实验证明,反向预测损失可轻松集成至现有SSL目标中,并在视觉与视觉-文本基准测试中均提升了下游任务的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。