[论文解读] Characterizing and Avoiding Negative Transfer
本文提出了迁移学习中负迁移的正式定义,并引入一种通用的对抗性门控机制,以过滤有害的源数据。通过判别器估计源域与目标域之间的分布偏移,该方法在六种深度迁移学习模型上均一致地提升了性能,即使在源数据退化的情况下也能有效避免负迁移。
When labeled data is scarce for a specific target task, transfer learning often offers an effective solution by utilizing data from a related source task. However, when transferring knowledge from a less related source, it may inversely hurt the target performance, a phenomenon known as negative transfer. Despite its pervasiveness, negative transfer is usually described in an informal manner, lacking rigorous definition, careful analysis, or systematic treatment. This paper proposes a formal definition of negative transfer and analyzes three important aspects thereof. Stemming from this analysis, a novel technique is proposed to circumvent negative transfer by filtering out unrelated source data. Based on adversarial networks, the technique is highly generic and can be applied to a wide range of transfer learning algorithms. The proposed approach is evaluated on six state-of-the-art deep transfer methods via experiments on four benchmark datasets with varying levels of difficulty. Empirically, the proposed method consistently improves the performance of all baseline methods and largely avoids negative transfer, even when the source data is degenerate.
研究动机与目标
- 解决迁移学习中负迁移缺乏严格定义与系统性分析的问题。
- 识别导致负迁移的关键因素——算法依赖性、领域差异性以及目标数据可用性。
- 开发一种通用且可部署的方法,以检测并避免负迁移,且无需依赖目标数据的标签。
- 确保所提方法与广泛范围的深度迁移学习算法兼容。
提出的方法
- 基于风险比较,提出一种算法特定的负迁移正式定义:$ R_{P_T}(A( ext{S}, ext{T})) > R_{P_T}(A( ext{empty}, ext{T})) $,即当使用源数据时模型性能劣于忽略源数据时。
- 引入一种基于对抗网络的判别器门控机制,用于估计源数据与目标数据的边缘分布与联合分布。
- 将判别器的输出作为实例权重,对源样本进行重加权,过滤掉与目标分布差异较大的样本。
- 将门控机制形式化为一种重要性重加权方法,以减小源域与目标域风险之间的偏差,从而有效最小化负迁移。
- 与主模型端到端联合训练判别器,实现在训练过程中动态过滤无关或有害的源样本。
- 将该方法作为插件模块集成到现有迁移学习框架中,保持与最先进深度模型的兼容性。
实验结果
研究问题
- RQ1如何在测试时以一种严谨且可度量的方式正式定义负迁移?
- RQ2导致负迁移的关键因素是什么?它们如何与迁移学习算法相互作用?
- RQ3能否设计一种通用的、与模型无关的方法,在迁移前检测并过滤有害的源数据?
- RQ4所提方法是否能在负迁移条件下,持续提升多种深度迁移学习算法的性能?
主要发现
- 所提出的判别器门控方法在四个基准数据集上,对六种基线深度迁移学习方法的性能均实现了持续提升。
- 实验结果表明,即使源数据退化或与目标域高度不相似,该方法仍能有效避免负迁移。
- 判别器输出分布显示,标准DANN对所有源样本分配近乎均匀的权重(约0.5),而门控版本则显著降低了对扰动(无关)数据的权重。
- 该方法通过过滤与目标分布差异较大的样本,降低了使用有害源数据的风险,表现为对扰动源样本的平均权重更低。
- 所提出的负迁移正式定义消除了以往非正式使用中的模糊性,实现了可测量、算法特定的负迁移效应评估。
- 实验验证了负迁移受算法选择、领域差异性和目标数据可用性的影响,与理论分析一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。