Skip to main content
QUICK REVIEW

[论文解读] Robust Learning with the Hilbert-Schmidt Independence Criterion

Daniel Greenfeld, Uri Shalit|arXiv (Cornell University)|Oct 1, 2019
Domain Adaptation and Few-Shot Learning参考文献 35被引用 10
一句话总结

本文提出使用希尔伯特-施密特独立性准则(HSIC)作为损失函数,以在无监督协变量偏移下训练鲁棒的回归与分类模型,其中模型残差被鼓励与输入特征统计独立。该方法在具有挑战性的细胞显微镜数据集上实现了最先进性能,尤其在分布偏移的测试集上优于标准交叉熵损失。

ABSTRACT

We investigate the use of a non-parametric independence measure, the Hilbert-Schmidt Independence Criterion (HSIC), as a loss-function for learning robust regression and classification models. This loss-function encourages learning models where the distribution of the residuals between the label and the model prediction is statistically independent of the distribution of the instances themselves. This loss-function was first proposed by Mooij et al. (2009) in the context of learning causal graphs. We adapt it to the task of learning for unsupervised covariate shift: learning on a source domain without access to any instances or labels from the unknown target domain, but with the assumption that $p(y|x)$ (the conditional probability of labels given instances) remains the same in the target domain. We show that the proposed loss is expected to give rise to models that generalize well on a class of target domains characterised by the complexity of their description within a reproducing kernel Hilbert space. Experiments on unsupervised covariate shift tasks demonstrate that models learned with the proposed loss-function outperform models learned with standard loss functions, achieving state-of-the-art results on a challenging cell-microscopy unsupervised covariate shift task.

研究动机与目标

  • 开发一种在无监督协变量偏移下具有良好泛化能力的学习框架,其中测试分布的输入边缘分布与训练分布不同,但条件标签分布保持不变。
  • 解决标准损失函数的局限性,即可能在源域的特定子群体上过拟合,并在分布偏移下失效。
  • 利用非参数独立性度量HSIC,学习预测误差与输入特征在统计上独立的模型,从而提升鲁棒性。
  • 从理论上证明HSIC损失在一致收敛性和有界RKHS复杂度下的可学习性。
  • 通过实证验证,HSIC损失模型在真实世界分布偏移基准上优于标准损失函数,尤其在具有挑战性的显微成像任务中表现突出。

提出的方法

  • 该方法将学习问题表述为最小化模型残差(Y - f(X))与输入特征X之间的HSIC,从而在不假设噪声分布为参数形式的前提下强制实现统计独立性。
  • 在再生核希尔伯特空间(RKHS)中使用基于核的HSIC估计器,实现残差与输入之间非参数独立性检验。
  • 该方法假设真实模型满足 Y = f*(X) + ε,且 ε ⊥⊥ X,目标是通过使预测满足 Y - f(X) ⊥⊥ X 来恢复 f*。
  • 损失通过随机梯度下降(如Adam)进行优化,无需访问目标域数据,仅依赖源数据和HSIC独立性准则。
  • 该方法应用于深度神经网络(如11层CNN),在训练过程中用HSIC损失替代标准交叉熵或MSE损失。
  • 在实验中应用了测试时增强技术,以进一步提升鲁棒性,特别是在细胞显微镜基准中。

实验结果

研究问题

  • RQ1与标准损失函数相比,基于HSIC的学习是否能产生在无监督协变量偏移下泛化能力更好的模型?
  • RQ2在分布偏移的测试集上,强制残差与输入之间实现统计独立性是否能提升模型鲁棒性?
  • RQ3当分布偏移在RKHS复杂度上有界时,HSIC损失是否在一致收敛下具有可学习性?
  • RQ4在源域和逐渐偏移的目标域上,基于HSIC的训练与标准交叉熵训练相比,性能表现如何?
  • RQ5HSIC损失是否能在具有显著领域偏移的真实世界基准(如显微图像分类)上实现最先进性能?

主要发现

  • 在cell out of sample数据集上,HSIC损失模型在Target1上达到99.2%准确率,Target2上为98.8%,Target3上为93.4%,Target4上为95.3%,优于交叉熵模型。
  • 基于HSIC的模型在最具挑战性的目标分布(Target3和Target4)上实现了最先进性能,而交叉熵模型表现显著下降。
  • 即使不使用测试时增强,HSIC模型在所有目标集上的性能也与使用增强的交叉熵模型持平或更优。
  • HSIC模型在源分布上保持了高性能(Target1上为99.2%),表明其在原始分布上无性能退化。
  • 该方法在无需访问目标域数据的情况下展现出对分布偏移的鲁棒性,验证了其无监督特性。
  • 理论分析表明,当分布偏移在RKHS复杂度上有界时,HSIC损失在一致收敛下具有可学习性,支持其泛化特性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。