Skip to main content
QUICK REVIEW

[论文解读] Semi-Generative Modelling: Covariate-Shift Adaptation with Cause and Effect Features

Julius von Kügelgen, Alexander Mey|arXiv (Cornell University)|Jul 20, 2018
Neural Networks and Applications被引用 13
一句话总结

该论文提出了一种半生成模型 $P(Y,X_E|X_C,\theta)$,通过利用原因特征 ($X_C$) 和结果特征 ($X_E$) 来改进半监督学习中的协变量偏移适应。通过使用未标注的目标数据建模从原因到结果的直接映射,该方法在合成数据和真实世界分类与回归任务中,显著优于纯监督学习和重要性加权基线方法。

ABSTRACT

Current methods for covariate-shift adaptation use unlabelled data to compute importance weights or domain-invariant features, while the final model is trained on labelled data only. Here, we consider a particular case of covariate shift which allows us also to learn from unlabelled data, that is, combining adaptation with semi-supervised learning. Using ideas from causality, we argue that this requires learning with both causes, $X_C$, and effects, $X_E$, of a target variable, $Y$, and show how this setting leads to what we call a semi-generative model, $P(Y,X_E|X_C,θ)$. Our approach is robust to domain shifts in the distribution of causal features and leverages unlabelled data by learning a direct map from causes to effects. Experiments on synthetic data demonstrate significant improvements in classification over purely-supervised and importance-weighting baselines.

研究动机与目标

  • 解决在目标域标注数据稀缺时协变量偏移适应的挑战。
  • 探究在已知因果结构的前提下,协变量偏移假设下半监督学习是否可行。
  • 提出一种通过利用原因和结果特征联合学习目标域未标注数据的方法。
  • 通过引入因果结构,克服传统半监督学习假设数据独立同分布的局限性。
  • 提供一种结合重要性加权和结果特征无监督建模的稳健领域自适应框架。

提出的方法

  • 提出半生成模型 $P(Y,X_E|X_C,\theta)$,用于建模在原因特征 $X_C$ 条件下目标变量 $Y$ 和结果特征 $X_E$ 的联合分布。
  • 使用未标注的目标域数据估计 $P(X_C, X_E|D=1)$,并将其分解为 $P(X_C|D=1)P(X_E|X_C)$,以指导无监督组件。
  • 通过最大化源数据监督对数似然与目标数据无监督对数似然的加权组合来训练模型,其中超参数 $\lambda$ 控制两者的权重。
  • 利用无监督组件学习从原因 $X_C$ 到结果 $X_E$ 的直接映射,从而在协变量偏移下实现更好的泛化性能。
  • 将模型应用于分类与回归任务,针对每类任务进行特定调整,包括在高方差场景下对模型参数施加限制。
  • 通过构建加权池化对数似然 $\ell_{WP}^\lambda$ 将该方法与重要性加权相结合,以进一步提升性能。

实验结果

研究问题

  • RQ1当已知因果结构时,协变量偏移假设下半监督学习是否仍具有效性?
  • RQ2在领域自适应设置中,同时学习原因和结果特征是否能提升模型泛化能力?
  • RQ3通过结果特征引入未标注目标数据,与重要性加权或纯监督学习相比有何优势?
  • RQ4模型灵活性,特别是 $Y$ 的潜在空间中的灵活性,在该方法成功中起到何种作用?
  • RQ5在何种场景下,该方法优于基于特征变换的领域自适应技术?

主要发现

  • 在合成分类数据上,所提方法在高类别重叠情况下,负对数似然和误差率均显著低于纯监督学习和重要性加权基线方法。
  • 在玩具 LUCAS 数据集上,使用 256 个未标注目标样本和 16 个源样本时,该方法将测试误差降低至 0.188,优于基线方法。
  • 在更简单的 ${\cal D}_1$ 回归数据集上,当仅有四个标注源样本时,该方法实现了最低的 RMSE,展现出强大的 few-shot 性能。
  • 在更具挑战性的 ${\cal D}_2$ 数据集上,所提方法的受限版本取得了最佳 RMSE,优于基线方法和特征变换方法。
  • 该方法在回归任务中对超参数 $\lambda$ 敏感,若过度强调未标注数据,可能导致过拟合,尤其在 $n_T$ 较大时。
  • 该方法计算效率高,运行时间约为 TCA 等特征变换方法的十分之一。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。