Skip to main content
QUICK REVIEW

[论文解读] Target-Embedding Autoencoders for Supervised Representation Learning

Daniel Jarrett, Mihaela van der Schaar|arXiv (Cornell University)|Jan 23, 2020
Topic Modeling参考文献 77被引用 5
一句话总结

本文提出了目标嵌入自编码器(Tea),一种监督表示学习框架,通过联合优化潜在表征,使其既能从输入特征中预测,又能预测高维目标。通过在目标嵌入上引入辅助重建损失,Tea 在无需显式正则化的情况下提升了泛化性能,在线性与非线性循环架构的多变量序列预测任务中均取得了最先进性能,其有效性已在真实世界医疗数据上得到验证。

ABSTRACT

Autoencoder-based learning has emerged as a staple for disciplining representations in unsupervised and semi-supervised settings. This paper analyzes a framework for improving generalization in a purely supervised setting, where the target space is high-dimensional. We motivate and formalize the general framework of target-embedding autoencoders (TEA) for supervised prediction, learning intermediate latent representations jointly optimized to be both predictable from features as well as predictive of targets---encoding the prior that variations in targets are driven by a compact set of underlying factors. As our theoretical contribution, we provide a guarantee of generalization for linear TEAs by demonstrating uniform stability, interpreting the benefit of the auxiliary reconstruction task as a form of regularization. As our empirical contribution, we extend validation of this approach beyond existing static classification applications to multivariate sequence forecasting, verifying their advantage on both linear and nonlinear recurrent architectures---thereby underscoring the further generality of this framework beyond feedforward instantiations.

研究动机与目标

  • 为解决在目标空间高维的监督设置中学习有效表征的挑战,例如多标签分类或多变量序列预测。
  • 形式化一个统一框架——目标嵌入自编码器(Tea),利用目标嵌入的辅助重建任务,提升纯监督学习中的泛化性能。
  • 通过线性情况下的统一稳定性,提供泛化性能的理论保证,将辅助任务解释为一种隐式正则化形式。
  • 在静态分类之外进行实证验证,将 Tea 的应用扩展至非线性循环架构,用于多变量序列预测。
  • 在分布偏移场景下,包括在不同患者人群等分布外数据上的医疗预测任务中,展示 Tea 的鲁棒性。

提出的方法

  • Tea 使用共享编码器 φ: X → Z,将输入特征 x 映射到潜在表征 z,该表征同时用于目标预测 d: Z → Y 和目标嵌入重建 r: Z → Y。
  • 模型通过复合损失端到端训练:L = (1/N)Σ[ℓ_p(ŷ_n, y_n) + ℓ_r(ỹ_n, y_n)],其中 ℓ_p 为主要预测损失,ℓ_r 为针对目标嵌入的辅助重建损失。
  • 该框架适用于任意底层架构,包括前馈神经网络与循环神经网络,支持连续与离散目标空间。
  • 采用分阶段训练流程:首先在重建任务上预训练编码器,然后联合微调编码器与预测头,最后对完整模型进行微调。
  • 理论分析建立了线性 Tea 的统一稳定性,显示不稳定性具有 O(1/N) 的界,表明无需基于范数的显式正则化即可实现泛化。
  • 实证评估使用真实世界多变量疾病轨迹数据集(如 UKCF),在线性与非线性循环模型中对比 Tea 与标准基线方法。

实验结果

研究问题

  • RQ1在目标空间高维的纯监督学习中,目标嵌入的辅助重建是否能提升泛化性能?
  • RQ2Tea 中的辅助重建任务是否可作为隐式正则化形式,且能否从理论上加以证明?
  • RQ3Tea 是否能超越静态分类任务,在复杂的时间序列预测任务(如多变量疾病轨迹预测)中实现泛化?
  • RQ4在分布偏移场景下(如在不同患者人口统计学特征的数据上测试),Tea 的表现如何?
  • RQ5Tea 的分阶段训练流程中,最优训练顺序是什么?是否会影响最终性能?

主要发现

  • Tea 在多变量序列预测任务中实现了最先进性能,在真实世界医疗数据集上的线性与非线性循环架构中均显著优于标准基线方法。
  • 在线性情况下,Tea 展现出统一稳定性,不稳定性具有 O(1/N) 的界,为辅助重建任务的泛化优势提供了理论依据。
  • 在 UKCF 数据集中,Tea 在感染预测上的平均 AUC 为 0.767 ± 0.026,在共病预测上的平均 AUC 为 0.767 ± 0.042,显著优于次优方法。
  • 在精确率与召回率方面,Tea 分别达到 0.559 ± 0.060 (Prc(c)) 和 0.450 ± 0.035 (Prc(i)),与对比方法相比具有统计显著性提升(p < 0.05)。
  • 模型对分布偏移表现出鲁棒性,在分布外数据(如男性与女性患者)上测试时,性能无统计显著下降,表明其具有强泛化能力。
  • 敏感性分析确认训练顺序具有影响:'1-2-3' 顺序(先预训练编码器,再联合微调,最后完整微调)优于其他顺序,如 '3-1-2',其表现几乎等同于仅使用 '1-2' 的情况。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。