[论文解读] Variational Multi-Task Learning with Gumbel-Softmax Priors
该论文提出了变分多任务学习(VMTL),一种概率贝叶斯框架,通过使用Gumbel-Softmax学习的先验来建模任务相关性,联合推断任务特定的表征和分类器。通过利用可微分的混合权重,将每个任务的先验条件化为其他任务的变分后验,VMTL 实现了在表征和分类器之间统一、数据驱动的知识迁移,在五个多任务基准上实现了最先进性能,尤其在数据有限的情况下表现优异。
Multi-task learning aims to explore task relatedness to improve individual tasks, which is of particular significance in the challenging scenario that only limited data is available for each task. To tackle this challenge, we propose variational multi-task learning (VMTL), a general probabilistic inference framework for learning multiple related tasks. We cast multi-task learning as a variational Bayesian inference problem, in which task relatedness is explored in a unified manner by specifying priors. To incorporate shared knowledge into each task, we design the prior of a task to be a learnable mixture of the variational posteriors of other related tasks, which is learned by the Gumbel-Softmax technique. In contrast to previous methods, our VMTL can exploit task relatedness for both representations and classifiers in a principled way by jointly inferring their posteriors. This enables individual tasks to fully leverage inductive biases provided by related tasks, therefore improving the overall performance of all tasks. Experimental results demonstrate that the proposed VMTL is able to effectively tackle a variety of challenging multi-task learning settings with limited training data for both classification and regression. Our method consistently surpasses previous methods, including strong Bayesian approaches, and achieves state-of-the-art performance on five benchmark datasets.
研究动机与目标
- 为解决每个任务训练数据有限时的多任务学习挑战,避免单个模型过拟合。
- 在统一的概率框架中实现跨任务共享表征和分类器的联合学习。
- 通过可学习先验,以可微分、数据驱动的方式建模复杂、非线性的任务相关性。
- 通过合理的不确定性建模,利用相关任务的归纳偏置来提升泛化能力。
- 在低数据、少样本多任务设置下,超越现有的贝叶斯方法和深度多任务学习方法。
提出的方法
- VMTL 将多任务学习建模为对任务特定表征和分类器的联合变分推断问题。
- 为每个任务的潜在变量引入条件先验,其中先验是其他相关任务变分后验的可学习混合。
- 先验混合权重通过 Gumbel-Softmax 重参数化技巧参数化,支持端到端反向传播。
- 模型联合优化变分后验参数以及用于任务相关先验选择的 Gumbel-Softmax 温度和 logits。
- 引入了近似推理(VMTL-AC),通过在任务间共享分类器生成机制,加速训练过程。
- 该框架适用于具有共享标签/目标空间但输入领域不同的分类和回归任务。
实验结果
研究问题
- RQ1统一的变分贝叶斯框架能否联合利用表征和分类器中的共享知识,实现多任务学习?
- RQ2如何以可微分、数据驱动的方式建模任务相关性,以在低数据场景下提升性能?
- RQ3使用 Gumbel-Softmax 学习其他任务后验的混合先验,是否能比固定或启发式先验带来更好的泛化性能?
- RQ4在少样本多任务学习中,结合不确定性建模的变分推断是否能优于点估计或启发式正则化方法?
- RQ5在低数据设置下,该方法对分布偏移和对抗性样本的鲁棒性如何?
主要发现
- VMTL 在五个多任务学习基准上均达到最先进性能,持续超越强基准的贝叶斯和深度学习方法。
- 在最具挑战性的 5% 训练数据划分下,VMTL 在 CUB-200-2011 数据集上达到 25.2% 的准确率,显著优于次优方法(20.6%)。
- VMTL-AC 由于采用近似推理,收敛速度优于 VMTL,同时保持了具有竞争力的性能。
- 模型对对抗性攻击表现出鲁棒性,可能归因于分类器生成中使用了均值特征表示。
- 在旋转 MNIST 回归任务中,VMTL 和 VMTL-AC 的平均 NMSE 最低,VMTL 为 17.1 ± 0.1,VMTL-AC 为 17.5 ± 0.1。
- VMTL 超越了甚至贝叶斯方法(如 Bakker 等 [4])和点估计方法(如 Long 等 [36]),证明了结合不确定性建模的变分推断的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。