Skip to main content
QUICK REVIEW

[论文解读] Minimax Multi-Task Learning and a Generalized Loss-Compositional Paradigm for MTL

Nishant A. Mehta, Dongryeol Lee|arXiv (Cornell University)|Sep 13, 2012
Domain Adaptation and Few-Shot Learning参考文献 15被引用 6
一句话总结

本文提出最小最大多任务学习(minimax multi-task learning, MTL),一种新的MTL公式化方法,通过最小化任务间最大经验风险来提升鲁棒性,并提出一种广义的损失组合范式,通过连续松弛化统一经典MTL与最小最大MTL。理论上,最小最大MTL可降低新任务上的最坏情况测试风险;实验上,其在最大风险目标下优于标准MTL,尤其在数据有限或模型容量较高时表现更优。

ABSTRACT

Since its inception, the modus operandi of multi-task learning (MTL) has been to minimize the task-wise mean of the empirical risks. We introduce a generalized loss-compositional paradigm for MTL that includes a spectrum of formulations as a subfamily. One endpoint of this spectrum is minimax MTL: a new MTL formulation that minimizes the maximum of the tasks' empirical risks. Via a certain relaxation of minimax MTL, we obtain a continuum of MTL formulations spanning minimax MTL and classical MTL. The full paradigm itself is loss-compositional, operating on the vector of empirical risks. It incorporates minimax MTL, its relaxations, and many new MTL formulations as special cases. We show theoretically that minimax MTL tends to avoid worst case outcomes on newly drawn test tasks in the learning to learn (LTL) test setting. The results of several MTL formulations on synthetic and real problems in the MTL and LTL test settings are encouraging.

研究动机与目标

  • 为解决经典MTL的局限性,即最小化平均任务风险可能导致最坏情况任务表现不佳。
  • 提出一种新的MTL公式化方法——最小最大MTL,通过最小化所有任务中的最大经验风险,以确保对最坏情况结果的鲁棒性。
  • 构建一种广义的损失组合范式,将经典MTL、最小最大MTL及中间松弛形式统一于单一框架中。
  • 在最大风险与平均风险标准下,评估最小最大MTL与松弛MTL公式在多任务学习与元学习设置下的性能。
  • 提供理论依据,证明最小化最大经验风险可限制新任务上的真实最坏情况风险。

提出的方法

  • 提出最小最大MTL作为新的MTL目标,其最小化所有任务经验风险的最大值,而非其总和或平均值。
  • 引入一个以α为参数的连续松弛族,其中α = 1时恢复最小最大MTL,α = 0时恢复经典MTL。
  • 提出一种广义的损失组合范式,作用于经验风险向量,并将ℓp MTL公式作为特例。
  • 将该框架应用于多任务学习(MTL)与元学习(LTL),结合共享表示学习与任务特定预测器微调。
  • 对共享权重矩阵使用迹范数正则化,以控制模型容量并防止过拟合。
  • 通过交叉验证与在合成数据及真实数据集(个人电脑、MNIST及其他两个)上的受控实验,比较不同模型容量与数据规模下的公式表现。

实验结果

研究问题

  • RQ1在多任务学习中,最小化任务间最大经验风险是否能带来更好的最坏情况泛化性能?
  • RQ2广义损失组合范式能否通过连续松弛谱统一经典MTL与最小最大MTL?
  • RQ3在不同数据集与模型容量下,最小最大MTL与松弛MTL公式相较于ℓ₁ MTL在最大与平均测试风险上的表现如何?
  • RQ4当模型容量相对于训练数据较高时,最小最大MTL是否表现出更强的抗过拟合能力?
  • RQ5是否存在理论依据,解释为何最小化最大经验风险可限制新任务上的真实最坏情况风险?

主要发现

  • 在个人电脑与MNIST数据集上,最小最大MTL在最大测试风险目标下优于ℓ₁ MTL,尤其在模型容量受限时表现更优。
  • 在MNIST数据集上,随着模型容量降低,最小最大MTL与ℓ₁ MTL之间的性能差距进一步扩大,验证了其在数据稀缺下的鲁棒性。
  • 在最大风险目标下,(0.1T)-minimax与(0.2T)-minimax MTL公式在任务特定容量较高的场景中,常优于ℓ₁ MTL甚至最小最大MTL。
  • 在元学习设置中,最小最大MTL与(0.1T)-minimax MTL在最大RMSE目标下优于ℓ₁ MTL,尤其在共享容量适中时表现更优。
  • 当共享容量较高时,ℓ₁ MTL在平均RMSE目标下表现最佳,表明公平性与平均性能之间存在权衡。
  • 理论分析(定理1)表明,若最大经验风险被γ有界,则新任务上的真实最坏情况风险也极大概率被γ有界,从而为最小最大方法提供了理论支持。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。