Skip to main content
QUICK REVIEW

[论文解读] Deep Multi-Task Learning via Generalized Tensor Trace Norm

Yi Zhang, Yu Zhang|arXiv (Cornell University)|Feb 12, 2020
Tensor decomposition and applications参考文献 29被引用 4
一句话总结

本文提出了一种广义张量迹范数(GTTN),用于深度多任务学习,通过结合所有可能的张量展平方式的矩阵迹范数,捕捉参数张量中所有可能的低秩结构。该方法学习最优的组合权重,实现对各展平方式重要性的自动估计,并在真实世界数据集上优于现有张量迹范数,性能得到提升。

ABSTRACT

The trace norm is widely used in multi-task learning as it can discover low-rank structures among tasks in terms of model parameters. Nowadays, with the emerging of big datasets and the popularity of deep learning techniques, tensor trace norms have been used for deep multi-task models. However, existing tensor trace norms cannot discover all the low-rank structures and they require users to manually determine the importance of their components. To solve those two issues together, in this paper, we propose a Generalized Tensor Trace Norm (GTTN). The GTTN is defined as a convex combination of matrix trace norms of all possible tensor flattenings and hence it can discover all the possible low-rank structures. In the induced objective function, we will learn combination coefficients in the GTTN to automatically determine the importance. Experiments on real-world datasets demonstrate the effectiveness of the proposed GTTN.

研究动机与目标

  • 解决现有张量迹范数因仅使用部分可能的张量展平方式而遗漏某些低秩结构的局限性。
  • 克服现有方法中假设所有张量展平方式重要性相等所导致的次优性能问题。
  • 构建统一的正则化框架,通过数据驱动的组合系数自动学习不同张量展平方式的重要性。
  • 通过揭示哪些张量轴或展平方式对学习到的低秩结构贡献最大,提升模型可解释性。
  • 提供GTTN的理论分析,包括其对偶范数和泛化界,以支持其在实际应用中的可靠性。

提出的方法

  • 将GTTN定义为对p阶参数张量所有可能张量展平方式的矩阵迹范数的凸组合。
  • 将GTTN中的组合系数视为可学习参数,通过平衡正则化与任务特定损失的目标函数进行优化。
  • 采用一种张量展平策略,考虑将p阶张量重排为矩阵的所有2^p - 2种可能方式,重点关注具有不同迹范数的展平方式(共2^{p-1} - 1种唯一形式)。
  • 构建包含GTTN和任务特定损失的正则化优化问题,支持在深度学习模型中端到端训练。
  • 分析GTTN的对偶范数,并推导其泛化界,以提供理论保障。
  • 在多个真实世界数据集(包括ImageCLEF、Office-31、Office-Home和Office-Caltech10)上实现并评估该方法,使用不同网络层(pool5、fc7)的特征。

实验结果

研究问题

  • RQ1是否一种包含所有可能张量展平方式的广义张量迹范数,能够比现有张量迹范数捕捉到更全面的低秩结构?
  • RQ2学习张量展平方式的组合系数是否能带来优于假设所有分量重要性相等的性能提升?
  • RQ3所学习的组合系数能否提供可解释性洞察,揭示哪些张量轴或结构模式对多任务学习问题最为关键?
  • RQ4GTTN的计算复杂度如何随张量阶数增长?是否适用于实际的深度学习应用?
  • RQ5与最先进多任务学习方法相比,GTTN在真实世界基准上的泛化性能如何?

主要发现

  • GTTN在ImageCLEF、Office-31、Office-Home和Office-Caltech10数据集上均优于最先进多任务学习基线方法,表现出一致的性能提升。
  • GTTN中学习到的组合系数(α)在不同数据集和训练比例下呈现差异,表明不同张量展平方式的重要性具有数据依赖性。
  • 在使用fc7特征、λ=0.25的ImageCLEF数据集中,θ分别为0.5、0.6和0.7时,α值分别为0.3718、0.2154和0.4128,表明其能动态适应训练数据。
  • 在使用fc7特征、λ=0.65的Office-31数据集中,θ=0.7时,α值变为0.3279、0.2399和0.4322,反映出随着数据可用性变化,结构重要性也随之改变。
  • GTTN在所有测试数据集和特征层上均取得最佳性能,证实其能够捕捉多样化的低秩结构。
  • 理论分析表明,GTTN具有明确定义的对偶范数和泛化界,支持其在统计学习中的应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。