Skip to main content
QUICK REVIEW

[论文解读] Disjoint Multi-task Learning between Heterogeneous Human-centric Tasks

Dong-Jin Kim, Jinsoo Choi|arXiv (Cornell University)|Feb 14, 2018
Human Pose and Action Recognition参考文献 43被引用 3
一句话总结

本文提出了一种新颖的交替方向优化方法,用于在异构以人为中心的任务——动作分类与视频字幕生成——之间进行不相交的多任务学习,使用独立的单任务数据集。通过引入温度缩放的知识蒸馏并缓解灾难性遗忘,该模型在两项任务上均实现了最先进性能,优于单任务和标准多任务基线模型。

ABSTRACT

Human behavior understanding is arguably one of the most important mid-level components in artificial intelligence. In order to efficiently make use of data, multi-task learning has been studied in diverse computer vision tasks including human behavior understanding. However, multi-task learning relies on task specific datasets and constructing such datasets can be cumbersome. It requires huge amounts of data, labeling efforts, statistical consideration etc. In this paper, we leverage existing single-task datasets for human action classification and captioning data for efficient human behavior learning. Since the data in each dataset has respective heterogeneous annotations, traditional multi-task learning is not effective in this scenario. To this end, we propose a novel alternating directional optimization method to efficiently learn from the heterogeneous data. We demonstrate the effectiveness of our model and show performance improvements on both classification and sentence retrieval tasks in comparison to the models trained on each of the single-task datasets.

研究动机与目标

  • 解决在无共享标注的不相交异构数据集上训练多任务模型的挑战。
  • 在每个样本仅包含单一任务标签的数据集上训练时,缓解灾难性遗忘问题。
  • 通过联合学习独立的动作数据集与字幕数据集,提升动作分类与句子检索的性能。
  • 验证具有不同理解水平的人为中心任务可通过共享表征学习相互受益。

提出的方法

  • 提出一种交替方向优化框架,在训练某一任务数据的同时,通过基于知识蒸馏的损失保留另一任务的知识。
  • 采用温度超参数 T=2 的知识蒸馏,实现任务间软标签分布的迁移,增强特征对齐。
  • 使用共享主干网络进行特征提取,任务特定头用于分类与字幕生成。
  • 采用交叉熵损失与蒸馏损失的加权组合,最优 λ 值在 mAP 指标下为 λC=0.5 和 λS=0.7。
  • 引入两阶段训练流程:首先在单一数据集上训练;随后在不同数据集间交替训练,同时通过知识蒸馏保留知识。
  • 为字幕检索使用对比损失,为动作分类使用交叉熵损失,通过交替更新联合优化。

实验结果

研究问题

  • RQ1在异构以人为中心的任务之间进行不相交多任务学习,是否能超越单任务学习的性能?
  • RQ2在每个样本仅包含单一任务标签的数据集上训练时,如何缓解灾难性遗忘?
  • RQ3在联合训练设置中,动作分类与字幕生成损失的最优平衡是什么?
  • RQ4即使没有共享标注,从动作识别中学得的表征是否能提升字幕检索性能,反之亦然?

主要发现

  • 所提方法在动作分类与字幕检索任务上的 mAP 均高于单任务与标准多任务基线模型。
  • 采用 T=2 的知识蒸馏在各项指标上表现最佳,优于 L1、L2 与交叉熵损失。
  • 跨任务预测结果表明,模型能从动作数据生成语义相关的字幕,并能从字幕嵌入中准确预测动作。
  • 最优损失权重为 λC=0.5(字幕生成)与 λS=0.7(动作分类),表明非均匀权衡可提升性能。
  • 定性结果表明,模型泛化能力良好,能从动作数据生成合理字幕,并能从字幕嵌入中正确识别动作。
  • 该方法在不同数据模态下均具有通用性与有效性,表明异构以人为中心的任务可通过共享表征学习实现互补。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。