Skip to main content
QUICK REVIEW

[论文解读] Feature Partitioning for Efficient Multi-Task Architectures

Alejandro Newell, Lu Jiang|arXiv (Cornell University)|Aug 12, 2019
Domain Adaptation and Few-Shot Learning参考文献 38被引用 11
一句话总结

本文提出了一种多任务神经网络中特征划分的紧凑参数化方法,以在资源约束下实现对参数共享策略的高效搜索。通过使用特征蒸馏实现快速架构评估,该方法发现了在每项任务上参数使用量更低但准确率更高的多任务模型,在 Visual Decathlon 上优于基线方法。

ABSTRACT

Multi-task learning holds the promise of less data, parameters, and time than training of separate models. We propose a method to automatically search over multi-task architectures while taking resource constraints into consideration. We propose a search space that compactly represents different parameter sharing strategies. This provides more effective coverage and sampling of the space of multi-task architectures. We also present a method for quick evaluation of different architectures by using feature distillation. Together these contributions allow us to quickly optimize for efficient multi-task models. We benchmark on Visual Decathlon, demonstrating that we can automatically search for and identify multi-task architectures that effectively make trade-offs between task resource requirements while achieving a high level of final performance.

研究动机与目标

  • 为解决自动发现高效多任务架构的挑战,该架构需在性能与资源使用之间取得平衡。
  • 通过紧凑表示共享策略,降低多任务架构空间中搜索的计算成本。
  • 利用特征蒸馏作为全量训练的代理,加速架构评估。
  • 在不同任务之间优化参数效率与模型准确率之间的权衡。
  • 在现实资源约束下,于多样化基准 Visual Decathlon 上验证该方法的有效性。

提出的方法

  • 提出一种紧凑的特征划分参数化方法,通过矩阵 P 表示共享策略,减少冗余,并实现对架构空间的高效搜索。
  • 使用特征蒸馏,通过从教师模型向在部分特征上训练的学生模型迁移知识,快速估计候选划分策略的性能。
  • 采用结合梯度更新的进化策略探索搜索空间,优化在每项任务参数使用量约束下的准确率。
  • 引入可微且可解释的特征共享表示,实现对每项任务共享或分配通道数量的细粒度控制。
  • 通过在数据集的蒸馏版本上仅训练少量步骤来评估候选架构,其性能与全量训练的准确率高度相关。
  • 通过权重衰减惩罚控制优化过程中的资源使用,支持针对特定计算预算的调优。

实验结果

研究问题

  • RQ1如何高效搜索涉及特征共享与任务特定容量分配的庞大多任务架构配置空间?
  • RQ2特征蒸馏能否在多任务设置中提供可靠且快速的全量训练性能代理?
  • RQ3与固定或随机共享策略相比,显式参数化特征共享在性能上有多大提升?
  • RQ4在使用自适应特征划分时,不同任务之间参数使用与准确率的权衡如何变化?
  • RQ5在资源约束下,结合蒸馏反馈的进化搜索能否发现优于人工设计或均匀划分基线的架构?

主要发现

  • 所提方法在降低每项任务平均特征通道使用量的同时,验证准确率高于多种基线划分策略(如独立、半共享、全共享)。
  • 结合蒸馏反馈的进化搜索在使用 4×P100 GPU 的情况下,五小时内完成搜索,仅评估了 1000 个样本,即发现高性能架构。
  • 特征蒸馏与最终验证准确率高度相关,可在无需全量训练的情况下实现可靠且快速的性能估计。
  • 通过矩阵 P 显式参数化共享至关重要——不同共享模式下的性能差异显著,尤其在低资源使用时。
  • 在低平均参数使用量下,最优划分策略对性能影响更大,凸显智能共享设计的重要性。
  • 该方法能有效探索性能-资源权衡的前沿,揭示当资源受限时,性能增益对划分选择最为敏感。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。