Skip to main content
QUICK REVIEW

[论文解读] Identifying beneficial task relations for multi-task learning in deep neural networks

Joachim Bingel, Anders Søgaard|arXiv (Cornell University)|Feb 27, 2017
Topic Modeling参考文献 18被引用 12
一句话总结

本文识别了在自然语言处理(NLP)序列标注任务中,深度神经网络进行多任务学习(MTL)时取得成功的关键预测特征。通过分析单任务学习曲线和数据集特性,研究发现当主任务的学习曲线早期趋于平缓(梯度较小)而辅助任务的学习曲线仍保持陡峭时,MTL的性能增益最大,这表明MTL有助于逃离局部极小值;此外,辅助任务的标签熵也是一个强有力的预测因子。

ABSTRACT

Multi-task learning (MTL) in deep neural networks for NLP has recently received increasing interest due to some compelling benefits, including its potential to efficiently regularize models and to reduce the need for labeled data. While it has brought significant improvements in a number of NLP tasks, mixed results have been reported, and little is known about the conditions under which MTL leads to gains in NLP. This paper sheds light on the specific task relations that can lead to gains from MTL models over single-task setups.

研究动机与目标

  • 系统性地确定在自然语言处理(NLP)任务中,深度神经网络进行多任务学习(MTL)在何种条件下能带来性能提升。
  • 识别数据集层面和训练动态特征,以在不重新调整超参数的情况下预测MTL的成功。
  • 探究任务相似性、标签分布或学习曲线模式是否主导了序列标注任务中MTL的有效性。
  • 评估数据量、标签熵和分布差异(JSD)作为MTL收益预测因子的作用。
  • 为实践者提供可操作的见解,以选择在NLP中对MTL有益的任务组合。

提出的方法

  • 在12个NLP序列标注任务中,使用共享的双向LSTM编码器执行了90项多任务学习实验。
  • 在多任务设置中复用单任务的超参数,以隔离任务关系的影响,排除超参数调优的干扰。
  • 从单任务训练曲线中提取了42个预测特征,包括在训练进度10%、20%、30%、50%和70%处的梯度。
  • 使用逻辑回归识别MTL收益最强的预测因子(以F1值相对于单任务基线的提升衡量)。
  • 分析了标签熵、词汇表中未登录词(OOV)率、Jensen-Shannon散度(JSD)以及特征表示的Frobenius范数等特征。
  • 通过比较逻辑回归模型中主任务与辅助任务特征系数的相对重要性,分析了主任务与辅助任务特征的相对影响。

实验结果

研究问题

  • RQ1哪些数据集层面和训练动态特征最能预测在深度神经网络进行序列标注时MTL的增益?
  • RQ2学习曲线模式(例如特定训练点处的梯度)在多大程度上能预测MTL是否能提升性能?
  • RQ3标签分布(熵)和数据平衡如何影响MTL的成功?标签均匀性是否是可靠的预测因子?
  • RQ4任务数据分布之间的Jensen-Shannon散度是否能预测MTL性能,如迁移学习中普遍假设的那样?
  • RQ5主任务与辅助任务之间的大小差异是否能预测MTL增益,还是在实践中其相关性较弱?

主要发现

  • MTL收益最强的预测因子是主任务在训练进度20%至30%处学习曲线的梯度(负系数:-0.297),表明主任务早期趋于平缓可提升MTL增益。
  • 辅助任务在训练进度10%处学习曲线的梯度也具有高度预测性(系数:0.267),梯度越陡峭,MTL增益越高。
  • 当主任务早期趋于平缓(梯度小)但辅助任务仍保持陡峭时,MTL效果最佳,这表明MTL有助于主任务逃离局部极小值。
  • 辅助任务的标签熵是一个强有力的预测因子(系数:-0.411),支持先前研究中关于均匀标签分布有助于MTL的结论。
  • 主任务的大小及其OOV率也具有预测能力,OOV率越高,MTL增益越大(系数:0.061)。
  • Jensen-Shannon散度(JSD)和数据集大小差异是弱预测因子,与迁移学习中的假设相矛盾,表明它们在本设置中对MTL成功的影响较弱。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。