[论文解读] Multi-Task Learning for Sequence Tagging: An Empirical Study
该论文在11个序列标注任务上对三种多任务学习方法进行实证比较,结果显示 All 或 Oracle MTL 在大约一半的情形优于 STL,并揭示了任务之间的关系和将任务在语义上聚类的嵌入。
We study three general multi-task learning (MTL) approaches on 11 sequence tagging tasks. Our extensive empirical results show that in about 50% of the cases, jointly learning all 11 tasks improves upon either independent or pairwise learning of the tasks. We also show that pairwise MTL can inform us what tasks can benefit others or what tasks can be benefited if they are learned jointly. In particular, we identify tasks that can always benefit others as well as tasks that can always be harmed by others. Interestingly, one of our MTL approaches yields embeddings of the tasks that reveal the natural clustering of semantic and syntactic tasks. Our inquiries have opened the doors to further utilization of MTL in NLP.
研究动机与目标
- 研究多任务联合学习是否在多于两任务时相对于 STL 或简单的两两 MTL 提供额外收益。
- 表征任务之间的关系,识别哪些任务在 MTL 中对其他任务有帮助或有害。
- 探究不同的 MTL 架构如何影响在不同标签集合上的共享与性能。
- 评估是否存在可提升性能的 Oracle 有益任务集合相对于 All MTL 和 STL。
提出的方法
- 描述并实现三种 MTL 框架:Multi-Dec(共享编码器,多个解码器),TE ⊕ Dec(共享编码器和解码器,向解码器输入任务嵌入),TE ⊕ Enc(把任务嵌入拼到输入给编码器)。
- 使用基于 biRNN 的通用编码器/解码器设置,GRU 单元和 CRF 分类器覆盖 11 个序列标注任务。
- 用跨任务的平衡小批量策略进行训练,并以 span 基的微平均 F1 分数评估;比较 STL、Pairwise MTL、All MTL、Oracle MTL,以及 All-but-one MTL 设置。
- 从成对结果构建 Oracle 集合,选择在测试任务上优于 STL 的任务,分析 Oracle 与 All MTL 的比较。
- 提供广泛的跨任务分析,包括成对收益/损害图和任务贡献表。
- 实验设置使用如 UD v1.4、CoNLL-2000/2003、Streusle、SemCor 等数据集,及论文中列出的标签空间和熵。
实验结果
研究问题
- RQ1把不止两个任务联合学习,是否能在序列标注上提高性能,相对于 STL 或简单的两两 MTL?
- RQ2任务之间存在哪些成对的有益或有害关系;当学习所有任务时,这些关系如何放大/缩小?
- RQ3基于 Oracle 的有益任务选择是否始终优于 All MTL,以及在何种条件下?
- RQ4是否存在能显现语义与句法任务自然聚类的任务嵌入?
主要发现
- 在大约 50% 的情形下,All 或 Oracle MTL 相较于 STL 或成对学习,在 11 个任务上有所提升。
- 成对 MTL 显示出明确的有益/有害关系;某些任务(如 mwe、supSense、semtr、hyp)往往对其他任务有益,而其他任务(如 com、frame、hyp)则可能有害。
- All MTL 往往能匹配或超越成对 MTL,而且在许多情形下被 Oracle MTL 超越,后者利用了已识别的有益任务。
- 在 TE 基模型中使用的任务嵌入得到的嵌入将句法任务与语义任务聚类,表明具有意义的任务表示。
- 在若干任务(特别是 com)中,即使没有单个成对任务能提升 STL,All MTL 仍可优于 STL,表明任务间的有益正则化。
- 成对 MTL 对 All MTL 的预测力存在但不完美;方向通常可靠,但幅度不易预测。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。