[论文解读] Same Representation, Different Attentions: Shareable Sentence Representation Learning from Multiple Tasks
本文提出了一种多任务学习框架,所有任务共享单一通用的句子表征,通过任务特定的注意力机制动态选择相关特征。在16个文本分类任务上的实验表明,该方法提升了性能,加快了收敛速度,并增强了迁移能力,尤其在引入POS标注和短语切分等辅助任务时效果更显著。
Distributed representation plays an important role in deep learning based natural language processing. However, the representation of a sentence often varies in different tasks, which is usually learned from scratch and suffers from the limited amounts of training data. In this paper, we claim that a good sentence representation should be invariant and can benefit the various subsequent tasks. To achieve this purpose, we propose a new scheme of information sharing for multi-task learning. More specifically, all tasks share the same sentence representation and each task can select the task-specific information from the shared sentence representation with attention mechanism. The query vector of each task's attention could be either static parameters or generated dynamically. We conduct extensive experiments on 16 different text classification tasks, which demonstrate the benefits of our architecture.
研究动机与目标
- 为解决缺乏适用于多种自然语言处理任务的通用、可迁移句子表征的问题。
- 克服从零开始训练任务特定表征的局限性,后者需要大量标注数据集。
- 通过在任务间共享单一句子表征并允许任务特定的特征选择,提升模型效率与性能。
- 通过在多任务学习框架中引入辅助序列标注任务(如POS标注、短语切分),提升迁移能力与泛化能力。
提出的方法
- 所有任务共享通过共享编码器(如BiLSTM)学习到的单一共享句子表征,消除了任务特定的表征层。
- 每个任务使用可学习或动态生成的查询向量,通过注意力机制关注共享表征中的任务相关部分。
- 注意力机制对共享隐藏状态计算加权和,使每个任务能够聚焦于同一句子的不同语义方面。
- 将POS标注和短语切分等辅助任务与主要分类任务联合训练,共享相同的句子编码层。
- 模型采用端到端训练,分类与序列标注任务使用交叉熵损失,任务间共享参数。
- 该架构支持注意力分布的可视化,揭示了每个任务所强调的词语或短语。
实验结果
研究问题
- RQ1是否可以有效利用单一共享句子表征于多个自然语言处理任务,同时仍捕捉任务特定的细微差别?
- RQ2基于注意力的特征选择从共享表征中与传统的私有-共享架构相比,在多任务学习中表现如何?
- RQ3辅助序列标注任务在多大程度上能提升共享句子表征的质量,以用于下游分类任务?
- RQ4与现有多任务学习基线相比,所提出的模型是否实现了更快的收敛速度与更好的泛化能力?
主要发现
- 所提出的SA-MTL模型在16个情感分类任务上达到最先进性能,优于SSP-MTL与PSP-MTL基线模型。
- 引入如短语切分与POS标注等辅助任务可带来显著性能提升,其中DA-MTL在CoNLL-2000数据集上达到89.04%的平均精确率。
- 由于共享表征与基于注意力的选择机制,该模型收敛更快且参数效率更高,优于现有多任务学习架构。
- 可视化结果表明,模型能正确识别情感分类任务中的情感相关短语(如“easy to use”)与领域分类任务中的领域相关术语(如“infantile cart”),即使在联合训练下亦然。
- 训练时包含辅助任务(如短语切分)的模型展现出更强鲁棒性,能正确区分介词短语与动词短语,从而在模糊情况下做出正确的情感预测。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。