[论文解读] Transfer Learning for Sequences via Learning to Collocate
该论文提出ART(对齐循环迁移),一种用于序列的新型迁移学习框架,通过注意力机制学习跨域词共现,实现细粒度的单元级信息迁移。通过将源域序列中对应位置及共现位置的隐藏状态对齐并迁移至目标域的每个RNN单元,ART在序列标注和分类任务中表现更优,F1得分最高提升2.2%。
Transfer learning aims to solve the data sparsity for a target domain by applying information of the source domain. Given a sequence (e.g. a natural language sentence), the transfer learning, usually enabled by recurrent neural network (RNN), represents the sequential information transfer. RNN uses a chain of repeating cells to model the sequence data. However, previous studies of neural network based transfer learning simply represents the whole sentence by a single vector, which is unfeasible for seq2seq and sequence labeling. Meanwhile, such layer-wise transfer learning mechanisms lose the fine-grained cell-level information from the source domain. In this paper, we proposed the aligned recurrent transfer, ART, to achieve cell-level information transfer. ART is under the pre-training framework. Each cell attentively accepts transferred information from a set of positions in the source domain. Therefore, ART learns the cross-domain word collocations in a more flexible way. We conducted extensive experiments on both sequence labeling tasks (POS tagging, NER) and sentence classification (sentiment analysis). ART outperforms the state-of-the-arts over all experiments.
研究动机与目标
- 解决层级迁移学习的局限性,后者会丢弃细粒度的单元级信息,且在seq2seq和序列标注任务中不可行。
- 通过利用领域相关的小规模预训练语料而非大规模领域无关语料,提升低资源领域的迁移学习效果。
- 通过注意力机制学习跨域词共现,建模跨域的长期依赖关系。
- 通过整合源域中上下文相关的相关信息,实现目标域中词语更精确的语义表征。
提出的方法
- ART将目标域中的每个RNN单元扩展为接收来自源域相同位置及所有位置的隐藏状态,权重由学习得到的注意力分数决定。
- 注意力机制计算目标序列与源序列位置之间的对齐分数,以识别语义共现的词语,从而实现长程依赖的迁移。
- 模型采用预训练与微调的框架:首先在领域特定的源语料上进行预训练,然后在目标域的标注数据上进行微调。
- 对于每个目标词,ART结合源域对应位置的隐藏状态与所有源隐藏状态的加权和,其中权重由注意力分数确定。
- 该方法支持长期记忆(细胞状态c)和短期记忆(隐藏状态h)的迁移,支持判别性特征学习。
- ART具有通用性,适用于多种序列任务,包括词性标注、命名实体识别和情感分析。
实验结果
研究问题
- RQ1与层级迁移相比,单元级信息迁移是否能提升序列标注和seq2seq任务的性能?
- RQ2基于注意力的对齐在捕捉跨域词共现以建模长期依赖方面是否有效?
- RQ3在低资源目标领域中,基于小规模领域特定语料的预训练是否优于大规模领域无关预训练?
- RQ4当目标域训练数据有限时,ART是否仍能从源域迁移细粒度的语义信息?
主要发现
- ART在所有评估的序列标注任务中均优于当前最先进方法,在从PTB迁移到Twitter/0.1时,F1得分比HRN高出2.2%。
- ART在所有设置中均表现最佳,尤其在目标域数据中等丰富时(如Twitter/0.1),优于FLORS。
- 注意力矩阵的可视化结果表明,ART能突出显示语义上有意义的词语(如“pleased”、“easy to move”),注意力强度较强,表明共现学习有效。
- 长期记忆(c)和短期记忆(h)的注意力模式不同,表明ART能为不同类型的记忆捕捉到独特且具有判别性的特征。
- ART成功建模了长程依赖关系,例如即使“sometimes”与“hate”不相邻,也能实现信息迁移,从而在低资源设置下提升语义理解。
- ART表明,当源域与目标域密切相关时,领域相关的、小规模的预训练比大规模、领域无关的预训练更有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。