[论文解读] TransferTransfo: A Transfer Learning Approach for Neural Network Based Conversational Agents
TransferTransfo 在 persona-chat 上使用多任务学习(下一个发话分类 + 语言建模)对一个 12-layer 解码器为主的 Transformer 进行微调,达到 ConvAI2 指标的最新绩效。
We introduce a new approach to generative data-driven dialogue systems (e.g. chatbots) called TransferTransfo which is a combination of a Transfer learning based training scheme and a high-capacity Transformer model. Fine-tuning is performed by using a multi-task objective which combines several unsupervised prediction tasks. The resulting fine-tuned model shows strong improvements over the current state-of-the-art end-to-end conversational models like memory augmented seq2seq and information-retrieval models. On the privately held PERSONA-CHAT dataset of the Conversational Intelligence Challenge 2, this approach obtains a new state-of-the-art, with respective perplexity, Hits@1 and F1 metrics of 16.28 (45 % absolute improvement), 80.7 (46 % absolute improvement) and 19.5 (20 % absolute improvement).
研究动机与目标
- 通过解决不一致性、缺乏长期记忆和生成通用回复来推动开放域聊天机器人改进。
- 利用大规模预训练语言模型提升生成对话的表现。
- 开发一种微调方案,在 persona 条件对话数据集上联合优化下一个发话预测和语言建模。
提出的方法
- 使用一个具备遮蔽自注意力的 12-layer 解码器 Transformer(隐藏维度 768,头数 12)。
- 在 BooksCorpus 上进行带有文档级序列的预训练,以捕捉长程依赖。
- 通过多任务学习进行微调,结合下一个发话分类和语言建模损失。
- 输入表示将 persona 句子与对话历史拼接,并添加表示 persona/说话者角色的对话状态嵌入。
- 通过复用位置嵌入并在训练时可能对 persona 句子进行洗牌,促进对 persona 句子顺序的对不变性。
- 使用束搜索解码(束宽 4)并结合采样,应用 n-gram 过滤以避免从 persona 句子中复制;最终排序结合发话概率和下一个发话分类分数。
实验结果
研究问题
- RQ1大型语言模型的迁移学习能否提升开放域对话代理的质量?
- RQ2多任务微调设置(下一个发话分类 + 语言建模)是否比传统基线在 persona 一致性与流畅性方面表现更好?
- RQ3与端到端 Seq2Seq 以及记忆/检索基线相比,TransferTransfo 在 ConvAI2 persona-chat 数据集上的表现如何?
主要发现
- TransferTransfo 在 persona-chat 数据集上相对于 ConvAI2 基线,在验证集和私有测试集上均获得显著改进。
- 在私有测试集上困惑度(PPL)绝对值提升 45%,在验证集上提升 51.0%(与某些基线相比,具体数值见表格)。
- Hits@1 在私有测试集上绝对提升约 46%,在验证集上约提升 35%。
- F1 分数在私有测试集上绝对提升约 20%,在验证集上约提升 13%。
- 模型在 eval 的 PPL 为 17.51、test 为 16.28,eval 的 Hits@1 为 82.1,test 为 80.7,F1 为 19.09(eval)与 19.5(test)。
- 微调大约在四块 GPU 的 10 小时内完成,共 200,000 步。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。