Skip to main content
QUICK REVIEW

[论文解读] Multi-Task Learning for Conversational Question Answering over a Large-Scale Knowledge Base

Tao Shen, Xiubo Geng|arXiv (Cornell University)|Oct 11, 2019
Topic Modeling参考文献 41被引用 5
一句话总结

本文提出了一种用于大规模知识库对话式问答的多任务学习框架,通过联合训练带有指针的语义解析器与类型感知的实体检测,减少错误传播并提升监督共享。该方法在包含160万条样本和1280万实体的数据集上将F1分数从67%提升至79%,显著优于先前的最先进方法。

ABSTRACT

We consider the problem of conversational question answering over a large-scale knowledge base. To handle huge entity vocabulary of a large-scale knowledge base, recent neural semantic parsing based approaches usually decompose the task into several subtasks and then solve them sequentially, which leads to following issues: 1) errors in earlier subtasks will be propagated and negatively affect downstream ones; and 2) each subtask cannot naturally share supervision signals with others. To tackle these issues, we propose an innovative multi-task learning framework where a pointer-equipped semantic parsing model is designed to resolve coreference in conversations, and naturally empower joint learning with a novel type-aware entity detection model. The proposed framework thus enables shared supervisions and alleviates the effect of error propagation. Experiments on a large-scale conversational question answering dataset containing 1.6M question answering pairs over 12.8M entities show that the proposed framework improves overall F1 score from 67% to 79% compared with previous state-of-the-art work.

研究动机与目标

  • 解决大规模知识库问答中顺序神经语义解析流水线的错误传播问题。
  • 实现实体检测与逻辑形式生成等子任务之间的监督共享。
  • 通过在检测过程中整合类型预测,减少实体链接中的歧义。
  • 通过指针网络联合优化共指消解与逻辑形式生成。
  • 提升大规模对话式知识库问答数据集上的整体KB-QA性能。

提出的方法

  • 带有指针的语义解析器将逻辑形式中的实体替换为问题中提及的起始位置,自然地建模对话中的共指关系。
  • 该模型与序列标注任务联合训练以实现实体检测,从而实现监督共享并减少错误。
  • 类型感知的实体检测模块在检测提及的同时预测实体类型,推理阶段用于过滤链接候选。
  • 该框架将实体提及检测、类型预测与逻辑形式生成整合为单一多任务学习架构。
  • 联合预测空间结合了实体检测与类型分类,利用上下文信息提升链接准确性。
  • 通过在训练期间基于BFS搜索真实逻辑形式,缓解了虚假逻辑形式的问题。

实验结果

研究问题

  • RQ1联合训练实体检测与逻辑形式生成是否能减少大规模知识库对话式问答中的错误传播?
  • RQ2在检测过程中引入实体类型预测在多大程度上提升了实体链接的准确性?
  • RQ3基于指针的语义解析器在多轮对话中对共指消解的建模效果如何?
  • RQ4子任务之间的监督共享是否能带来更好的整体KB-QA性能?
  • RQ5该框架在包含数百万实体的大规模知识库中表现如何?

主要发现

  • 所提出的多任务框架在包含160万组问答对的大规模对话式问答数据集上,将整体F1分数从67%提升至79%。
  • 基于指针的语义解析与实体检测的联合训练显著减少了子任务间的错误传播。
  • 类型感知的实体检测通过过滤类型错误的实体,减少了由实体歧义引起的错误。
  • 指针网络通过引用输入问题中提及的位置,有效建模了对话中的共指关系。
  • 该框架在包含1280万实体的大规模知识库上表现出强大的泛化能力,优于先前的最先进方法。
  • 该方法有效利用了多个子任务之间的共享监督信号,从而提升了模型的鲁棒性与准确性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。