[论文解读] Question Answering on Freebase via Relation Extraction and Textual Evidence
本文提出了一种混合问答框架,通过结合Freebase上的神经关系抽取与Wikipedia中的文本证据,提升对复杂、复合型问题的准确率。通过在Freebase上联合执行实体链接与关系抽取,再利用Wikipedia句子验证候选答案,该方法在WebQuestions数据集上取得了53.3%的F1分数,优于先前的最先进方法,通过利用非结构化文本解决了表示能力和数据稀缺性方面的局限。
Existing knowledge-based question answering systems often rely on small annotated training data. While shallow methods like relation extraction are robust to data scarcity, they are less expressive than the deep meaning representation methods like semantic parsing, thereby failing at answering questions involving multiple constraints. Here we alleviate this problem by empowering a relation extraction method with additional evidence from Wikipedia. We first present a neural network based relation extractor to retrieve the candidate answers from Freebase, and then infer over Wikipedia to validate these answers. Experiments on the WebQuestions question answering dataset show that our method achieves an F_1 of 53.3%, a substantial improvement over the state-of-the-art.
研究动机与目标
- 为解决涉及多个约束条件(如'最高'或'母亲')的复合型问题带来的挑战,此类问题对纯关系抽取方法而言具有难度。
- 通过使用Wikipedia作为外部证据来验证Freebase中的候选答案,缓解训练中的数据稀缺问题。
- 在不依赖复杂语义解析或大规模标注数据集的前提下,提升关系抽取模型的鲁棒性与表达能力。
- 通过支持在两种数据源之间进行联合推理,弥合结构化知识库与非结构化文本之间的差距。
- 开发一种可扩展的端到端流水线,通过文本证据增强答案选择能力,尤其适用于具有次词汇复合性的提问。
提出的方法
- 采用多通道卷积神经网络(MCCNN)在Freebase上联合执行实体链接与关系抽取,利用句法与句子级特征预测候选答案。
- 该模型通过句法感知架构处理问题中的实体与候选关系,捕捉依存与词级特征。
- 通过在实体-关系配置上进行联合推理生成候选答案,从Freebase中输出一个排序后的潜在答案列表。
- 第二阶段的答案优化模型利用主题实体的Wikipedia页面检索支持性句子作为文本证据。
- 系统通过匹配候选答案与证据句子之间的词汇与语义重叠,验证或排除答案,从而过滤错误候选。
- 该流水线通过基于句法的模式将复杂查询分解为子问题,能够同时处理单关系与多关系问题。
实验结果
研究问题
- RQ1Wikipedia中的文本证据能否提升基于Freebase关系抽取的问答系统在复杂、复合型问题上的准确率?
- RQ2在低数据环境下,基于句法感知神经网络的联合实体链接与关系抽取模型效果如何?
- RQ3在关系抽取中引入非结构化文本证据在多大程度上能减少因表示能力不足导致的错误?
- RQ4两阶段推理流水线(先结构化知识库,再非结构化文本)是否优于端到端语义解析或纯知识库方法?
- RQ5该方法如何处理具有次词汇复合性的问题,例如'母亲'同时隐含父母关系与性别约束?
主要发现
- 所提方法在WebQuestions基准上实现了53.3%的F1分数,显著优于先前的最先进水平。
- Wikipedia文本证据的整合显著减少了多约束问题(如涉及'最高'或'母亲'的问题)中的错误,通过提供明确的验证依据。
- 基于MCCNN的关系抽取器优于逻辑回归基线模型,并在关系抽取任务中对未见上下文更具鲁棒性。
- 即使不使用非结构化推理,该方法仍比先前的SOTA模型高出7个F1分数,证明了神经关系抽取组件的强大性能。
- 两阶段流水线通过基于句法的模式分解复合问题,并利用证据句子验证答案,有效处理了复合型问题。
- 该系统在需要多关系或隐含约束的问题(如'伊莎贝拉女王的母亲是谁?')上表现出强大的泛化能力,通过利用Wikipedia中的性别与亲属角色线索。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。