[论文解读] Open Domain Question Answering Using Web Tables
本文提出了一种新颖的开放域问答系统,通过结合基于深度神经网络的查询-表格语义相似度、表格主导性与质量特征,利用网页表格回答事实性与非事实性查询。该方法显著优于现有基线模型,在实验中实现了80%精确率下的20%召回率,并已部署于主流商业搜索引擎中,每月服务数千万次表格答案。
Tables extracted from web documents can be used to directly answer many web search queries. Previous works on question answering (QA) using web tables have focused on factoid queries, i.e., those answerable with a short string like person name or a number. However, many queries answerable using tables are non-factoid in nature. In this paper, we develop an open-domain QA approach using web tables that works for both factoid and non-factoid queries. Our key insight is to combine deep neural network-based semantic similarity between the query and the table with features that quantify the dominance of the table in the document as well as the quality of the information in the table. Our experiments on real-life web search queries show that our approach significantly outperforms state-of-the-art baseline approaches. Our solution is used in production in a major commercial web search engine and serves direct answers for tens of millions of real user queries per month.
研究动机与目标
- 解决利用网页表格回答非事实性查询(如列表、排名或结构化数据)的挑战。
- 在现有基于信息检索(IR)和主导表格的基线之上,提升开放域问答中表格答案选择的精确率。
- 开发一个统一框架,有效处理使用网页表格作为答案的事实性与非事实性查询。
- 基于语义相关性、表格主导性与信息质量,从大量候选表格中识别并排序最相关的网页表格。
提出的方法
- 系统使用网页搜索引擎为给定查询检索候选网页表格池。
- 通过深度神经网络计算查询与每个候选表格之间的语义相似度,以评估相关性。
- 引入三类特征:表格在文档中的占比(主导性)、表格在文档中的位置,以及表格质量度量指标。
- 采用学习排序模型,将查询-表格语义相似度与主导性及质量特征结合,对表格进行打分并选择最佳答案。
- 模型在真实用户查询上进行训练与评估,性能通过不同阈值下的精确率与召回率进行衡量。
- 该方法旨在通过惩罚非主导或质量低下的表格,避免选择来自非理想文档的表格,即使其与查询的IR匹配度较高。
实验结果
研究问题
- RQ1统一方法是否能有效处理使用网页表格作为答案的事实性与非事实性问题?
- RQ2结合神经语义相似度与表格主导性及质量特征,相较于基于IR或主导表格的基线,如何提升表格答案选择的性能?
- RQ3表格主导性与质量特征在多大程度上减少了因高IR匹配度但低相关性导致的误报?
- RQ4语义相似度与主导性及质量特征在实现高精确率表格答案选择中的相对贡献如何?
主要发现
- 当同时使用语义相似度、主导性与质量三类特征时,所提方法在80%精确率下实现了20%的召回率,显著优于基线模型。
- 仅使用主导性与质量特征(不包含语义相似度)时,可实现80%精确率下的16%召回率,表明即使不使用深度学习,这些特征也具有重要价值。
- 与仅使用主导性与质量特征相比,引入查询-表格语义相似度特征使80%精确率下的召回率提升了4个百分点。
- 仅依赖主导表格的方法在顶级文档并非完美答案时会失效,如在'纽约萨拉托加即将举行的赛马'示例中,错误选择了州级表格。
- 基于IR的基线表现不佳,因为它倾向于选择IR匹配度高但并非最佳答案的表格,例如在'图数据库'查询中,错误选择了维基百科表格而非实际解释性内容。
- 该系统已部署于主流商业网页搜索引擎的生产环境中,每月为数千万真实用户查询提供直接的表格答案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。