[论文解读] Multi-Stage Conversational Passage Retrieval: An Approach to Fusing Term Importance Estimation and Neural Query Rewriting
本文提出了一种多阶段对话文档检索框架,通过结合基于历史查询扩展(Historical Query Expansion)的词项重要性估计与基于T5的序列到序列模型的神经查询重写,解决多轮查询中的歧义问题。通过使用倒数排名融合(reciprocal rank fusion)整合这两种查询重写方法,该方法在TREC CAsT 2019最佳提交结果的基础上,将NDCG@3提升了30%,创下新的最先进水平。
Conversational search plays a vital role in conversational information seeking. As queries in information seeking dialogues are ambiguous for traditional ad-hoc information retrieval (IR) systems due to the coreference and omission resolution problems inherent in natural language dialogue, resolving these ambiguities is crucial. In this paper, we tackle conversational passage retrieval (ConvPR), an important component of conversational search, by addressing query ambiguities with query reformulation integrated into a multi-stage ad-hoc IR system. Specifically, we propose two conversational query reformulation (CQR) methods: (1) term importance estimation and (2) neural query rewriting. For the former, we expand conversational queries using important terms extracted from the conversational context with frequency-based signals. For the latter, we reformulate conversational queries into natural, standalone, human-understandable queries with a pretrained sequence-tosequence model. Detailed analyses of the two CQR methods are provided quantitatively and qualitatively, explaining their advantages, disadvantages, and distinct behaviors. Moreover, to leverage the strengths of both CQR methods, we propose combining their output with reciprocal rank fusion, yielding state-of-the-art retrieval effectiveness, 30% improvement in terms of NDCG@3 compared to the best submission of TREC CAsT 2019.
研究动机与目标
- 解决多轮对话中因代词指代和省略导致的查询歧义问题。
- 通过将查询重写技术整合到多阶段即席信息检索(ad-hoc IR)流程中,提升对话文档检索(ConvPR)的检索效果。
- 评估并比较两种不同的对话查询重写(CQR)方法:词项重要性估计与神经查询重写。
- 证明融合两种CQR方法输出可显著提升检索性能,超越单一方法。
- 揭示基于规则与基于神经网络的查询重写技术之间的互补行为特征。
提出的方法
- 提出历史查询扩展(HQE),利用基于频率的信号从对话上下文中提取关键术语,以扩展模糊查询。
- 引入神经迁移重写(NTR),一种基于T5的序列到序列模型,将对话查询转化为独立且符合人类表达习惯的查询。
- 将两种CQR方法整合进多阶段IR流程,初始检索使用BM25,重排序使用BERT。
- 采用倒数排名融合(RRF)结合HQE与NTR的排序结果,充分发挥其互补优势。
- 使用TREC CAsT 2019基准进行评估,以NDCG@3、MAP和R@1000作为性能指标。
- 通过测量不同束宽下NTR模型的CPU与TPU延迟,评估推理效率。
实验结果
研究问题
- RQ1词项重要性估计与神经查询重写在解决对话查询歧义方面的能力有何差异?
- RQ2结合基于频率信号与神经序列到序列建模的两种不同CQR方法,能否提升检索效果?
- RQ3每种CQR方法对下游检索指标(如NDCG@3与MAP)的相对影响如何?
- RQ4HQE与NTR输出的融合效果与单一方法及TREC CAsT 2019最佳提交结果相比如何?
- RQ5神经查询重写的计算成本如何?束宽对效率与效果的影响如何?
主要发现
- 通过倒数排名融合(RRF)融合HQE与NTR,NDCG@3相比TREC CAsT 2019最佳提交结果提升了23%。
- NTR单独使用时,NDCG@3相比TREC CAsT 2019最佳提交结果提升18%,表明其在模拟人类查询重写方面表现优异。
- HQE在利用对话上下文中的频率信号提取主题相关关键词方面表现突出,有效扩展查询。
- 当束宽w=1时,NTR模型的推理延迟与非神经网络的HQE模型相当;而束宽提升至w=5或w=10时,效果提升微乎其微。
- BERT重排序器引入了显著的计算开销(在TPU上每查询耗时3.29秒),凸显了早期融合相比晚期融合的效率优势。
- 案例研究显示,尽管NTR生成的查询更自然、更接近人类表达,HQE则通过频率信号更好地保留了关键术语,表明两者具有互补优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。