Skip to main content
QUICK REVIEW

[论文解读] Selective Term Proximity Scoring Via BP-ANN

Yang Ju, Jiancong Tong|arXiv (Cornell University)|Jun 23, 2016
Data Management and Algorithms参考文献 10被引用 3
一句话总结

本文提出一种基于反向传播人工神经网络(BP-ANN)的可选术语邻近度(TP)评分模型,用于预测哪些查询能从基于TP的排序中受益。通过学习查询特定特征,该模型仅在有效时才选择性地应用TP评分,从而在降低计算开销的同时提升排序质量,其MAP和吞吐量表现优于始终启用TP评分的方案。

ABSTRACT

When two terms occur together in a document, the probability of a close relationship between them and the document itself is greater if they are in nearby positions. However, ranking functions including term proximity (TP) require larger indexes than traditional document-level indexing, which slows down query processing. Previous studies also show that this technique is not effective for all types of queries. Here we propose a document ranking model which decides for which queries it would be beneficial to use a proximity-based ranking, based on a collection of features of the query. We use a machine learning approach in determining whether utilizing TP will be beneficial. Experiments show that the proposed model returns improved rankings while also reducing the overhead incurred as a result of using TP statistics.

研究动机与目标

  • 解决在信息检索中对所有查询统一使用术语邻近度(TP)评分所导致的效率低下与效果不一致问题。
  • 通过智能选择仅对性能有益的查询,减少始终启用TP评分带来的计算开销。
  • 基于查询特定特征,仅在TP评分能提升相关性时应用,从而提升排序质量。
  • 通过机器学习驱动的查询选择,实现检索效果与效率的平衡。

提出的方法

  • 该模型使用BP-ANN根据一组13个查询特征对查询进行分类,预测TP评分是否能提升排序效果。
  • 特征包括查询长度、词频、逆文档频率,以及平均词间距等与邻近度相关的统计量。
  • BP-ANN被训练以预测二元标签:1表示TP评分能提升排序效果(有益),0表示否则。
  • 该模型被集成到排序流水线中,仅对预测为有益的查询启用TP评分。
  • 该方法避免对非有益查询进行完整的TP计算,从而减少索引大小与查询处理时间。
  • 使用标准IR指标(MAP、NDCG、精确率)和真实测试集上的吞吐量对模型进行评估。

实验结果

研究问题

  • RQ1在文档排序中,哪些查询真正从术语邻近度(TP)评分中受益?
  • RQ2机器学习模型能否准确预测针对特定查询,TP评分是否能提升排序效果?
  • RQ3选择性地应用TP评分是否能在保持或提升排序质量的同时减少计算开销?
  • RQ4在不同查询类型与长度下,该选择性模型的性能与始终启用TP及无TP基线相比如何?

主要发现

  • 选择性TP模型(_tpS)的MAP与平均NDCG均高于始终启用TP的模型(_tpAll),表明排序质量更优。
  • 对于MRF排序公式,_tpS的MAP达到0.4924,优于_logitsAll(0.4883),并接近理想性能(0.5362)。
  • 与_logitsAll相比,选择性模型的吞吐量提升了15%–25%,其中_logitsS在EXP下处理速率达477.82 Q/s,而_logitsAll为334.56 Q/s。
  • 在k=1精确率上,_tpS在所有查询长度下均优于_logitsAll,表明其在精确匹配查询中效果更强。
  • 该模型将使用TP的查询数量从143减少至80(EXP)和69(MRF),表明能有效过滤非有益查询。
  • BP-ANN模型在BM25TP模型中实现了98.57 Q/s的吞吐量(选择性评分),显著优于_logitsAll的352.71 Q/s。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。