[论文解读] Ranking Clarifying Questions Based on Predicted User Engagement
本文提出一种方法,通过仅使用词汇特征(查询、问题、回答)并结合 BERT 嵌入与回归/分类模型,预测用户参与度,从而对对话式搜索中的澄清面板进行排序。将预测的参与度作为特征引入 RankNet 后,排序性能显著提升,NDCG 从 0.611 提升至 0.620。
To improve online search results, clarification questions can be used to elucidate the information need of the user. This research aims to predict the user engagement with the clarification pane as an indicator of relevance based on the lexical information: query, question, and answers. Subsequently, the predicted user engagement can be used as a feature to rank the clarification panes. Regression and classification are applied for predicting user engagement and compared to naive heuristic baselines (e.g. mean) on the new MIMICS dataset [20]. An ablation study is carried out using a RankNet model to determine whether the predicted user engagement improves clarification pane ranking performance. The prediction models were able to improve significantly upon the naive baselines, and the predicted user engagement feature significantly improved the RankNet results in terms of NDCG and MRR. This research demonstrates the potential for ranking clarification panes based on lexical information only and can serve as a first neural baseline for future research to improve on. The code is available online.
研究动机与目标
- 解决在缺乏真实用户交互数据的情况下,对对话式搜索中澄清面板进行排序的挑战。
- 通过仅利用查询、问题和答案的词汇信息,预测用户参与度,构建相关性的代理指标。
- 为未来在无需实际用户点击数据的前提下,建立澄清面板排序的神经基线模型。
- 探究预测的用户参与度是否能提升学习排序模型在澄清面板上的性能。
- 提供一种完全基于词汇的解决方案,以增强小屏幕或语音交互式搜索界面的用户体验。
提出的方法
- 使用查询-问题-答案三元组的 BERT 和 TF-IDF 嵌入,训练回归与分类模型以预测用户参与度(PUE)。
- 使用 MIMICS 数据集,该数据集包含用户与澄清面板的交互记录,用于训练和评估 PUE 模型。
- 在 RankNet 上进行消融研究,比较在使用与不使用预测用户参与度作为特征时的性能表现。
- 通过超参数调优优化模型,并应用曝光级别过滤器,以减少低可见性实例带来的噪声。
- 在保留的测试集上,使用 NDCG 和 MRR 指标评估最终的排序模型性能。
- 采用两阶段流程:首先预测参与度,然后将预测结果作为特征输入学习排序模型。
实验结果
研究问题
- RQ1能否仅使用词汇特征,将澄清面板上的用户参与度准确预测为回归或分类任务?其性能与基线方法相比如何?
- RQ2在预测澄清面板用户参与度方面,BERT 嵌入与 TF-IDF 表示相比表现如何?
- RQ3在学习排序设置中,使用预测的用户参与度是否能提升澄清面板的排序性能?该提升是否在 NDCG 和 MRR 指标上得到验证?
主要发现
- 预测用户参与度的回归模型显著优于基线方法(如均值预测),表明词汇特征中包含可预测的参与度信号。
- 在回归与分类任务中,BERT 嵌入均优于 TF-IDF 表示,表明其在捕捉澄清内容语义细微差别的能力上更具优势。
- 消融研究显示,将预测的用户参与度作为 RankNet 的特征后,NDCG 从 0.611 提升至 0.620(p 值 = 0.0008),证明其在排序中的有效性。
- MRR 也显著提升,从 0.607 提高至 0.620,p 值为 0.011,表明在不同指标上均获得一致的性能增益。
- 二分类变体的性能优于十一分类变体,可能是因为类别不平衡减少,且泛化能力更强。
- 与随机基线相比,该模型实现了显著改进(NDCG ~0.47),验证了所提方法的实用性,尽管预测本身存在固有难度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。