[论文解读] MIMICS: A Large-Scale Data Collection for Search Clarification
本论文介绍了MIMICS,一个从Bing查询日志中提取的大规模、公开可用的数据集,用于搜索澄清研究。该数据集包含三个子集——MIMICS-Click(400,000个查询,附带点击信号)、MIMICS-ClickExplore(60,000个查询,附带多个澄清面板)和MIMICS-Manual(2,000个查询,附带分级的人工标注),支持对澄清问题生成、候选答案重排序、用户参与度预测以及网络搜索和对话式搜索中的点击建模等研究。
Search clarification has recently attracted much attention due to its applications in search engines. It has also been recognized as a major component in conversational information seeking systems. Despite its importance, the research community still feels the lack of a large-scale data for studying different aspects of search clarification. In this paper, we introduce MIMICS, a collection of search clarification datasets for real web search queries sampled from the Bing query logs. Each clarification in MIMICS is generated by a Bing production algorithm and consists of a clarifying question and up to five candidate answers. MIMICS contains three datasets: (1) MIMICS-Click includes over 400k unique queries, their associated clarification panes, and the corresponding aggregated user interaction signals (i.e., clicks). (2) MIMICS-ClickExplore is an exploration data that includes aggregated user interaction signals for over 60k unique queries, each with multiple clarification panes. (3) MIMICS-Manual includes over 2k unique real search queries. Each query-clarification pair in this dataset has been manually labeled by at least three trained annotators. It contains graded quality labels for the clarifying question, the candidate answer set, and the landing result page for each candidate answer. MIMICS is publicly available for research purposes, thus enables researchers to study a number of tasks related to search clarification, including clarification generation and selection, user engagement prediction for clarification, click models for clarification, and analyzing user interactions with search clarification.
研究动机与目标
- 为解决在网页搜索和对话式搜索中研究搜索澄清时缺乏大规模真实世界数据的问题。
- 提供一个全面的数据集,以支持对澄清问题生成、候选答案选择和用户交互建模的研究。
- 利用真实用户交互信号和人工标注的质量判断,支持对用户参与度预测、点击模型和重排序方法的评估。
- 支持对用户行为的深入分析,包括澄清面板的点击偏差和呈现方式的影响。
- 通过发布标准化数据集和评估方法,促进搜索澄清研究中的可复现性和基准测试。
提出的方法
- MIMICS基于真实的Bing查询日志构建,捕捉了生产环境中用户与澄清面板的交互行为。
- MIMICS-Click包含400,000个独立查询,每个查询对应一个澄清面板,以及聚合的点击率和参与度信号。
- MIMICS-ClickExplore包含超过60,000个查询,每个查询包含多个澄清面板,来源于在线A/B实验和探索性研究。
- MIMICS-Manual包含2,000个真实查询,附带人工标注的澄清问题、候选答案以及着陆结果页面质量的分级相关性评分。
- 这些数据集支持使用NDCG、均方误差和交叉熵等指标进行评估,同时关注呈现偏差和点击分布建模。
- 研究人员可利用这些数据集训练和评估澄清生成、重排序、参与度预测和点击建模的模型,并遵循已建立的评估协议。
实验结果
研究问题
- RQ1在搜索澄清中,用户点击行为在不同澄清问题和候选答案排序下如何变化?
- RQ2呈现顺序和文本长度对澄清面板中点击率有何影响?
- RQ3机器学习模型在使用点击信号时,预测用户对澄清面板参与度的能力如何?
- RQ4人工标注的澄清问题和候选答案质量判断与用户点击行为的相关性如何?
- RQ5现有网页搜索点击模型在多大程度上可泛化到搜索澄清任务?如何对其进行适应?
主要发现
- MIMICS-Click包含超过400,000个独立查询,附带澄清面板和聚合的用户点击信号,支持对参与度预测和重排序的大规模评估。
- MIMICS-ClickExplore包含超过60,000个查询,每个查询包含多个澄清面板,支持对答案排序效应和点击建模的受控分析。
- MIMICS-Manual提供2,000对查询-澄清问题对,附带分级的人工标注,包括澄清问题、候选答案以及着陆页面质量,支持监督学习和评估。
- 数据显示,文本更长且排名更高的候选答案吸引的点击更多,表明存在显著的呈现偏差,建模时必须加以处理。
- 现有网页搜索点击模型在搜索澄清任务上泛化能力较差,亟需开发针对澄清特性的用户行为定制的新模型。
- 该数据集支持使用NDCG评估重排序、使用交叉熵评估点击分布建模、使用相关性度量评估参与度预测。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。