[论文解读] Deep Learning Relevance: Creating Relevant Information (as Opposed to Retrieving it)
本文提出了一种新颖的信息检索方法,其中具有长短期记忆(LSTM)的循环神经网络(RNN)从现有相关文档中学习,为给定查询合成一份新的、潜在更相关的一体化文档。通过众包方式对词云进行排序,合成文档在所有查询中的平均相关性排名为1.81,被普遍视为最相关。
What if Information Retrieval (IR) systems did not just retrieve relevant information that is stored in their indices, but could also "understand" it and synthesise it into a single document? We present a preliminary study that makes a first step towards answering this question. Given a query, we train a Recurrent Neural Network (RNN) on existing relevant information to that query. We then use the RNN to "deep learn" a single, synthetic, and we assume, relevant document for that query. We design a crowdsourcing experiment to assess how relevant the "deep learned" document is, compared to existing relevant documents. Users are shown a query and four wordclouds (of three existing relevant documents and our deep learned synthetic document). The synthetic document is ranked on average most relevant of all.
研究动机与目标
- 探索信息检索系统是否能够超越索引文档的检索,转而合成语义连贯且更相关的全新文档。
- 研究深度学习模型是否能够从相关文档中学习潜在语义,并为查询生成一份统一的合成文档。
- 评估用户对合成文档与现有相关文档在相关性方面的感知差异。
- 评估使用字符级嵌入的RNN生成连贯且相关合成内容的可行性。
提出的方法
- 使用查询及其已知相关文档的文本,训练一个基于字符级长短期记忆(LSTM)的循环神经网络(RNN),以生成合成文档。
- RNN通过处理字符序列学习输入文档的语义结构,从而能够生成反映训练文档内容的新颖连贯文本。
- 从合成文档和三份现有相关文档中生成词云,以供用户进行快速、直观的评估。
- 通过众包实验,将每个查询与四个词云(三份真实文档,一份合成文档)呈现给用户,由用户按相关性对它们进行排序,以评估用户对文档质量的感知。
- 通过时间反向传播训练模型,以最小化字符序列上的预测误差,使模型能够学习生成合理且相关的新文本。
- 该方法假设:包含训练集中所有相关信息的合成文档,将比任何单一文档更具相关性。
实验结果
研究问题
- RQ1深度学习模型能否生成一份被用户感知为比现有相关文档更相关的合成文档?
- RQ2使用RNN结合字符级嵌入是否能够使模型从现有信息检索文档中合成语义连贯且相关的新文本?
- RQ3用户对合成文档与真实索引相关文档的相关性感知有何差异?
- RQ4视觉呈现方式(如词云)对用户评估文档相关性有何影响?
主要发现
- 合成文档在所有查询和用户中的平均相关性排名为1.81,被普遍视为最相关。
- 在101个查询中,有45个查询的合成文档排名第一,42个排名第二,显示出强烈的用户偏好。
- 仅有两个合成文档排名最后(第4位),原因均为单一或两个词语在视觉上占据主导,掩盖了其他内容,降低了感知相关性。
- 结果表明,基于RNN的合成方法能够生成比单个检索文档更相关的新文档,即使通过简化的词云进行评估亦然。
- 该方法在用户感知中优于基线检索方法,表明合成文档生成可能提升信息检索的相关性。
- 该方法在重排序检索结果前列文档方面展现出潜力,但在对整个索引中所有文档进行排序时效果较弱。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。