[论文解读] Description-Based Text Similarity
本文提出了一项新颖的检索任务——寻找能够实例化抽象描述的句子,采用基于 GPT-3 生成的合成 <描述, 句子> 对进行训练的对比双编码器模型。该模型在 precision@1 上达到 85.4%,显著优于当前最优的句子编码器(如 E5 的 73.6%),表明通过大语言模型进行任务特定的数据整理,可实现针对抽象查询类型的更优语义检索。
Identifying texts with a given semantics is central for many information seeking scenarios. Similarity search over vector embeddings appear to be central to this ability, yet the similarity reflected in current text embeddings is corpus-driven, and is inconsistent and sub-optimal for many use cases. What, then, is a good notion of similarity for effective retrieval of text? We identify the need to search for texts based on abstract descriptions of their content, and the corresponding notion of \emph{description based similarity}. We demonstrate the inadequacy of current text embeddings and propose an alternative model that significantly improves when used in standard nearest neighbor search. The model is trained using positive and negative pairs sourced through prompting a LLM, demonstrating how data from LLMs can be used for creating new capabilities not immediately possible using the original model.
研究动机与目标
- 为解决当前模型在处理内容的抽象、高层次描述时语义检索能力不足的问题。
- 基于抽象描述与其文本实例之间的 '实例化' 关系,定义一种结构良好且一致的相似性概念。
- 提升针对需要查找与概念描述相匹配的具体内容实例的信息检索任务的性能,而非依赖词汇或表面层面的相似性。
- 探索大语言模型不仅用于蒸馏,还可用于生成专门训练数据,以构建超越原始大语言模型能力的检索模型的可行性。
提出的方法
- 利用 GPT-3 生成多样化且高质量的正样本与负样本 <抽象描述, 句子> 对,其中句子是描述的实例化。
- 构建一个对比双编码器模型,为描述和句子分别设置独立编码器,通过最小化正样本对之间的距离并最大化负样本对之间的距离进行训练。
- 采用两阶段数据过滤流程:首先通过 MTurk 进行众包验证,筛选出符合描述的句子(有效)或不符合的句子(无效),以确保训练数据的高质量。
- 在经过筛选的 201 个测试查询数据集上进行训练,每个查询包含 12 个有效句子和 12 个无效句子,并结合 955 万条维基百科句子构建检索索引。
- 使用 precision@k、valid-recall@k 和 invalid-recall@k 进行评估,结果报告于一个保留的测试集(包含抽象描述)上。
- 采用标准的最近邻搜索方法,利用学习到的嵌入向量从大规模维基百科索引中检索句子。

实验结果
研究问题
- RQ1在大语言模型生成的 <描述, 句子> 对上进行训练的检索模型,是否能在基于抽象描述的检索任务中超越通用句子编码器?
- RQ2抽象描述与其文本实例之间的 '实例化' 关系是否是一种定义良好且一致的相似性概念,适用于语义检索?
- RQ3大语言模型在多大程度上可用于生成高质量、多样化且可靠的专用检索任务训练数据?
- RQ4在经过精心筛选的任务特定数据集上进行训练的模型,是否能在抽象查询检索任务中超越通用模型,在精度和召回率方面表现更优?
主要发现
- 所提出的模型在 precision@1 上达到 85.4%,比最强基线模型 E5(73.6%)高出 11.8 个百分点。
- 性能差距在 k=1 时最大,随着 k 增大而减小,表明该模型在抽象描述检索中具有极强的 top-1 重现质量。
- 在所有基线模型中,该模型在 invalid-recall@k 上表现最高,表明其在避免检索不匹配描述的句子方面能力极强。
- 尽管在 valid-recall@k 上低于部分基线模型,但其卓越的精度和极低的假阳性率使其在真实世界的信息检索任务中更具可靠性。
- 结果证实,标准句子编码器因相似性定义模糊且不一致,不适用于抽象描述检索。
- 本研究证明,大语言模型可被有效用于生成高质量、任务特定的训练数据,使模型能够学习到原始大语言模型本身不具备的检索能力。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。