[论文解读] Fine-Grained Distillation for Long Document Retrieval
本文提出了一种新颖的知识蒸馏框架——细粒度蒸馏(FGD),用于长文档检索,通过让双编码器与来自交叉编码器的多粒度表征对齐,缓解了粒度不匹配问题。在训练过程中,FGD 通过使用全局一致的粒度嵌入和跨句子与段落层级的局部协调蒸馏,实现了在 MS-Marco 和 TREC 2019 基准上的最先进性能,且不影响推理效率。
Long document retrieval aims to fetch query-relevant documents from a large-scale collection, where knowledge distillation has become de facto to improve a retriever by mimicking a heterogeneous yet powerful cross-encoder. However, in contrast to passages or sentences, retrieval on long documents suffers from the scope hypothesis that a long document may cover multiple topics. This maximizes their structure heterogeneity and poses a granular-mismatch issue, leading to an inferior distillation efficacy. In this work, we propose a new learning framework, fine-grained distillation (FGD), for long-document retrievers. While preserving the conventional dense retrieval paradigm, it first produces global-consistent representations crossing different fine granularity and then applies multi-granular aligned distillation merely during training. In experiments, we evaluate our framework on two long-document retrieval benchmarks, which show state-of-the-art performance.
研究动机与目标
- 解决由于范围假设和粒度不匹配导致的双编码器与交叉编码器在长文档检索中的性能差距。
- 克服现有蒸馏方法在长文档上失效的局限性,原因在于不同主题间存在结构和语义异质性。
- 开发一种训练时框架,实现在不改变推理效率的前提下,从异构的交叉编码器向双编码器有效迁移知识。
- 在细粒度单元(如句子、段落)之间保持一致的表征,同时保留全局文档级语义。
- 通过统一的蒸馏策略,实现对多种双编码器和交叉编码器架构的泛化能力。
提出的方法
- 引入全局一致的粒度嵌入,以动态上下文化方式在长文档中对多个粒度(句子、段落)的表征进行建模。
- 提出局部协调得分蒸馏,通过在多个粒度层级上将交叉编码器的相关性得分分布蒸馏到双编码器,实现训练过程中的知识迁移。
- 设计一种分层负样本挖掘策略,从顶层(文档)到细粒度层级(句子、段落)逐层采样难负样本,以提升表征学习效果。
- 仅在训练阶段应用多粒度蒸馏,部署时保持双编码器的单向量推理,以维持效率。
- 在推理时使用双编码器和固定的单向量文档嵌入,同时在训练中利用多粒度监督提升泛化能力。
- 将蒸馏与对比学习相结合,增强双编码器的鲁棒性并减少过拟合。
实验结果
研究问题
- RQ1尽管长文档具有多主题特性,是否仍可有效将交叉编码器的知识蒸馏到双编码器?
- RQ2与文档级蒸馏相比,多粒度蒸馏是否能显著提升双编码器在长文档上的性能?
- RQ3全局一致的粒度嵌入是否能改善长文档中细粒度表征与全局表征之间的对齐?
- RQ4分层负样本挖掘在长文档检索的蒸馏质量方面有何影响?
- RQ5所提出的 FGD 框架是否与多种双编码器和交叉编码器架构兼容?
主要发现
- FGD 在 MS-Marco 和 TREC 2019 长文档检索基准上均取得了最先进性能,优于现有基于蒸馏的方法。
- 该方法在长文档上实现了显著的性能提升——检索指标提升超过 1%,而初步实验中暴力蒸馏仅带来不足 0.1% 的增益。
- 通过仅在训练阶段应用多粒度蒸馏,框架保持了推理效率,同时保留了标准双编码器的推理流程。
- 全局一致的粒度嵌入有效减少了跨粒度冲突,改善了细粒度与全局表征之间的对齐。
- 分层负样本挖掘通过在多个粒度层级上提供更具信息量的难负样本,提升了蒸馏质量并增强了模型泛化能力。
- 该框架与多种双编码器和交叉编码器架构兼容,展现出在不同模型选择下的强大泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。