Skip to main content
QUICK REVIEW

[论文解读] On the Robustness of Generative Retrieval Models: An Out-of-Distribution Perspective

Yuan Liu, Ruqing Zhang|arXiv (Cornell University)|Jun 22, 2023
Information Retrieval and Search Behavior被引用 6
一句话总结

本文通過定義三種分佈外(OOD)場景——查詢變異、未見過的查詢類型以及未見過的任務——研究了生成式檢索模型的分佈外(OOD)魯棒性。利用 KILT 基準,研究發現生成式檢索模型(包括 BART 和 CorpusBrain)在 OOD 條件下表現顯著下降,特別是在查詢變異和未見過的查詢類型方面,表明在現實世界部署中,除了標準的分佈內評估外,亟需提升其魯棒性。

ABSTRACT

Recently, we have witnessed generative retrieval increasingly gaining attention in the information retrieval (IR) field, which retrieves documents by directly generating their identifiers. So far, much effort has been devoted to developing effective generative retrieval models. There has been less attention paid to the robustness perspective. When a new retrieval paradigm enters into the real-world application, it is also critical to measure the out-of-distribution (OOD) generalization, i.e., how would generative retrieval models generalize to new distributions. To answer this question, firstly, we define OOD robustness from three perspectives in retrieval problems: 1) The query variations; 2) The unforeseen query types; and 3) The unforeseen tasks. Based on this taxonomy, we conduct empirical studies to analyze the OOD robustness of several representative generative retrieval models against dense retrieval models. The empirical results indicate that the OOD robustness of generative retrieval models requires enhancement. We hope studying the OOD robustness of generative retrieval models would be advantageous to the IR community.

研究动机与目标

  • 為解決生成式檢索模型在分佈外(OOD)魯棒性方面缺乏系統性評估的問題,這些模型通常僅在分佈內假設下進行評估。
  • 識別並分類檢索系統中關鍵的 OOD 泛化挑戰,特別是在測試數據分佈與訓練數據不同的現實世界部署場景中。
  • 實證比較生成式檢索模型(如 BART、CorpusBrain)與密集檢索基線在多種 OOD 情境下的 OOD 泛化性能。
  • 突出當前生成式檢索模型在處理分佈偏移(特別是查詢品質與格式)方面的局限性,並激勵未來針對魯棒性的研究。
  • 釋出程式碼與數據,以支援生成式檢索中 OOD 魯棒性的可重現評估與進一步研究。

提出的方法

  • 提出一個三元分類的 OOD 魯棒性分類法:(1) 查詢變異(如拼寫錯誤、詞序變化),(2) 未見過的查詢類型(如網路搜尋 vs. 知識型查詢),以及 (3) 未見過的下游任務(如實體連結、槽位填補)。
  • 使用 KILT 基準,其涵蓋 5 個任務(如 NQ、EL、SF)的 11 個數據集,用於評估模型在這些 OOD 條件下的表現。
  • 使用標準檢索指標(如 R-precision 和 DR_OOD(分佈外下降率))評估生成式檢索模型(BART、CorpusBrain)與密集檢索基線(如 DPR)的表現。
  • 對預訓練模型進行微調,以適應特定任務的檢索目標,其中 CorpusBrain 使用三種專用預訓練任務(ISS、LPS、HIP)以提升泛化能力。
  • 透過擾動查詢(如拼寫錯誤、詞序重排)或使用訓練期間未見過的域外查詢類型與任務,設計受控的 OOD 測試分割。
  • 透過 DR_OOD(定義為從分佈內到分佈外設定下檢索性能的下降)來衡量性能下降,以量化魯棒性。

实验结果

研究问题

  • RQ1與分佈內性能相比,生成式檢索模型在查詢變異(如拼寫錯誤與詞序變化)下的表現如何?
  • RQ2生成式檢索模型在未見過的查詢類型(如訓練期間未見的網路搜尋查詢)上的泛化能力如何?
  • RQ3生成式檢索模型在與其預訓練目標不同的未見過的下游任務(如實體連結)上的表現如何?
  • RQ4生成式模型的預訓練設計(如 CorpusBrain 與 BART)如何影響其在不同魯棒性情境下的 OOD 泛化能力?
  • RQ5密集檢索模型在 OOD 泛化方面是否顯著優於生成式模型?生成式模型在分佈偏移下的主要失敗模式是什麼?

主要发现

  • 生成式檢索模型在 OOD 條件下遭受顯著的性能下降,平均 R-precision 在拼寫錯誤與詞序變化等查詢變異任務中下降超過 20%。
  • 在 NQ 數據集上,BART 等生成式模型對未見過的查詢類型(如網路搜尋查詢)表現出特別差的魯棒性,某些情況下 DR_OOD 值超過 30%。
  • CorpusBrain 在所有 OOD 情境下均優於 BART,在 20 種未見過的任務組合中達到了更好的泛化表現,展現出任務專用預訓練的優勢。
  • 生成式模型的 OOD 下降率(DR_OOD)在所有情境中均顯著高於密集檢索模型,特別是在查詢變異與未見過的查詢類型情境下。
  • 即使在生成式模型內部,預訓練設計亦至關重要:與標準 BART 相比,CorpusBrain 的三階段預訓練(ISS、LPS、HIP)顯著提升了對分佈偏移的魯棒性。
  • 本研究揭示,當前的生成式檢索模型對現實世界中的分佈偏移缺乏魯棒性,儘管其在分佈內表現強勁,但泛化能力仍存在關鍵缺口。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。