Skip to main content
QUICK REVIEW

[论文解读] INTERS: Unlocking the Power of Large Language Models in Search with Instruction Tuning

Yutao Zhu, Peitian Zhang|arXiv (Cornell University)|Jan 12, 2024
Topic Modeling被引用 4
一句话总结

本文提出 INTERS,一个专为提升大语言模型(LLMs)在信息检索(IR)任务中的表现而设计的新指令微调数据集。通过从43个数据集中精心筛选出21项与搜索相关的任务(涵盖查询理解、文档理解以及查询-文档关系理解),并使用人工设计的模板,INTERS 显著提升了 LLaMA、Mistral 和 Phi 等模型在域内及域外 IR 任务中的性能,且在各类模型上均表现出一致的性能增益。

ABSTRACT

Large language models (LLMs) have demonstrated impressive capabilities in various natural language processing tasks. Despite this, their application to information retrieval (IR) tasks is still challenging due to the infrequent occurrence of many IR-specific concepts in natural language. While prompt-based methods can provide task descriptions to LLMs, they often fall short in facilitating a comprehensive understanding and execution of IR tasks, thereby limiting LLMs' applicability. To address this gap, in this work, we explore the potential of instruction tuning to enhance LLMs' proficiency in IR tasks. We introduce a novel instruction tuning dataset, INTERS, encompassing 20 tasks across three fundamental IR categories: query understanding, document understanding, and query-document relationship understanding. The data are derived from 43 distinct datasets with manually written templates. Our empirical results reveal that INTERS significantly boosts the performance of various publicly available LLMs, such as LLaMA, Mistral, and Phi, in IR tasks. Furthermore, we conduct extensive experiments to analyze the effects of instruction design, template diversity, few-shot demonstrations, and the volume of instructions on performance. We make our dataset and the fine-tuned models publicly accessible at https://github.com/DaoD/INTERS.

研究动机与目标

  • 为解决 LLM 在信息检索(IR)任务中表现有限的问题,原因在于其对相关概念(如相关性与用户意图)的接触频率较低。
  • 通过创建一个专门且全面的数据集,填补现有指令微调数据集中针对 IR 任务的空白。
  • 通过系统性实验,探究指令设计、数据量以及少样本学习对 LLM 在 IR 任务中性能的影响。
  • 通过在多样化、任务特定的模板上进行指令微调,实现 LLM 对未见 IR 任务的更好泛化能力。

提出的方法

  • 作者收集了涵盖21项与搜索相关任务的43个现有数据集,划分为三类:查询理解、文档理解以及查询-文档关系理解。
  • 针对每一项任务,人工设计任务描述及12种独特的输入模板,以引导模型行为并提升其对任务的理解。
  • 通过混合43个数据集中的所有样本构建数据集,每个样本均使用对应的指令和模板进行格式化。
  • 在多个开源 LLM(如 LLaMA、Mistral、Phi)上使用 INTERS 数据集进行微调,以使其适配 IR 任务。
  • 通过消融实验评估模板、数据量以及少样本学习的影响,比较包含与不包含这些组件的配置。
  • 在未见过的任务上评估零样本和少样本推理,以评估泛化能力,性能使用标准 IR 指标进行衡量。

实验结果

研究问题

  • RQ1在像 INTERS 这样针对特定任务的数据集上进行指令微调,如何提升 LLM 在多样化 IR 任务中的性能?
  • RQ2人工设计的指令模板对模型性能和任务理解有何影响?
  • RQ3训练数据量如何影响指令微调后的 LLM 在 IR 任务中的泛化能力和性能表现?
  • RQ4少样本示例在多大程度上提升了模型对域外 IR 任务的泛化能力?
  • RQ5不同基础模型(如 LLaMA、Mistral、Phi)在 INTERS 上进行微调后,对不同任务类型的受益程度如何?

主要发现

  • INTERS 显著提升了多个开源 LLM 在域内及域外 IR 任务中的性能,且在 LLaMA、Mistral 和 Phi 模型上均表现出一致的性能增益。
  • 训练过程中使用指令模板可带来可测量的性能提升,消融实验显示去除模板后性能下降,证实模板在任务理解中的关键作用。
  • 增加训练数据量可一致提升模型性能,尽管不同任务对数据量的敏感度不同,其中重排序任务从更多数据中获益最大。
  • 少样本示例在所有任务中均能持续提升性能,尤其在输出空间复杂的任务(如阅读理解任务 BoolQ)中,有助于明确任务目标和输出格式。
  • 在 INTERS 上微调的模型优于在 FLAN 上微调的模型,尤其在重排序任务中表现更优,表明针对 IR 任务的指令微调具有显著优势。
  • 查询改写任务在不同数据量下表现稳定,表明其因任务本身较简单,对数据量不敏感。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。