[论文解读] One Embedder, Any Task: Instruction-Finetuned Text Embeddings
本文提出 InstructOR,一种单一文本嵌入模型,通过基于描述下游任务的自然语言指令进行条件化,生成任务和领域感知的表示。该模型在包含 330 个多样化数据集的指令数据集上,使用对比学习进行训练,这些数据集均配有由人工标注的指令。InstructOR 在 70 项下游嵌入任务中达到最先进性能——其中 66 项在训练期间未见过——在仅使用 335M 参数的情况下,平均性能优于先前模型 3.4%。
We introduce INSTRUCTOR, a new method for computing text embeddings given task instructions: every text input is embedded together with instructions explaining the use case (e.g., task and domain descriptions). Unlike encoders from prior work that are more specialized, INSTRUCTOR is a single embedder that can generate text embeddings tailored to different downstream tasks and domains, without any further training. We first annotate instructions for 330 diverse tasks and train INSTRUCTOR on this multitask mixture with a contrastive loss. We evaluate INSTRUCTOR on 70 embedding evaluation tasks (66 of which are unseen during training), ranging from classification and information retrieval to semantic textual similarity and text generation evaluation. INSTRUCTOR, while having an order of magnitude fewer parameters than the previous best model, achieves state-of-the-art performance, with an average improvement of 3.4% compared to the previous best results on the 70 diverse datasets. Our analysis suggests that INSTRUCTOR is robust to changes in instructions, and that instruction finetuning mitigates the challenge of training a single model on diverse datasets. Our model, code, and data are available at https://instructor-embedding.github.io.
研究动机与目标
- 解决现有文本嵌入模型在新任务和新领域上零样本泛化能力差的问题。
- 探究任务和领域指令是否能使单一模型在无需进一步微调的情况下生成高效且定制化的嵌入表示。
- 开发一种统一的、基于指令微调的嵌入模型,使其在多样化下游应用中表现优异。
- 证明基于指令的微调可提升在异构数据集上的鲁棒性与性能。
提出的方法
- InstructOR 同时编码输入文本和描述任务或领域的自然语言指令,生成任务感知的嵌入表示。
- 该模型在包含 330 个多样化文本嵌入数据集的多任务混合数据集上进行训练,使用对比损失最大化语义相关样本对之间的相似度。
- MEDI 数据集由 330 个指令标注的数据集构成,为每个输入样本对人工编写了任务和领域描述。
- 采用孪生网络架构计算文本-指令对的嵌入表示,对比损失用于优化语义相似度。
- 在 70 项下游嵌入基准任务上评估模型性能,涵盖分类、检索、聚类和语义相似性等任务。
- 与先前最先进模型(如 GTR 和 SimCSE)进行比较,并通过消融研究分离指令微调的贡献。
实验结果
研究问题
- RQ1单一文本嵌入模型是否仅通过自然语言指令即可生成高质量、任务特定的表示?
- RQ2基于指令的微调是否能提升在多样化下游任务和领域上的零样本泛化能力?
- RQ3指令微调如何影响对改写或不同表述形式指令的鲁棒性?
- RQ4在指令监督下,参数量更小的模型(335M 参数)是否能超越更大的模型(15 亿参数)?
- RQ5指令微调在多大程度上缓解了异构数据集之间的分布偏移问题?
主要发现
- InstructOR 在 70 项多样化下游嵌入任务中平均性能优于先前最先进模型 3.4%,其中包括 66 项训练期间未见过的任务。
- 尽管参数量仅为 335M,InstructOR 在 70 项评估任务中的 63 项上优于更大的 15 亿参数 GTR 模型。
- InstructOR 对改写后的指令表现出鲁棒性,不同表述形式的同一任务描述下性能保持稳定。
- 消融研究证实,指令微调至关重要——不使用指令进行训练会导致性能显著下降。
- InstructOR 在 MTEB 基准的所有类别中均达到最先进结果,包括检索、分类、聚类和语义文本相似性。
- 该模型在低资源领域(如医学和金融)表现尤为出色,展现出强大的零样本迁移能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。