Skip to main content
QUICK REVIEW

[论文解读] $k$NN-Adapter: Efficient Domain Adaptation for Black-Box Language Models

Yangsibo Huang, Daogao Liu|arXiv (Cornell University)|Feb 21, 2023
Topic Modeling被引用 4
一句话总结

kNN-Adapter 是一种轻量级、参数高效的黑盒大语言模型微调方法,可在无需微调的情况下将模型适应到新领域。它自适应地学习预训练语言模型与检索增强数据存储之间的逐标记插值权重,显著提升了困惑度,尤其在低数据和受限访问设置下表现优异,相较于原始 kNN-LM 和微调方法在少样本场景中表现更优。

ABSTRACT

Fine-tuning a language model on a new domain is standard practice for domain adaptation. However, it can be infeasible when it comes to modern large-scale language models such as GPT-3, which can only be accessed through APIs, making it difficult to access the internal parameters of the model. In this paper, we propose $k$NN-Adapter, a method to effectively adapt these black-box large language models (LLMs) to a new domain. The $k$NN-Adapter builds on top of the retrieval-augmented language model, and adaptively learns to interpolate the output of the language model with retrieval results from a datastore consisting of the target domain data. Our experiments on four different domains demonstrate that $k$NN-Adapter significantly improves perplexity, and works particularly well in settings with limited access to LLMs. Additionally, we show that $k$NN-Adapter is more effective than fine-tuning when the amount of training data is limited. We also release a dataset to encourage further study.

研究动机与目标

  • 为解决在无法访问模型权重(如仅通过黑盒 API)时,将大语言模型(LLMs)适应到新领域所面临的挑战。
  • 通过学习动态、上下文相关且标记特定的插值系数,提升检索增强语言模型(如 kNN-LM)的性能。
  • 在数据量有限和模型访问受限(如仅能获取 top-k token 概率)的情况下,实现有效的领域适应。
  • 为全量微调提供更高效的替代方案,尤其在模型参数不可访问且计算资源有限时。
  • 通过分析学习到的插值权重,深入理解检索增强模型有效性的内在机制。

提出的方法

  • kNN-Adapter 在 kNN-LM 的基础上引入了一个可学习的、逐标记的插值系数 λ,用于动态融合语言模型输出分布 p_LM 与 k-近邻检索分布 p_kNN。
  • 插值系数 λ 由一个小型可训练适配器网络预测,其输入包括当前上下文、待预测的标记以及来自特定领域数据存储的 k 个最近邻。
  • 通过引入可学习的温度参数来进一步优化检索分布,提升校准性和性能。
  • 适配器通过在目标领域数据集上使用交叉熵损失进行端到端训练,且不更新冻结的 LLM 权重。
  • 该方法在保持 kNN-LM 高效性的同时,实现了检索知识与 LLM 通用泛化能力的自适应、上下文感知融合。
  • 该方法兼容任何支持标记概率查询的黑盒 LLM,且无需架构修改即可应用。

实验结果

研究问题

  • RQ1可学习的、逐标记的插值机制是否能提升检索增强语言模型在领域适应任务中的性能?
  • RQ2当目标领域可用数据有限时,kNN-Adapter 与微调方法相比表现如何?
  • RQ3当 LLM API 仅返回 top-k 标记概率时,kNN-Adapter 是否仍能保持高性能?
  • RQ4通过分析不同标记类型和领域中学习到的自适应插值权重 λ,能获得哪些洞见?
  • RQ5kNN-Adapter 是否能在低资源设置下同时超越原始 kNN-LM 和微调模型?

主要发现

  • 与基线 kNN-LM 相比,kNN-Adapter 在四个不同领域中将困惑度降低了约 2 个点,且推理成本仅略有增加。
  • 当训练样本少于 10^4 个 token 时,kNN-Adapter 显著优于微调方法,展现出在少样本场景下的卓越样本效率。
  • 即使 LLM API 仅返回 top-k 标记的概率,kNN-Adapter 仍能保持强劲性能,适用于真实世界的黑盒部署。
  • 学习到的插值权重 λ 在不同领域和标记类型间存在显著差异;例如,Amazon 和 Enron 中代词的 λ 值较高,而 Wikitext-103 因其数据存储中代词较少,λ 值较低。
  • 自适应 λ 机制至关重要——静态或分组设置的系数会导致性能下降,证实了在检索增强推理中逐标记个性化的重要性。
  • 研究发现,kNN-Adapter 的成功源于其能够动态平衡通用语言知识与领域特定模式,尤其在低资源场景下表现突出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。