Skip to main content
QUICK REVIEW

[論文レビュー] $k$NN-Adapter: Efficient Domain Adaptation for Black-Box Language Models

Yangsibo Huang, Daogao Liu|arXiv (Cornell University)|Feb 21, 2023
Topic Modeling被引用数 4
ひとこと要約

kNN-Adapter は、微調整を必要とせずブラックボックスの大規模言語モデル(LLM)を新しいドメインに適応させる軽量でパラメータ効率の良い手法である。この手法は、事前学習済み言語モデルと検索拡張データベースの間で、トークンごとに適応的に重みを学習する。特に低データ量やアクセス制限のある状況でも、パープレキシティに顕著な向上を達成し、少データ設定下で、vanilla kNN-LM や微調整を上回る性能を発揮する。

ABSTRACT

Fine-tuning a language model on a new domain is standard practice for domain adaptation. However, it can be infeasible when it comes to modern large-scale language models such as GPT-3, which can only be accessed through APIs, making it difficult to access the internal parameters of the model. In this paper, we propose $k$NN-Adapter, a method to effectively adapt these black-box large language models (LLMs) to a new domain. The $k$NN-Adapter builds on top of the retrieval-augmented language model, and adaptively learns to interpolate the output of the language model with retrieval results from a datastore consisting of the target domain data. Our experiments on four different domains demonstrate that $k$NN-Adapter significantly improves perplexity, and works particularly well in settings with limited access to LLMs. Additionally, we show that $k$NN-Adapter is more effective than fine-tuning when the amount of training data is limited. We also release a dataset to encourage further study.

研究の動機と目的

  • ブラックボックス API アクセスのため、微調整が不可能な状況下で大規模言語モデル(LLM)を新しいドメインに適応する課題に対処すること。
  • kNN-LM のような検索拡張型言語モデルの性能を、文脈およびトークンに依存する動的補間係数を学習することで向上させること。
  • データが少ない状況やモデルへのアクセスが制限される状況(例:上位k個のトークン確率しか得られない状況)においても、効果的なドメイン適応を可能にすること。
  • モデルパラメータがアクセス不可で計算リソースが限られる状況において、完全な微調整のより効率的な代替手段を提供すること。
  • 学習された補間重みの分析を通じて、検索拡張型モデルがなぜ効果的であるかのメカニズムを解明すること。

提案手法

  • kNN-Adapter は kNN-LM を基盤とし、言語モデルの出力分布 p_LM と k 近傍検索による分布 p_kNN の間で、動的に変化するトークンごとの補間係数 λ を導入する。
  • 補間係数 λ は、現在のコンテキスト、予測対象のトークン、およびドメイン固有のデータベースから取得した k 個の近傍を入力とする、小さな学習可能なアダプターネットワークによって予測される。
  • 検索分布のための学習可能な温度パラメータを導入することで、補間をさらに精緻化し、キャリブレーションと性能を向上させる。
  • アダプタは、ターゲットドメインのデータセット上で交差エントロピー損失を用いてエンドツーエンドで訓練され、固定された LLM の重みには更新を加えない。
  • このアプローチは kNN-LM の効率性を維持しつつ、検索ベースの知識と LLM の一般化能力を文脈に応じて適応的に統合する。
  • 任意のブラックボックス LLM と互換性があり、アーキテクチャの変更なしに適用可能である。

実験結果

リサーチクエスチョン

  • RQ1学習可能な、トークンごとの補間メカニズムは、ドメイン適応タスクにおける検索拡張型言語モデルの性能を向上させることができるか?
  • RQ2限られたデータしか利用できない状況下で、kNN-Adapter は微調整と比べてどのように性能を発揮するか?
  • RQ3LLM の API が上位k個のトークン確率しか返さないような制限付きアクセス環境下でも、kNN-Adapter は高い性能を維持できるか?
  • RQ4異なるトークンタイプやドメインにおける学習済み補間重み λ の分析から、どのようなインサイトが得られるか?
  • RQ5kNN-Adapter は、リソースが限られた状況下で、vanilla kNN-LM と微調整済みモデルの両方を上回る性能を発揮できるか?

主な発見

  • kNN-Adapter は、ベースラインの kNN-LM と比較して、4つの異なるドメインでパープレキシティを約 2 ポints 減少させ、推論コストの増加はわずかである。
  • 10^4 個未満のトレーニングトークンしか利用できない状況では、微調整を著しく上回り、少データ設定下での高いデータ効率性を示している。
  • LLM API が上位k個のトークン確率しか返さない状況でも、kNN-Adapter は高い性能を維持しており、実世界のブラックボックス展開に適している。
  • 学習された補間重み λ はドメインやトークンタイプによって顕著に異なる。例えば、Amazon や Enron では人称代名詞に対して高い λ 値を示すが、Wikitext-103 はデータベース内での人称代名詞の数が少ないため、低い値を示す。
  • 適応的かつ動的な λ 機構は不可欠である。固定値またはグループ単位の係数では性能が劣り、検索拡張推論におけるトークンレベルのカスタマイズの重要性が裏付けられる。
  • 本研究では、kNN-Adapter の成功要因が、特にリソースが限られた状況下で、一般言語知識とドメイン固有のパターンの動的バランスを取ることに起因することを明らかにした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。