[논문 리뷰] $k$NN-Adapter: Efficient Domain Adaptation for Black-Box Language Models
kNN-Adapter는 파라미터 효율적인 가벼운 방법으로, 흑상자 대규모 언어 모델을 새로운 도메인에 적응시키기 위해 파인튜닝 없이도 가능하게 한다. 이 방법은 사전 훈련된 언어 모델과 검색 증강 데이터베이스 간의 토큰 단위로 가중치를 적응적으로 학습하며, 특히 저자료 및 제한된 액세스 환경에서 퍼플렉서티를 크게 향상시켜, 소수의 샘플 설정에서 기존의 kNN-LM 및 파인튜닝보다 뛰어난 성능을 보인다.
Fine-tuning a language model on a new domain is standard practice for domain adaptation. However, it can be infeasible when it comes to modern large-scale language models such as GPT-3, which can only be accessed through APIs, making it difficult to access the internal parameters of the model. In this paper, we propose $k$NN-Adapter, a method to effectively adapt these black-box large language models (LLMs) to a new domain. The $k$NN-Adapter builds on top of the retrieval-augmented language model, and adaptively learns to interpolate the output of the language model with retrieval results from a datastore consisting of the target domain data. Our experiments on four different domains demonstrate that $k$NN-Adapter significantly improves perplexity, and works particularly well in settings with limited access to LLMs. Additionally, we show that $k$NN-Adapter is more effective than fine-tuning when the amount of training data is limited. We also release a dataset to encourage further study.
연구 동기 및 목표
- 블랙박스 API 접근으로 인해 파인튜닝이 불가능한 상황에서 대규모 언어 모델(LLM)을 새로운 도메인에 적응시키는 데 도전하는 것.
- kNN-LM와 같은 검색 증강 언어 모델의 성능을 향상시키기 위해, 맥락과 토큰에 따라 동적으로 변하는 가중치 계수를 학습하는 것.
- 저자료 환경 및 모델 액세스 제한(예: 상위-k 토큰 확률만 제공되는 경우)에서도 효과적인 도메인 적응을 가능하게 하는 것.
- 모델 파라미터에 접근할 수 없거나 계산 자원이 제한된 상황에서 전체 파인튜닝의 더 효율적인 대안을 제공하는 것.
- 학습된 가중치 혼합 계수의 분석을 통해 검색 증강 모델이 효과적인 이유를 이해하는 데 기여하는 것.
제안 방법
- kNN-Adapter는 kNN-LM을 기반으로 하되, 사전 훈련된 언어 모델의 출력 분포 p_LM과 k-가장 가까운 이웃 검색 분포 p_kNN 간의 동적 혼합을 위한 학습 가능한 토큰 단위의 가중치 λ를 도입한다.
- 가중치 λ는 현재 맥락, 예측할 토큰, 도메인 특화 데이터베이스에서 검색된 k개의 가장 가까운 이웃을 입력으로 받는 소규모 학습 가능한 어댑터 네트워크에 의해 예측된다.
- 검색 분포에 대해 학습 가능한 온도 파라미터를 도입하여 혼합을 더욱 정교하게 조정함으로써 캘리브레이션과 성능을 향상시킨다.
- 어댑터는 타겟 도메인 데이터셋에서 교차 엔트로피 손실을 사용해 엔드 투 엔드로 훈련되며, 동결된 LLM 가중치는 업데이트되지 않는다.
- 이 방법은 kNN-LM의 효율성을 유지하면서도, 검색 기반 지식과 LLM의 일반화 능력을 맥락 인식 가능한 방식으로 융합할 수 있도록 한다.
- 이 방법은 어떤 블랙박스 LLM과도 호환되며, 아키텍처 변경 없이도 적용 가능하다.
실험 결과
연구 질문
- RQ1학습 가능한 토큰 단위의 혼합 메커니즘이 도메인 적응 작업에서 검색 증강 언어 모델의 성능을 향상시킬 수 있는가?
- RQ2제한된 데이터만 이용 가능한 상황에서 kNN-Adapter는 파인튜닝과 비교해 어떻게 성능을 내는가?
- RQ3LLM API가 상위-k 토큰의 확률만 반환하는 제한된 액세스 조건에서도 kNN-Adapter는 높은 성능을 유지하는가?
- RQ4다양한 토큰 유형과 도메인에서 학습된 적응적 혼합 가중치 λ의 분석을 통해 어떤 통찰을 얻을 수 있는가?
- RQ5저자원 환경에서 kNN-Adapter는 기존의 kNN-LM과 파인튜닝된 모델을 모두 능가할 수 있는가?
주요 결과
- kNN-Adapter는 기준 모델인 kNN-LM 대비 네 가지 다른 도메인에서 퍼플렉서티를 약 2점 감소시켰으며, 추론 비용은 거의 증가하지 않았다.
- 10^4개 미만의 훈련 토큰이 이용 가능한 상황에서 파인튜닝보다 뚜렷이 뛰어난 성능을 보이며, 소수 샘플 설정에서 뛰어난 샘플 효율성을 입증했다.
- LLM API가 상위-k 토큰의 확률만 반환하는 제한된 환경에서도 kNN-Adapter는 높은 성능을 유지하여 실질적인 블랙박스 배포에 적합함을 입증했다.
- 학습된 혼합 가중치 λ는 도메인과 토큰 유형에 따라 크게 다름을 보였으며, 예를 들어 Amazon과 Enron에서는 대명사에 대해 높은 λ 값을 보였고, Wikitext-103는 데이터베이스에 대명사 토큰이 적어 낮은 값을 보였다.
- 적응적 λ 메커니즘이 핵심적임을 확인함—고정 또는 그룹 단위의 계수는 최적의 성능을 내지 못했으며, 이는 검색 증강 추론에서 토큰 수준의 개인화의 중요성을 입증한다.
- 연구 결과, kNN-Adapter의 성공은 일반 언어 지식과 도메인 특화 패턴을 동적으로 균형 잡는 능력에 기인하며, 특히 저자원 환경에서 두각을 나타낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.