Skip to main content
QUICK REVIEW

[논문 리뷰] Propagating Knowledge Updates to LMs Through Distillation

Shankar Padmanabhan, Yasumasa Onoe|arXiv (Cornell University)|2023. 06. 15.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Models, LLMs)에 지식 업데이트를 주입하고 전파하기 위한 컨텍스트 디스틸레이션 방법을 제안한다. 이를 통해 모델은 새로운 사실에 기반한 추론을 수행할 수 있다. 엔티티 정의에서 연속을 생성하고, 이를 바탕으로 '선생' 모델의 조건부 분포를 따라 디스틸레이션함으로써, 이 방법은 피니테이닝과 기울기 기반 편집 방법보다 지식 전파 및 확장성 면에서 뛰어나며, 최대 150개의 엔티티를 주입해도 성능 저하가 최소한도로 유지된다.

ABSTRACT

Modern language models have the capacity to store and use immense amounts of knowledge about real-world entities, but it remains unclear how to update such knowledge stored in model parameters. While prior methods for updating knowledge in LMs successfully inject atomic facts, updated LMs fail to make inferences based on injected facts. In this work, we demonstrate that a context distillation-based approach can both impart knowledge about entities and propagate that knowledge to enable broader inferences. Our approach consists of two stages: transfer set generation and distillation on the transfer set. We first generate a transfer set by prompting a language model to generate continuations from the entity definition. Then, we update the model parameters so that the distribution of the LM (the student) matches the distribution of the LM conditioned on the definition (the teacher) on the transfer set. Our experiments demonstrate that this approach is more effective at propagating knowledge updates than fine-tuning and other gradient-based knowledge-editing methods. Moreover, it does not compromise performance in other contexts, even when injecting the definitions of up to 150 entities at once.

연구 동기 및 목표

  • 기존의 지식 편집 방법이 사실을 주입하지만 추론을 위한 전파에 실패하는 한계를 해결하기 위해.
  • 추론을 가능하게 하는 리트리ieval-증강 프롬프팅과 추론 능력이 떨어지는 파라미터 기반 지식 주입 간 격차를 메우기 위해.
  • 기타 작업 성능을 훼손하지 않으면서도 주입된 엔티티 정의로부터 일반화할 수 있도록 확장 가능하고 파라미터 효율적인 방법을 개발하기 위해.
  • 디스틸레이션이 다양한 모델과 엔티티 집합, 특히 대규모 업데이트에 대해 지식을 효과적으로 전파할 수 있는지 평가하기 위해.

제안 방법

  • 엔티티 정의 문장의 연속을 생성하도록 언어 모델을 프롬프팅하여 전이 세트를 생성한다.
  • 학생 모델의 다음 토큰 분포를 엔티티 정의에 조건부로 설정된 선생 모델의 분포와 일치시키기 위해 지식 디스틸레이션을 사용하며, 전이 세트에서 KL 발산을 최소화한다.
  • 동일한 컨텍스트에서 학생 모델의 무조건적 출력과 선생 모델의 조건부 출력 간의 KL 손실을 사용하여 학생 모델을 훈련한다.
  • 생성자 모델을 사용하여 전이 세트를 구성하며, 기본 모델과 GPT-3.5와 같은 더 큰 모델의 출력을 비교하는 아블레이션 연구를 실시한다.
  • 모델 파라미터를 대상으로 정확히 업데이트하는 방식으로 디스틸레이션 과정을 적용하여 광범위한 분포 이탈을 방지한다.
  • 최대 150개의 엔티티를 동시에 주입할 수 있도록 방법을 확장하며, 다양한 벤치마크에서 성능와 특이성에 대해 평가한다.
Figure 1 : Overview of our distillation approach. Our goal is to inject the entity definition ( $\mathbf{d}_{e}$ ) into the student model ( $M_{s}$ ) and propagate it to make inferences based on the injected knowledge. This example uses ChatGPT as a new entity. We first generate a set of continuatio
Figure 1 : Overview of our distillation approach. Our goal is to inject the entity definition ( $\mathbf{d}_{e}$ ) into the student model ( $M_{s}$ ) and propagate it to make inferences based on the injected knowledge. This example uses ChatGPT as a new entity. We first generate a set of continuatio

실험 결과

연구 질문

  • RQ1지식 디스틸레이션이 LMs에서 원자적 사실을 초월한 추론을 가능하게 하기 위해 주입된 지식을 효과적으로 전파할 수 있는가?
  • RQ2피니테이닝 및 기울기 기반 편집(MEND, MEMIT 등) 방법과 비교할 때, 디스틸레이션 기반 방법은 지식 전파 및 성능 유지 측면에서 어떻게 다른가?
  • RQ3이 방법은 대규모 엔티티 수(예: 100개 이상)에 대해 지식 주입에 확장 가능한가? 그리고 관련 없는 작업에서 성능을 유지하는가?
  • RQ4생성자 모델의 선택(예: 기본 모델 대비 큰 모델)이 전이 세트의 품질과 최종 모델 성능에 어떤 영향을 미치는가?
  • RQ5CounterFact 벤치마크에서 가짜나 반사적 사실을 주입할 경우, 디스틸레이션 방법이 특이성을 유지하는가?

주요 결과

  • 디스틸레이션 방법은 세 언어 모델에 대해 Entity Inferences 및 Entity Cloze by Date 벤치마크에서 피니테이닝 및 이전의 편집 방법(MEND, MEMIT)보다 뚜렷이 뛰어난 성능을 보였다.
  • 최대 150개의 엔티티를 동시에 주입하더라도 관련 없는 작업에서 높은 성능을 유지하며, 성능 저하가 최소한도로 유지되었다.
  • 기본 모델 자체에서 생성된 전이 세트를 사용한 디스틸레이션은 GPT-3.5에서 생성된 것과 경쟁 가능했으며, 이는 더 큰 선생 모델이 필요하지 않음을 시사한다.
  • CounterFact 벤치마크에서 디스틸레이션 방법은 MEND 및 MEMIT보다 더 높은 특이성(neighborhood score +)을 달성했지만, 효율성과 일반화 능력은 낮아, 거짓 사실 처리 시 상충 관계가 있음을 시사한다.
  • 이 방법은 확장성 면에서 뛰어난 강건성을 보였으며, 25개 이상의 엔티티를 주입할 경우 퍼즐리티가 증가하는 MEMIT에 비해 뛰어난 성능을 보였다.
  • GPT-Neo에서는 특이성 저하가 관찰되었지만, GPT2-XL에서는 그렇지 않았으며, 이는 대규모 편집에서 특이성에 대한 모델 의존적 행동이 있음을 시사한다.
Propagating Knowledge Updates to LMs Through Distillation

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.