Skip to main content
QUICK REVIEW

[논문 리뷰] K-Adapter: Infusing Knowledge into Pre-Trained Models with Adapters

Ruize Wang, Duyu Tang|arXiv (Cornell University)|2020. 02. 05.
Topic Modeling참고 문헌 43인용 수 135
한 줄 요약

K-Adapter는 원래의 사전 학습 모델을 고정 상태로 두고 지식에 특화된 어댑터를 추가하여 사실적 지식과 언어 지식을 주입하고, 지속적이고 분리된 지식 주입과 다운스트림 작업 성능 향상을 가능하게 한다.

ABSTRACT

We study the problem of injecting knowledge into large pre-trained models like BERT and RoBERTa. Existing methods typically update the original parameters of pre-trained models when injecting knowledge. However, when multiple kinds of knowledge are injected, the historically injected knowledge would be flushed away. To address this, we propose K-Adapter, a framework that retains the original parameters of the pre-trained model fixed and supports the development of versatile knowledge-infused model. Taking RoBERTa as the backbone model, K-Adapter has a neural adapter for each kind of infused knowledge, like a plug-in connected to RoBERTa. There is no information flow between different adapters, thus multiple adapters can be efficiently trained in a distributed way. As a case study, we inject two kinds of knowledge in this work, including (1) factual knowledge obtained from automatically aligned text-triplets on Wikipedia and Wikidata and (2) linguistic knowledge obtained via dependency parsing. Results on three knowledge-driven tasks, including relation classification, entity typing, and question answering, demonstrate that each adapter improves the performance and the combination of both adapters brings further improvements. Further analysis indicates that K-Adapter captures versatile knowledge than RoBERTa.

연구 동기 및 목표

  • 이전에 학습한 지식을 덮어쓰지 않으면서 대형 사전 학습 모델에 지식을 주입해야 할 필요성을 제시한다.
  • 백본을 고정된 상태로 두고 개별 지식 어댑터를 학습하는 유연한 어댑터 기반 프레임워크(K-Adapter)를 제안한다.
  • 여러 어댑터를 독립적으로 학습하고 결합하여 지식 주도 작업을 개선할 수 있음을 보여준다.
  • 새로운 어댑터가 기존 어댑터에 영향을 주지 않는 지속적(연속적) 지식 주입을 선보인다.

제안 방법

  • RoBERTa 외부에 연결된 지식 특화 어댑터를 도입하고 이들이 백본의 중간 은닉 상태를 입력으로 사용한다.
  • RoBERTa 매개변수를 고정한 채 어댑터를 학습시키고 매개변수 수를 작게 유지한다(~42M per adapter).
  • 다른 작업에 대해 독립적으로 어댑터를 선행 학습한다: 관계 분류(사실 지식)를 위한 facAdapter와 의존 관계 예측(언어 지식)을 위한 linAdapter.
  • 다운스트림 작업 레이어를 위해 어댑터 출력의 표현을 RoBERTa 출력과 함께 연결(concatenate)하여 융합한다; 여러 어댑터를 작업에 맞게 결합할 수 있다.
  • RoBERTa-LARGE를 백본으로 사용하고 어댑터를 N=2 변환기 층, 은닉 크기 H_A=768, H_d=768, H_u=1024, A_A=12로 구성한다.
  • 개별 어댑터의 이득과 이들의 결합으로 얻는 이점을 평가하기 위해 엔터티 타입 지정, 질의 응답 및 관계 분류를 평가한다.

실험 결과

연구 질문

  • RQ1외부 어댑터를 사용해 고정된 사전 학습 모델에 지식을 주입하더라도 재앙적 망각 없이 가능할까?
  • RQ2별도의 사실 지식 어댑터와 언어 지식 어댑터가 지식 주도 작업에서 상호 보완적인 개선을 제공할까?
  • RQ3여러 어댑터를 결합하는 것이 하나의 어댑터에 비해 더해지는(additive) 혹은 시너지 효과를 낼까?
  • RQ4RoBERTa 및 다중 과제(Base라인) 대비 엔터티 타입 지정, QA, 관계 분류에서 K-Adapter의 성능은 어떠한가?
  • RQ5LAMA로 측정된 탐색(probing)에서 사실 지식의 기억력을 향상시키는가?

주요 결과

  • 각 어댑터(사실 및/또는 언어)가 지식 주도 작업에서 RoBERTa 기준선보다 개선된다.
  • 사실 어댑터와 언어 어댑터의 결합은 개별 어댑터를 넘어 추가 개선을 이끈다.
  • K-Adapter (F+L)는 테스트된 과제들 중 여러 데이터셋에서 최첨단 결과를 달성한다.
  • 프로빙 결과 K-Adapter가 RoBERTa보다 더 풍부한 사실 지식을 기억하며 지식 포착이 강화되었음을 나타낸다.
  • 분리된 어댑터는 이전에 주입된 지식을 재훈련 없이 지속적으로 주입하고 악화시키지 않도록 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.