Skip to main content
QUICK REVIEW

[논문 리뷰] Knowledge Distillation for BERT Unsupervised Domain Adaptation

Minho Ryu, Kichun Lee|arXiv (Cornell University)|2020. 10. 22.
Topic Modeling인용 수 9
한 줄 요약

이 논문은 BERT를 위한 새로운 비지도 도메인 적응 방법인 Adversarial Adaptation with Distillation (AAD)을 제안한다. AAD는 악성 도메인 적응(ADDA)과 지식 정착을 결합하여 치명적인 잊음 현상을 완화한다. 소스 모델을 미세조정한 후 타겟 BERT를 초기화하고, 온도 조절 소프트 레이블 손실을 사용한 정착을 적용함으로써, 30개의 도메인 간 감성 분류 작업에서 최신 기술 수준(SOTA) 성능을 달성한다. 기준 방법 대비 평균 1.6%의 정확도 향상을 기록하며 안정성 또한 향상된다.

ABSTRACT

A pre-trained language model, BERT, has brought significant performance improvements across a range of natural language processing tasks. Since the model is trained on a large corpus of diverse topics, it shows robust performance for domain shift problems in which data distributions at training (source data) and testing (target data) differ while sharing similarities. Despite its great improvements compared to previous models, it still suffers from performance degradation due to domain shifts. To mitigate such problems, we propose a simple but effective unsupervised domain adaptation method, adversarial adaptation with distillation (AAD), which combines the adversarial discriminative domain adaptation (ADDA) framework with knowledge distillation. We evaluate our approach in the task of cross-domain sentiment classification on 30 domain pairs, advancing the state-of-the-art performance for unsupervised domain adaptation in text sentiment classification.

연구 동기 및 목표

  • 소스 도메인과 타겟 도메인 간 도메인 이동으로 인한 BERT 모델의 성능 저하 문제를 해결하기 위해.
  • ADDA 프레임워크를 BERT와 같은 대규모 사전 학습 모델에 적용할 때 발생하는 치명적인 잊음 현상을 극복하기 위해.
  • 악성 적응 파ip라인에 지식 정착을 통합하여 도메인 적응의 안정성과 성능을 향상시키기 위해.
  • 지식 정착에서 온도 초모수의 영향이 모델의 일반화 및 강건성에 미치는 영향을 조사하기 위해.

제안 방법

  • 소스 인코더의 미세조정된 가중치로 타겟 인코더를 초기화하여 ADDA 프레임워크를 BERT에 적용한다.
  • 타겟 인코더와 도메인 구분자 간의 악성 학습을 수행하여 도메인 간 차이를 최소화한다.
  • 소스 모델의 소프트 레이블을 사용해 타겟 모델의 예측을 정규화한다.
  • 정착 과정에서 온도 조절된 교차 엔트로피 손실을 사용하여 확률 분포를 부드럽게 하여 클래스 정보를 유지한다.
  • 악성 도메인 손실과 정착 손실을 조합한 손실 함수를 사용해 타겟 BERT와 분류기의 공동 학습을 수행한다.
  • 두 단계 과정을 통해 타겟 모델을 최적화한다: 첫 번째로 악성 도메인 정렬, 두 번째로 정착 기반 정규화

실험 결과

연구 질문

  • RQ1비표본 타겟 데이터가 존재하는 조건에서, 지식 정착이 BERT를 새로운 도메인에 적응시키는 데 있어 치명적인 잊음 현상을 효과적으로 방지할 수 있는가?
  • RQ2지식 정착에서 온도 초모수의 변화가 적응된 BERT 모델의 성능과 안정성에 어떤 영향을 미치는가?
  • RQ3악성 도메인 적응과 지식 정착을 결합하면, BERT 기반 감성 분류에서 기존의 비지도 도메인 적응 방법보다 더 높은 성능을 달성할 수 있는가?
  • RQ4기존 기준 방법 대비 제안된 방법이 다양한 도메인 쌍에 걸쳐 더 안정적인가?

주요 결과

  • AAD는 30개의 도메인 간 감성 분류 쌍 중 21개에서 기준 방법을 뛰어넘으며, 평균 1.6%의 정확도 향상을 기록한다.
  • 메서드는 실험 전반에서 더 낮은 표준편차를 보이며 뛰어난 안정성을 확보한다.
  • 온도 20에서 지식 정착을 적용할 경우 최고의 성능을 기록하지만, 더 높은 온도(예: 50)는 레이블 정보의 과도한 부드러움으로 인해 성능 저하를 초래한다.
  • 온도 t=1 이외의 모든 온도 값에서 지식 정착은 지도 미세조정 기준 방법을 능가하며, 정규화 효과가 있음을 시사한다.
  • DDC와 DANN과 같은 기존 방법들은 평균적으로 기준 방법보다 열등한 성능을 보이며, BERT에 표준 도메인 적응를 적용할 경우의 한계를 드러낸다.
  • deep CORAL 방법은 DDC와 DANN보다 우수한 성능을 보이나, AAD보다 평균 1.1% 떨어진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.