[논문 리뷰] Unsupervised Domain Adaptation with Adapter
이 논문은 사전 훈련된 언어 모델(PrLM)에 훈련 가능한 어댑터 모듈을 삽입하면서 기존 PrLM 가중치를 동결하는 방식의 어댑터 기반 미세조정 방법을 제안한다. 이 방법은 원천 및 대상 도메인 데이터를 혼합하여 사용하는 도메인 융합 훈련과 그 후 작업별 미세조정을 거치는 이단계 훈련 과정을 사용하며, 파rameter 효율성과 지식 보존을 향상시켜 SDA와 XNLI에서 각각 1.21%와 1.09% 향상된 최신 기술 수준의 성능을 달성한다.
Unsupervised domain adaptation (UDA) with pre-trained language models (PrLM) has achieved promising results since these pre-trained models embed generic knowledge learned from various domains. However, fine-tuning all the parameters of the PrLM on a small domain-specific corpus distort the learned generic knowledge, and it is also expensive to deployment a whole fine-tuned PrLM for each domain. This paper explores an adapter-based fine-tuning approach for unsupervised domain adaptation. Specifically, several trainable adapter modules are inserted in a PrLM, and the embedded generic knowledge is preserved by fixing the parameters of the original PrLM at fine-tuning. A domain-fusion scheme is introduced to train these adapters using a mix-domain corpus to better capture transferable features. Elaborated experiments on two benchmark datasets are carried out, and the results demonstrate that our approach is effective with different tasks, dataset sizes, and domain similarities.
연구 동기 및 목표
- 도메인 특화의 비지도 도메인 적응(UDA)을 위한 전면 사전 훈련된 언어 모델(PrLM)의 미세조정에서 지식 왜곡과 높은 구현 비용 문제를 해결하기 위해.
- 도메인 적응 중 PrLM의 파rameters를 동결하여 내장된 일반 지식을 보존하기 위해.
- 파rameter 효율적인 어댑터 모듈을 사용하여 도메인 간 특징 이동성을 향상시키기 위해.
- 도메인 융합 후 작업별 미세조정을 거치는 이단계 훈련 과정이 UDA 성능 향상에 얼마나 효과적인지 탐색하기 위해.
제안 방법
- Transformer 기반의 사전 훈련된 언어 모델(PrLM)에 훈련 가능한 어댑터 모듈을 삽입하며, 훈련 중 기존 PrLM 파arameters를 동결한다.
- 이중단계 훈련 과정을 적용한다: 첫째, 원천 및 대상 도메인 데이터의 혼합 코퍼스를 사용하여 마스크된 언어 모델링(MLM) 손실을 기반으로 도메인 융합 훈련을 수행한다; 둘째, 원천 도메인 데이터를 사용하여 작업별 손실을 기반으로 작업별 미세조정을 수행한다.
- 다양한 도메인 데이터에서 함께 최적화함으로써 도메인 간 이동 가능한 특징을 학습하기 위해 도메인 융합 훈련을 활용한다.
- 파arameter 오버헤드를 최소화하기 위해 다운프로젝션, 피드포워드 네트워크, 업프로젝션 레이어를 포함한 브로드캐스트 어댑터 아키텍처를 구현한다.
- 다양한 도메인 융합 전략 하에서 도메인 정렬과 특징 이동 가능성 분석을 위해 히든 표현의 t-SNE 시각화를 수행한다.
- 다양한 데이터 크기와 도메인 유사도 조건에서 두 가지 벤치마크 데이터셋(SDA 및 XNLI)에서 방법을 평가한다.
실험 결과
연구 질문
- RQ1어댑터 기반 미세조정은 비지도 도메인 적응 중 사전 훈련된 언어 모델의 일반 지식을 보존할 수 있는가?
- RQ2도메인 융합 후 작업별 미세조정을 거치는 이단계 훈련 과정은 표준 미세조정 대비 UDA 성능 향상에 얼마나 효과적인가?
- RQ3혼합 도메인 데이터를 사용한 도메인 융합 훈련은 특히 도메인이 유사할 경우 특징 이동 가능성 향상에 기여하는가?
- RQ4UDA 설정에서 다양한 데이터 크기와 도메인 유사도에 따라 모델 성능은 어떻게 변하는가?
- RQ5지식 보존과 최종 작업 정확도 향상 측면에서 어댑터 기반 적응은 전면 미세조정보다 더 효과적인가?
주요 결과
- 제안된 어댑터 기반 방법은 SDA 데이터셋에서 전면 미세조정 대비 1.21% 향상되고, XNLI 데이터셋에서 1.09% 향상되어 뛰어난 성능을 보였다.
- 작은 SDA 데이터셋에서 이단계 훈련 과정은 어댑터의 효과를 약 6배 향상시켜 성능을 92.89%에서 93.31%로 향상시켰다.
- 도메인 융합 훈련은 도메인이 유사한 SDA에서는 1.14% 향상되었지만, 도메인이 다를 경우인 XNLI에서는 오직 0.22% 향상되어 도메인 유사도에 민감한 것으로 나타났다.
- t-SNE 시각화 결과, 어댑터를 사용한 도메인 융합 전략이 전면 모델 도메인 융합 또는 도메인 융합 없음 전략보다 더 잘 분리되고 더 잘 정렬된 히든 표현을 보였다.
- 도메인 융합 없이 어댑터 모듈만 사용할 경우 SDA에서 성능 향상이 0.07%에 그쳤지만, 이단계 훈련 과정을 거치면 0.87% 향상되어 소규모 데이터에서 도메인 융합의 필수성을 입증했다.
- 오직 어댑터 파arameters만 미세조정되기 때문에 전체 모델 재훈련이 필요 없어 비용이 많이 들지 않아 효율성과 확장성이 매우 높다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.