Skip to main content
QUICK REVIEW

[논문 리뷰] Exploring Fine-tuning Techniques for Pre-trained Cross-lingual Models via Continual Learning

Zihan Liu, Genta Indra Winata|arXiv (Cornell University)|2020. 04. 29.
Topic Modeling참고 문헌 30인용 수 17
한 줄 요약

이 논문은 mBERT와 XLM-R와 같은 사전 훈련된 다국어 모델의 미세조정 중 다국어 능력을 유지하기 위해 경사 에피소딕 메모리(GEM)를 사용하는 지속적 학습 접근법을 제안한다. 마스크된 언어 모델링(MLM) 및 다국어 문장 검색(XSR) 작업을 통해 미세조정을 제약함으로써 치명적인 잊음 문제를 방지하고, 다국어 품사 태깅 및 개체명 인식 태스크에서 최신 기술 수준의 제로샷 성능을 달성하며, 표준 미세조정 기반 모델보다 평균 1% 이상 뛰어난 성능을 보인다.

ABSTRACT

Recently, fine-tuning pre-trained language models (e.g., multilingual BERT) to downstream cross-lingual tasks has shown promising results. However, the fine-tuning process inevitably changes the parameters of the pre-trained model and weakens its cross-lingual ability, which leads to sub-optimal performance. To alleviate this problem, we leverage continual learning to preserve the original cross-lingual ability of the pre-trained model when we fine-tune it to downstream tasks. The experimental result shows that our fine-tuning methods can better preserve the cross-lingual ability of the pre-trained model in a sentence retrieval task. Our methods also achieve better performance than other fine-tuning baselines on the zero-shot cross-lingual part-of-speech tagging and named entity recognition tasks.

연구 동기 및 목표

  • 사전 훈련된 다국어 모델의 미세조정 과정에서 발생하는 치명적인 잊음 문제를 해결함으로써 다국어 성능이 악화되는 것을 방지하기 위해.
  • 원천 언어의 하류 태스크에서의 미세조정 이후 mBERT 및 XLM-R와 같은 모델의 원래 다국어 능력을 유지하기 위해.
  • 보조 작업(MLM 및 XSR)을 통한 지속적 학습이 미세조정 중 다국어 일치를 유지하는 데 효과적인지 탐색하기 위해.
  • 품사 태깅 및 명명된 실체 인식 태스크에서 제로샷 다국어 전이 성능을 향상시키기 위해.

제안 방법

  • 이 방법은 이전 태스크의 경험을 기억 형태로 저장하는 지속적 학습 프레임워크인 경사 에피소딕 메모리(GEM)를 사용한다.
  • 이전 태스크(MLM 또는 XSR)의 성능이 악화되지 않도록 보장하기 위해 부등식 제약 조건을 포함한 최적화 문제로 미세조정를 공식화한다.
  • 하류 태스크(예: 품사 태깅 또는 개체명 인식)에서 모델을 미세조정하면서, MLM 및 XSR 태스크의 성능를 유지하기 위한 정규화를 적용한다.
  • 훈련 중 제약 조건을 강제하기 위해 MLM 및 XSR 태스크의 대표적인 예제를 에피소딕 메모리에 저장한다.
  • 다국어 일반화 능력을 더 잘 유지하기 위해, MLM 및 XSR 목표를 동시에 통합된 훈련 환경에서 사용한다.
  • mBERT 및 XLM-R에 이 방법을 적용하고, 보조 태스크의 언어 범위(영어 전용 대비 전 언어)에 따른 추론 비교를 위한 분석을 수행한다.

실험 결과

연구 질문

  • RQ1GEM를 사용한 지속적 학습이 원천 언어 태스크에서의 미세조정 중 사전 훈련된 다국어 모델의 다국어 능력을 유지할 수 있는가?
  • RQ2MLM 및 XSR 태스크로 미세조정을 제약하면, 표준 미세조정 대비 품사 태깅 및 개체명 인식 태스크에서 더 나은 제로샷 다국어 전이 성능을 달성할 수 있는가?
  • RQ3성능 향상은 MLM 및 XSR 제약을 모두 사용했기 때문인지, 하나만으로도 충분한가?
  • RQ4보조 MLM 태스크에서 사용된 언어의 선택(영어 전용 대비 전 언어)이 최종 성능과 일반화 능력에 어떤 영향을 미치는가?
  • RQ5XSR에만 미세조정을 적용하면 표준 미세조정보다 더 나은 다국어 성능을 낼 수 있는가, 아니면 치명적인 잊음이 발생하는가?

주요 결과

  • MLM 및 XSR 제약 조건을 모두 적용한 GEM 방법이 품사 태깅 및 개체명 인식 태스크에서 가장 뛰어난 제로샷 다국어 성능을 달성하며, 표준 미세조정 기반 모델보다 평균 1% 이상 높은 성능을 보였다.
  • GEM w/ Both (MLM 및 XSR)는 품사 태깅에서 평균 F1 86.8%와 개체명 인식에서 75.5%를 기록하여 기반 모델인 나이브 미세조정보다 뚜렷이 뛰어난 성능을 보였다.
  • MLM 또는 XSR 태스크에서 다중 태스크 미세조정(MTF)을 수행하면 나이브 미세조정보다 하류 태스크 성능이 열악해졌으며, 이는 보조 태스크에 대한 과적합을 시사한다.
  • MLM 태스크에 대해 모든 언어를 고려한 GEM 제약 조건을 적용하면 영어 전용일 때보다 약간 성능이 열 劣하므로, 지나친 제약 조건이 일반화 능력을 저해할 수 있음을 시사한다.
  • GEM 방법은 미세조정 후에도 강력한 다국어 문장 검색(XSR) 성능을 유지하지만, 표준 미세조정은 XSR 정확도에 심각한 저하를 초래한다.
  • 분석 결과, GEM w/ MLM (모든 언어) 및 GEM w/ XSR (모든 언어) 모두 다국어 성능 향상을 이끌었지만, 두 제약 조건을 동시에 사용할 경우 가장 우수한 성능를 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.