[논문 리뷰] VECO: Variable and Flexible Cross-lingual Pre-training for Language Understanding and Generation
VECO는 다국어 트랜스포머 인코더에 플러그인/플러그아웃이 가능한 크로스 어텐션 모듈을 통합하여 사전 훈련 중에 명시적인 다국어 표현 정렬을 가능하게 하여 언어 이해 및 생성 작업에 대해 민첩하게 적용할 수 있도록 한다. 이는 새로운 CA-MLM 목적함수를 통해 双어 맥락 모델링을 향상시켜 XTREME 벤치마크에서 최고 성능을 기록하고, WMT14 번역 성능을 최대 1–2 BLEU 포인트 향상시킨다.
Existing work in multilingual pretraining has demonstrated the potential of cross-lingual transferability by training a unified Transformer encoder for multiple languages. However, much of this work only relies on the shared vocabulary and bilingual contexts to encourage the correlation across languages, which is loose and implicit for aligning the contextual representations between languages. In this paper, we plug a cross-attention module into the Transformer encoder to explicitly build the interdependence between languages. It can effectively avoid the degeneration of predicting masked words only conditioned on the context in its own language. More importantly, when fine-tuning on downstream tasks, the cross-attention module can be plugged in or out on-demand, thus naturally benefiting a wider range of cross-lingual tasks, from language understanding to generation. As a result, the proposed cross-lingual model delivers new state-of-the-art results on various cross-lingual understanding tasks of the XTREME benchmark, covering text classification, sequence labeling, question answering, and sentence retrieval. For cross-lingual generation tasks, it also outperforms all existing cross-lingual models and state-of-the-art Transformer variants on WMT14 English-to-German and English-to-French translation datasets, with gains of up to 1~2 BLEU.
연구 동기 및 목표
- 기존의 다국어 모델이 다국어 간 정렬을 위해 유일하게 자기 어텐션에 의존하는 데서 비롯되는 약한 다국어 어텐션 패tern을 해결하기 위해.
- 사전 훈련 중에 언어 간 상호의존성을 명시적으로 모델링하여 다국어 표현 학습을 향상시키기 위해.
- 요청 시 크로스 어텐션 통합을 통해 하나의 모델 아키텍처로 다국어 언어 이해(NLU) 및 생성(NLG) 작업을 통합하기 위해.
- 기존의 인코더 전용 또는 인코더-디코더 모델이 다른 작업 유형에 최적화될 경우 성능이 저하되는 한계를 극복하기 위해.
- 새로운 사전 훈련 목적함수인 CA-MLM을 통해 이중어 병렬 데이터의 보다 효과적인 활용을 가능하게 하기 위해, 이는 마스크된 언어 모델링과 크로스 어텐션을 통합한다.
제안 방법
- 쿼리가 한 언어의 표현에서 유도되고 키/밸류가 다른 언어의 표현에서 유도되는 플러그인/플러그아웃 크로스 어텐션 모듈을 트랜스포머 인코더에 통합하여 명시적인 다국어 어텐션을 가능하게 한다.
- 새로운 사전 훈련 목적함수인 CA-MLM(Cross-Attention Masked Language Modeling)을 제안하며, 이는 마스크된 토큰이 크로스 어텐션 모듈을 통해 자신의 언어 맥락뿐 아니라 다른 언어의 전체 맥락에도 어텐션을 가질 수 있도록 한다.
- 사전 훈련 중 크로스 어텐션 모듈을 사용하지 않고도 마스크된 토큰을 예측할 수 있도록 하여 원래 인코더의 이중 맥락 모델링 능력을 유지한다.
- 다양한 최종 작업에 따라 크로스 어텐션 모듈을 플러그인 또는 플러그아웃할 수 있도록 유연한 피지테이닝을 지원하여 NLU 또는 NLG에 최적화한다.
- 다국어 및 이중어 데이터를 사용하여 CA-MLM과 TLM 목적함수의 조합으로 모델을 사전 훈련하여 다국어 정렬 능력을 향상시킨다.
- 모든 언어에 공통된 서브워드 보편 어휘를 사용하고, 표준 마스크된 언어 모델링 및 번역 언어 모델링을 보조 목적함수로 적용한다.
실험 결과
연구 질문
- RQ1사전 훈련 중에 언어 간 명시적 크로스 어텐션을 적용할 경우, 자기 어텐션을 통한 암묵적 어텐션에 비해 다국어 표현 정렬이 향상되는가?
- RQ2플러그인/플러그아웃 가능한 크로스 어텐션 메커니즘은 통합된 모델이 언어 이해 및 생성 작업 모두에서 전용 모델을 능가할 수 있는가?
- RQ3CA-MLM 목적함수는 기존의 MLM과 TLM을 조합한 것보다 더 효과적으로 이중어 병렬 데이터를 활용할 수 있는가?
- RQ4요청 시 크로스 어텐션을 통합하는 통합 모델의 성능은 전용 인코더 전용 또는 인코더-디코더 모델에 비해 다국어 벤치마크에서 어떻게 비교되는가?
- RQ5피지테이닝 중 크로스 어텐션 모듈을 플러그인 또는 플러그아웃할 수 있는 유연성 덕분에 다양한 최종 작업에서 일관된 성능 향상이 이루어지는가?
주요 결과
- VECO는 XTREME 벤치마크에서 XLM과 XLM-R을 능가하는 새로운 최고 성능을 기록했으며, 텍스트 분류, 시퀀스 레이블링, 질의 응답, 문장 검색 등 여러 다국어 이해 작업에서 뛰어난 성능을 보였다.
- IWSLT14 영어-독어 번역 작업에서 VeCo는 XLM 대비 최대 2.1점, mBART 대비 1.5점 향상된 BLEU 점수를 기록하여 다국어 생성 성능 향상이 뚜렷하게 나타났다.
- 절단 실험 결과, CA-MLM과 TLM을 조합한 모델은 XNLI와 IWSLT14에서 각각 67.7점과 36.0점의 BLEU 점수를 기록했으며, MLM 또는 TLM만으로 훈련된 모델보다 유의미하게 뛰어난 성능을 보였다.
- CA-MLM을 사용한 사전 훈련은 XLM 대비 XNLI에서 3.2점 향상되고 IWSLT14에서 2.1점 향상되어 이중어 데이터의 보다 효과적인 활용이 가능함을 시사한다.
- mBART는 생성 작업에 최적화되어 있음에도 불구하고 XNLI에서 VeCo보다 약 6점 낮은 성능을 보였으며, 이는 명시적 크로스 어텐션을 통한 공동 사전 훈련이 NLU 작업에 더 효과적임을 시사한다.
- 플러그인 피지테이닝 전략(피지테이닝 중 크로스 어텐션 활성화)은 NLU 작업에서 성능을 추가로 향상시켜 이중어 맥락 융합의 가치를 확인시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.