Skip to main content
QUICK REVIEW

[논문 리뷰] On Learning Universal Representations Across Languages

Xiangpeng Wei, Rongxiang Weng|arXiv (Cornell University)|2020. 07. 31.
Topic Modeling참고 문헌 64인용 수 11
한 줄 요약

이 논문은 계층적 대비 학습(Hictl)을 제안하며, 대비 학습을 통해 문장 수준와 어휘 수준의 보편적 표현을 동시에 학습함으로써 번역 전이 모델의 성능을 향상시키는 자기지도 학습 프레임워크이다. Hictl은 XTREME에서 XLM-R보다 절대 정확도 4.2% 향상시키며, 저자원 및 고자원 기계 번역 작업에서 최신 기준 성능을 달성한다.

ABSTRACT

Recent studies have demonstrated the overwhelming advantage of cross-lingual pre-trained models (PTMs), such as multilingual BERT and XLM, on cross-lingual NLP tasks. However, existing approaches essentially capture the co-occurrence among tokens through involving the masked language model (MLM) objective with token-level cross entropy. In this work, we extend these approaches to learn sentence-level representations and show the effectiveness on cross-lingual understanding and generation. Specifically, we propose a Hierarchical Contrastive Learning (HiCTL) method to (1) learn universal representations for parallel sentences distributed in one or multiple languages and (2) distinguish the semantically-related words from a shared cross-lingual vocabulary for each sentence. We conduct evaluations on two challenging cross-lingual tasks, XTREME and machine translation. Experimental results show that the HiCTL outperforms the state-of-the-art XLM-R by an absolute gain of 4.2% accuracy on the XTREME benchmark as well as achieves substantial improvements on both of the high-resource and low-resource English-to-X translation tasks over strong baselines.

연구 동기 및 목표

  • 기존의 토큰 수준의 마스킹 언어 모델링에 의존하는 다국어 사전 훈련 모델의 한계를 해결하기 위해 문장 수준의 의미를 포착하지 못하는 문제를 해결한다.
  • 의미적으로 동일한 문장 간의 의미 차이를 줄이기 위해 언어에 관계없이 동일한 표현을 학습함으로써 의미 기반의 일관성을 확보한다.
  • 문장 수준과 어휘 수준의 동시 대비 학습을 통해 제로샷 및 저자원 설정에서의 다국어 전이 성능을 향상시킨다.
  • 계층적 대비 학습이 현재 최고 수준의 모델을 초월하여 다국어 이해 및 생성 작업 전반에서 성능 향상을 이끌어내는지 입증한다.

제안 방법

  • Hictl은 병렬 문장 쌍 간의 [CLS] 토큰을 이용해 BERT 스타일 인코더를 사용해 문장 표현을 생성한다.
  • 문장 수준에서, 병렬 문장 간 유사도를 극대화하고 비병렬 문장 간 유사도를 최소화하기 위해 대비 학습을 적용한다.
  • 어휘 수준에서, 문장 쌍 내의 각 어휘를 양성 샘플로 간주하고 공유 어휘 집합 내의 나머지 어휘를 부정 샘플로 간주하며, 계산 비용을 줄이기 위해 하드 부정 샘플링을 사용한다.
  • 문장 수준과 어휘 수준의 대비 목적함수를 결합하여 보편적인 다국어 표현을 동시에 최적화한다.
  • Hictl은 대규모 단어어 단일어 언어 코퍼스(CCNet-100)에서 사전 훈련을 수행하고, XTREME 및 기계 번역 벤치마크와 같은 최종 작업에 대해 미세 조정한다.
  • 모델은 제로샷 및 소수의 샘플이 있는 설정에서 평가되며, 특히 대상 언어 쌍에 병렬 데이터가 존재하지 않는 언어 전이 작업에서도 평가된다.

실험 결과

연구 질문

  • RQ1문장 수준와 어휘 수준의 동시 대비 학습이 토큰 수준의 마스킹 언어 모델링을 초월하여 다국어 표현 학습을 향상시킬 수 있는가?
  • RQ2계층적 대비 학습이 다국어 문장 쌍 간의 의미적 불일치를 어느 정도 줄이는가?
  • RQ3제안된 방법이 병렬 데이터가 없는 저자원 및 제로샷 번역 설정에 일반화되는가?
  • RQ4Hictl은 XLM-R 및 BERT-융합 기계 번역(NMT)과 같은 강력한 베이스라인 모델과 비교해 다국어 이해 및 생성 작업에서 어떤 성능을 보이는가?

주요 결과

  • Hictl은 XTREME 벤치마크에서 XLM-R보다 절대 정확도 4.2% 향상되었으며, BUCC 및 Tatoeba와 같은 제로샷 문장 검색 작업에서는 최대 6.0% 향상된 성과를 기록했다.
  • IWSLT’14 영어→독어 번역 작업에서 Hictl은 표준 Transformer 기준보다 BLEU 점수를 3.34점 향상시켰다.
  • 고자원 WMT’16 영어→독어 번역 작업에서는 Hictl이 표준 Transformer보다 BLEU 점수를 2.95점 향상시켰다.
  • 제로샷 언어 전이 설정에서 Hictl은 mBART 및 HiCTL를 초월했으며, 이탈리아어→영어에서 18.6 BLEU, 네팔어→영어에서 16.0 BLEU를 기록했고, mBART는 각각 16.7 및 14.5 BLEU를 기록했다.
  • IWSLT’17 영어→프랑스어 및 영어→중국어 번역 작업에서 Hictl은 BLEU 점수를 각각 3.24점 및 3.40점 향상시켰다.
  • 제한된 단일어 언어 데이터로도 모델은 강력한 성능를 보였지만, 구자라트어와 같이 저자원 언어의 경우 사전 훈련 데이터가 부족할 경우 성능 저하가 심각하게 발생했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.