Skip to main content
QUICK REVIEW

[논문 리뷰] CoSDA-ML: Multi-Lingual Code-Switching Data Augmentation for Zero-Shot Cross-Lingual NLP

Libo Qin, Minheng Ni|arXiv (Cornell University)|2020. 06. 11.
Topic Modeling참고 문헌 18인용 수 11
한 줄 요약

이 논문은 다국어 번역 사전을 사용하여 영어 원본 텍스트와 여러 타겟 언어의 번역문을 동적으로 혼합함으로써 다국어 코드 스위칭 문장을 생성하는 데이터 증강 프레임워크 CoSDA-ML을 제안한다. 이 방법은 mBERT를 단일 학습 과정에서 19개 언어 간의 문맥적 표현을 정렬하도록 피지테이닝하여, 병렬 문장 쌍이 없이도 mBERT와 XLM보다 유의미한 성능 향상을 이룬다. 특히 영어 학습 데이터의 1/10만으로도 성능 향상을 달성한다.

ABSTRACT

Multi-lingual contextualized embeddings, such as multilingual-BERT (mBERT), have shown success in a variety of zero-shot cross-lingual tasks. However, these models are limited by having inconsistent contextualized representations of subwords across different languages. Existing work addresses this issue by bilingual projection and fine-tuning technique. We propose a data augmentation framework to generate multi-lingual code-switching data to fine-tune mBERT, which encourages model to align representations from source and multiple target languages once by mixing their context information. Compared with the existing work, our method does not rely on bilingual sentences for training, and requires only one training process for multiple target languages. Experimental results on five tasks with 19 languages show that our method leads to significantly improved performances for all the tasks compared with mBERT.

연구 동기 및 목표

  • mBERT와 같은 다국어 모델에서 언어 간 일관되지 않은 문맥 기반 서브워드 표현을 해결하기 위해.
  • 병행 학습 데이터나 타겟 언어별 별도의 모델이 필요 없이 제로샷 다국어 전이 성능을 향상시키기 위해.
  • 단일 피지테이닝 과정에서 원본 언어와 다수의 타겟 언어 표현을 동시에 정렬할 수 있도록 하기 위해.
  • 다양한 저자원 언어에 걸쳐 mBERT의 다국어 일반화 능력을 향상시키는 유연하고 동적인 데이터 증강 방법을 개발하기 위해.

제안 방법

  • 해당 방법은 영어 문장을 무작위로 선택하고, 다국어 번역 사전을 활용해 선택된 토큰들을 여러 타겟 언어의 번역어로 교체하여 코드 스위칭 문장을 구성한다.
  • 교체 작업은 각 배치마다 동적으로 수행되어, 각 에포크 동안 다양한 언어 조합의 다양성 있는 코드 스위칭 데이터를 확보한다.
  • 프레임워크는 병행 문장 쌍에 의존하지 않고, 단일 언어 문장과 다국어 번역 사전만을 사용하여 데이터 생성을 수행한다.
  • 증강된 데이터는 mBERT를 피지테이닝하는 데 사용되며, 이로써 모델이 원본 언어와 다수의 타겟 언어 간의 단어 표현을 암묵적으로 정렬하도록 유도한다.
  • 이 방법은 mBERT에 국한되지 않고, BiLSTM 실험을 통해 어떤 기본 인코더 모델과도 호환됨을 입증하였다.
  • 공유 서브워드 토큰화와 문맥적 어텐션을 활용하여, 언어 간 공통 임베딩 공간에서 표현을 정렬한다.

실험 결과

연구 질문

  • RQ1동적인 다국어 코드 스위칭 데이터 증강이 여러 언어 간 제로샷 다국어 전이 성능 향상에 기여하는가?
  • RQ2제안된 방법이 병행 문장이 없이도 mBERT보다 더 나은 다국어 표현 정렬을 달성하는가?
  • RQ3단일 피지테이닝 과정이 원본 언어와 다수의 타겟 언어 표현을 동시에 정렬하는 데 효과적인가?
  • RQ4이 데이터 증강 프레임워크는 mBERT를 초월하여, 예를 들어 프리트레인되지 않은 인코더인 BiLSTM 등에서도 효과가 있는가?

주요 결과

  • CoSDA-ML은 자연어 추론, 감성 분류, 문서 분류, 자연어 이해, 대화 상태 추적과 같은 다섯 가지 제로샷 다국어 NLP 작업에서 mBERT 및 XLM 기준선을 뛰어넘는 성능을 기록했다.
  • 일부 작업에서는 영어 학습 데이터의 1/10만으로도 최신 기술 수준의 성능을 달성하여, 뛰어난 데이터 효율성을 입증했다.
  • CLS 토큰 벡터의 시각화 결과, CoSDA-ML 피지테이닝 후 동일한 의도를 가진 서로 다른 언어의 표현들이 임베딩 공간에서 더 가까워지고 겹치는 경향을 보여, 효과적인 다국어 정렬이 이루어졌음을 확인했다.
  • 19개 언어 전반에서 일관된 성능 향상이 이루어져, 다국어 환경에서의 확장성과 견고성을 입증했다.
  • BiLSTM에 적용한 결과, 모든 언어 및 메트릭에서 기준선을 초월하여, 이 방법이 트랜스포머 기반 모델을 초월한 효과성을 지닌다는 점을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.