Skip to main content
QUICK REVIEW

[논문 리뷰] L3Cube-IndicSBERT: A simple approach for learning cross-lingual sentence representations using multilingual BERT

Samruddhi Deode, Janhavi Gadre|arXiv (Cornell University)|2023. 04. 22.
Natural Language Processing Techniques인용 수 5
한 줄 요약

이 논문은 번역된 NLI 및 STS 데이터셋에서 유도된 합성 단어장의 병렬 데이터를 사용하여 일반 다국어 BERT를 미세조정하여 10개의 인도어 언어를 위한 다국어 문장 임베딩 모델인 L3Cube-IndicSBERT를 제안한다. 이 방법은 다국어 및 단국어 의미 유사성 작업에서 최신 기술 수준의 성능을 달성하며, LaBSE나 paraphrase-multilingual-mpnet-base-v2와 같은 모델들을 능가한다.

ABSTRACT

The multilingual Sentence-BERT (SBERT) models map different languages to common representation space and are useful for cross-language similarity and mining tasks. We propose a simple yet effective approach to convert vanilla multilingual BERT models into multilingual sentence BERT models using synthetic corpus. We simply aggregate translated NLI or STS datasets of the low-resource target languages together and perform SBERT-like fine-tuning of the vanilla multilingual BERT model. We show that multilingual BERT models are inherent cross-lingual learners and this simple baseline fine-tuning approach without explicit cross-lingual training yields exceptional cross-lingual properties. We show the efficacy of our approach on 10 major Indic languages and also show the applicability of our approach to non-Indic languages German and French. Using this approach, we further present L3Cube-IndicSBERT, the first multilingual sentence representation model specifically for Indian languages Hindi, Marathi, Kannada, Telugu, Malayalam, Tamil, Gujarati, Odia, Bengali, and Punjabi. The IndicSBERT exhibits strong cross-lingual capabilities and performs significantly better than alternatives like LaBSE, LASER, and paraphrase-multilingual-mpnet-base-v2 on Indic cross-lingual and monolingual sentence similarity tasks. We also release monolingual SBERT models for each of the languages and show that IndicSBERT performs competitively with its monolingual counterparts. These models have been evaluated using embedding similarity scores and classification accuracy.

연구 동기 및 목표

  • 저자원 인도 지역어를 위한 고성능 다국어 문장 임베딩 모델의 부족을 해결한다.
  • 병행 단어장 코퍼스나 복잡한 학습 체계가 필요 없이도 교차 언어 전이를 향상시킬 수 있는 강력하고 확장 가능한 접근법을 개발한다.
  • 일반 다국어 BERT의 교차 언어 능력을 크게 향상시키기 위해 합성 번역된 단어장 STS 및 NLI 데이터에 대한 단순한 미세조정 전략의 효과를 입증한다.
  • 10개 주요 인도어 언어와 영어를 대상으로 다국어 및 단국어 SBERT 모델을 공개하여 저자원 환경에서의 NLP 연구 및 응용을 지원한다.

제안 방법

  • 10개의 인도어 언어에 대해 번역된 NLI 및 STS 데이터셋으로 구성된 혼합 합성 코퍼스를 사용하여 사전 학습된 다국어 BERT(MuRIL)를 미세조정한다.
  • 문장 임베딩을 의미 텍스트 유사성 최적화를 위해 일반적인 SBERT의 시아모이드 네트워크 아키텍처를 적용한다.
  • 공유 벡터 공간 내에서 의미적으로 유사한 문장 쌍이 가까운 임베딩을 가지도록 유도하기 위해 미세조정 중 대비 손실 함수를 사용한다.
  • 다양한 목표 언어의 번역된 단어장 데이터를 하나의 혼합 훈련 세트로 통합하여 통합된 교차 언어 학습을 가능하게 한다.
  • 교차 언어 전처리 없이도 다국어 BERT의 내재된 교차 언어 능력을 활용하기 위해 최소한의 작업 특화 미세조정을 적용한다.
  • 모든 10개의 인도어 언어와 영어를 위한 통합 인코더로 기능하는 다국어 모델과 각 언어별 단국어 SBERT 변형을 동시에 훈련한다.

실험 결과

연구 질문

  • RQ1합성 단어장 번역 데이터에 대한 단순한 미세조정 전략이 일반 다국어 BERT의 교차 언어 성능을 크게 향상시킬 수 있는가?
  • RQ2L3Cube-IndicSBERT와 같은 다국어 SBERT 모델의 성능은 교차 언어 의미 유사성 작업에서 기존 최신 기술 수준의 모델인 LaBSE 및 paraphrase-multilingual-mpnet-base-v2와 비교해 어떻게 되는가?
  • RQ3합성 데이터에 의한 미세조정이 실제 응용 분야의 하류 NLP 작업, 예를 들어 텍스트 분류 작업에 얼마나 잘 일반화되는가?
  • RQ4동일한 미세조정 전략을 통해 각 인도어 언어의 경쟁력 있는 단국어 SBERT 모델을 생성할 수 있으며, 이는 해당 언어의 일반 BERT 모델을 능가하는가?
  • RQ5이 방법은 인도어 외의 언어, 예를 들어 독일어나 프랑스어에 적용되었을 때도 효과를 보이며, 이는 인도어 언어를 넘어서 보편적인 적용 가능성을 시사하는가?

주요 결과

  • L3Cube-IndicSBERT는 10개의 인도어 언어에서 교차 언어 의미 텍스트 유사성(STS) 작업에서 최신 기술 수준의 성능을 달성하며, 평균적으로 LaBSE와 paraphrase-multilingual-mpnet-base-v2를 능가한다.
  • 다국어 모델은 교차 언어 STS 작업에서 평균 STS 점수 0.71을 기록했으며, 힌두어(0.82)와 벤갈리어(0.82)는 특히 뛰어난 성능을 보였다.
  • 각 인도어 언어의 단국어 SBERT 변형은 단국어 STS 벤치마크에서 임베딩 유사성 측면에서 해당하는 일반 BERT 모델보다 뛰어난 성능을 보였다.
  • 실제 텍스트 분류 데이터셋에서 미세조정된 모델은 잘 일반화되어 있으며, 새로운 관련 작업에 대해 강력한 제로샷 전이 능력을 보였다.
  • 오리야어와 말라요람어와 같이 저자원 언어에서도 높은 성능을 기록했으며, STS 점수는 각각 0.70과 0.74로 강력한 내성성을 보였다.
  • 이 방법은 비-인도어 언어로도 적용 가능하다: 독일어와 프랑스어는 경쟁력 있는 결과를 기록하여 이 방법의 일반화 가능성은 인도어 언어를 넘어서도 유효함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.