Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Multilingual Semantic Textual Similarity with Shared Sentence Encoder for Low-resource Languages

Xin Tang, Shanbo Cheng|arXiv (Cornell University)|2018. 10. 20.
Topic Modeling참고 문헌 24인용 수 6
한 줄 요약

이 논문은 이중 방향 번역 사전학습 작업을 통해 풍부한 자원 언어(예: 영어) 데이터를 활용하여 스페인어, 아랍어, 태국어, 인도네시아어와 같은 저자원 언어에서 의미적 텍스트 유사도(STS)를 향상시키는 다국어 공유 문장 인코더 프레임워크를 제안한다. 이 방법은 공유 인코더를 통해 다국어별 문장 표현을 생성하고, 이를 앙상블하여 유사도 예측 성능을 향상시킨다. 이는 비-MT 기반 최신 기술을 능가하며 SemEval 및 산업 현장의 구두 언어 데이터에서 MT 기반 접근 방식과 동등한 성능을 기록한다.

ABSTRACT

Measuring the semantic similarity between two sentences (or Semantic Textual Similarity - STS) is fundamental in many NLP applications. Despite the remarkable results in supervised settings with adequate labeling, little attention has been paid to this task in low-resource languages with insufficient labeling. Existing approaches mostly leverage machine translation techniques to translate sentences into rich-resource language. These approaches either beget language biases, or be impractical in industrial applications where spoken language scenario is more often and rigorous efficiency is required. In this work, we propose a multilingual framework to tackle the STS task in a low-resource language e.g. Spanish, Arabic , Indonesian and Thai, by utilizing the rich annotation data in a rich resource language, e.g. English. Our approach is extended from a basic monolingual STS framework to a shared multilingual encoder pretrained with translation task to incorporate rich-resource language data. By exploiting the nature of a shared multilingual encoder, one sentence can have multiple representations for different target translation language, which are used in an ensemble model to improve similarity evaluation. We demonstrate the superiority of our method over other state of the art approaches on SemEval STS task by its significant improvement on non-MT method, as well as an online industrial product where MT method fails to beat baseline while our approach still has consistently improvements.

연구 동기 및 목표

  • 라벨이 부족한 저자원 언어에서 의미적 텍스트 유사도(STS) 문제를 해결하기 위해.
  • 기존의 MT 기반 접근 방식의 한계, 즉 비공식 텍스트에서 번역 품질 저하와 실시간 시스템에서의 높은 지연 시간을 극복하기 위해.
  • 언어별 특징 또는 전처리 없이도 풍부한 자원 언어 데이터를 활용할 수 있는 일반적이고 효율적인 프레임워크를 개발하기 위해.
  • 공유 다국어 인코더를 통해 다국어별 문장 표현을 생성함으로써 저자원 언어의 STS 성능을 향상시키기 위해.
  • 공개 벤치마크(SemEval)와 실제 산업 응용 분야의 구두 언어 데이터에서 프레임워크의 효과성을 입증하기 위해.

제안 방법

  • 대규모 단일 언어 및 다국어 코퍼스에서 이중 방향 기계 번역 작업을 통해 공유 다국어 인코더를 사전학습한다.
  • 모델은 원천 언어와 대상 언어 모두에 대해 공유된 트랜스포머 기반 인코더와 공유된 디코더를 사용하여 다국어 간 정렬을 가능하게 한다.
  • 자기 번역(self-translation)을 통해 노이즈 제거 오토인코더 유사 목적을 통합하여 사전학습 중 의미의 일관성을 유지한다.
  • 각 입력 문장에 대해 언어 토큰을 접두어로 추가하여 다양한 언어별 의미 공간에서의 다중 표현을 생성한다.
  • 공유된 다층 퍼셉트론(MLP)을 사용하여 다국어 표현들을 앙상블하여 문장 유사도를 예측한다.
  • 언어별 특징 또는 전처리 없이도, 풍부한 자원 언어와 저자원 언어의 라벨이 부여된 STS 데이터를 통해 프레임워크를 미세조정한다.

실험 결과

연구 질문

  • RQ1번역 작업을 통해 사전학습된 공유 다국어 문장 인코더가 저자원 언어에서 STS 성능을 향상시킬 수 있는가?
  • RQ2저자원 STS 환경에서 제안된 방법이 비-MT 및 MT 기반 기준 모델과 비교해 어떻게 성능을 내는가?
  • RQ3공유 인코더를 통해 다국어별 문장 표현을 다수 생성하는 것이 유사도 평가 성능을 향상시키는가?
  • RQ4MT 품질이 저하되는 비공식적이고 구두 언어 입력에서도 프레임워크가 높은 성능을 유지할 수 있는가?
  • RQ5다국어 데이터에서의 사전학습이 제로샷 또는 소수의 레이블이 있는 상황에서 STS 성능 향상에 얼마나 기여하는가?

주요 결과

  • SemEval 2017 스페인어(es-es) 과제에서, 영어 및 스페인어 데이터와 다국어 표현을 함께 미세조정한 결과, 스피어만 상관계수 0.825를 기록하여 비-MT 기준 모델을 크게 능가했다.
  • 스페인어 전용 학습 데이터로만 학습한 경우, 사전학습 후 스피어만 상관계수는 0.188에서 0.727로 향상되어 소수의 레이블에서도 강력한 제로샷 일반화 능력을 보였다.
  • SemEval에서 비-MT 최신 기술을 능가했으며, 스페인어 및 아랍어 쌍에서는 MT 기반 방법과 동등한 성능을 기록했다.
  • 태국어 및 인도네시아어의 구두 언어 데이터에 산업 현장에서 적용한 결과, MT 기반 기준 모델을 지속적으로 능가했으며, 이 설정에서는 MT 기반 모델이 기본 모델조차도 뛰어넘지 못했다.
  • 최소한의 라벨 데이터로도 사전학습이 성능 향상에 크게 기여하여, 저자원 환경에서 다국어 표현 학습이 효과적임을 입증했다.
  • 제거 실험(ablation study)를 통해 사전학습과 다국어 표현 포함 여부가 성능 향상에 결정적인 역할을 하며, 특히 저자원 환경에서 그 중요성이 높아짐을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.