Skip to main content
QUICK REVIEW

[논문 리뷰] Pushing the Limits of Paraphrastic Sentence Embeddings with Millions of Machine Translations

John Wieting, Kevin Gimpel|arXiv (Cornell University)|2017. 11. 15.
Topic Modeling참고 문헌 38인용 수 23
한 줄 요약

이 논문은 대규모 병렬 코퍼스의 역번역을 통해 생성된 5100만 개의 영어-영어 병렬문장 쌍으로 구성된 ParaNMT-50M 데이터셋을 소개한다. 이 코퍼스를 사용하여 저자들은 SemEval STS 벤치마크에서 이전의 모든 지도 학습 시스템을 능가하고 다양한 텍스트 스타일과 문장 구조에서 의미 유사성을 캡처하는 데 최신 기술 수준의 성능을 달성한 병렬문장 임베딩을 훈련시켰다.

ABSTRACT

We extend the work of Wieting et al. (2017), back-translating a large parallel corpus to produce a dataset of more than 51 million English-English sentential paraphrase pairs in a dataset we call ParaNMT-50M. We find this corpus to be cover many domains and styles of text, in addition to being rich in paraphrases with different sentence structure, and we release it to the community. To show its utility, we use it to train paraphrastic sentence embeddings using only minor changes to the framework of Wieting et al. (2016b). The resulting embeddings outperform all supervised systems on every SemEval semantic textual similarity (STS) competition, and are a significant improvement in capturing paraphrastic similarity over all other sentence embeddings We also show that our embeddings perform competitively on general sentence embedding tasks. We release the corpus, pretrained sentence embeddings, and code to generate them. We believe the corpus can be a valuable resource for automatic paraphrase generation and can provide a rich source of semantic information to improve downstream natural language understanding tasks.

연구 동기 및 목표

  • 다양한 도메인과 텍스트 스타일을 포함하는 대규모, 다양하고 고품질의 병렬문장 데이터셋을 구축하기 위해.
  • 기존의 지도 학습 방법을 초월하여 병렬문장 유사성을 더 잘 캡처할 수 있도록 문장 임베딩의 성능을 향상시키기 위해.
  • 인간의 주석 없이도 대규모 병렬문장 데이터를 생성하는 데에 역번역 기법의 유용성을 입증하기 위해.
  • 자동 병렬문장 생성과 후속 NLU 작업을 지원할 수 있는 자원을 공개하기 위해.

제안 방법

  • 대규모 병렬 단일언어 코퍼스의 역번역을 통해 합성된 영어-영어 병렬문장 쌍을 생성하기 위해.
  • Wieting 등 (2016b)의 프레임워크를 약간 수정하여 병렬문장 임베딩을 훈련하기 위해.
  • 수득한 5100만 개의 병렬문장 쌍을 활용하여 다양한 텍스트 분포를 포함하는 대규모 데이터셋에서 문장 임베딩을 사전 훈련하기 위해.
  • 동일한 훈련 절차를 적용하여 병렬문장 및 일반 문장 임베딩 작업 양쪽에서 뛰어난 성능을 달성하기 위해.
  • ParaNMT-50M 전체 데이터셋, 사전 훈련된 임베딩, 코드를 공개하여 재현성과 커뮤니티 활용을 위해.

실험 결과

연구 질문

  • RQ1대규모 병렬 코퍼스의 역번역을 통해 병렬문장 임베딩을 훈련시키기에 적합한 고품질의 대규모 병렬문장 데이터셋을 생성할 수 있는가?
  • RQ2ParaNMT-50M에서 훈련된 문장 임베딩의 성능은 의미 텍스트 유사성 작업에서 기존의 지도 학습 시스템과 비교해 어떻게 되는가?
  • RQ3ParaNMT-50M에 포함된 다양한 텍스트 스타일과 도메인은 문장 임베딩의 일반화 능력을 어느 정도 향상시키는가?
  • RQ4제안된 임베딩은 병행문장 작업 외의 일반 문장 임베딩 벤치마크에서도 경쟁력 있는 성능을 달성할 수 있는가?

주요 결과

  • ParaNMT-50M 데이터셋은 다양한 도메인과 텍스트 스타일을 포함한 5100만 개 이상의 영어-영어 병행문장 쌍을 포함한다.
  • ParaNMT-50M에서 훈련된 문장 임베딩은 SemEval STS 경쟁 대회 모든 과제에서 이전의 모든 지도 학습 시스템을 능가한다.
  • 기존의 모든 문장 임베딩 모델 대비 병행문장 유사성을 캡처하는 데서 뚜렷한 성능 향상을 달성한다.
  • 일반 문장 임베딩 작업에서도 경쟁력 있는 성능을 보이며, 광범위한 적용 가능성을 시사한다.
  • 데이터셋, 사전 훈련된 임베딩, 코드의 공개는 병행문장 생성 및 후속 NLU 응용 분야에서 널리 활용될 수 있도록 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.