Skip to main content
QUICK REVIEW

[논문 리뷰] MultiMWE: Building a Multi-lingual Multi-Word Expression (MWE) Parallel Corpora

Lifeng Han, Gareth J. F. Jones|arXiv (Cornell University)|2020. 05. 21.
Natural Language Processing Techniques참고 문헌 21인용 수 6
한 줄 요약

이 논문은 표준화된 파ip라인을 사용하여 병렬 코퍼스에서 추출한 316만 개의 독일어-영어 및 14만 3,042개의 중국어-영어 다어적어미(MWE) 쌍을 포함하는 대규모 다국어 병렬 코퍼스인 MultiMWE를 소개한다. 이 코퍼스는 신경 기계 번역(NMT) 성능을 향상시키며, MWE 번역의 정성적 향상과 BLEU 점수의 약간의 정량적 향상(특히 MWE가 훈련 데이터에 통합된 경우)을 보여준다.

ABSTRACT

Multi-word expressions (MWEs) are a hot topic in research in natural language processing (NLP), including topics such as MWE detection, MWE decomposition, and research investigating the exploitation of MWEs in other NLP fields such as Machine Translation. However, the availability of bilingual or multi-lingual MWE corpora is very limited. The only bilingual MWE corpora that we are aware of is from the PARSEME (PARSing and Multi-word Expressions) EU Project. This is a small collection of only 871 pairs of English-German MWEs. In this paper, we present multi-lingual and bilingual MWE corpora that we have extracted from root parallel corpora. Our collections are 3,159,226 and 143,042 bilingual MWE pairs for German-English and Chinese-English respectively after filtering. We examine the quality of these extracted bilingual MWEs in MT experiments. Our initial experiments applying MWEs in MT show improved translation performances on MWE terms in qualitative analysis and better general evaluation scores in quantitative analysis, on both German-English and Chinese-English language pairs. We follow a standard experimental pipeline to create our MultiMWE corpora which are available online. Researchers can use this free corpus for their own models or use them in a knowledge base as model features.

연구 동기 및 목표

  • NLP 연구에서 다국어 및 双어 MWE 코퍼스의 부족 문제를 해결하기 위해.
  • 병렬 코퍼스에서 이중어 MWE를 추출하기 위한 확장 가능하고 재현 가능한 파이프라인을 개발하기 위해.
  • MWE 통합이 신경 기계 번역(NMT) 성능에 미치는 영향을 평가하기 위해.
  • 정보 추출, 질의 응답, 정보 검색과 같은 다국어 NLP 작업을 위한 무료로 이용 가능한 고품질 자원을 제공하기 위해.
  • 기타 어휘 쌍으로 코퍼스를 확장하고, 끊어진 MWE 및 형태학적으로 복잡한 MWE의 추출을 향상시키기 위해.

제안 방법

  • 병역 코퍼스에서 품사(POS) 패턴 매칭을 사용하여 MWE를 추출하고, 어휘 간 의미 동치성에 기반해 독일어 및 중국어 POS 패턴을 영어로 정렬한다.
  • 의미 동치성에 기반한 정렬을 통해 MWE를 식별한다.
  • 저품질 또는 노이즈가 많은 MWE 쌍을 제거하기 위해 필터링 히우리스틱을 적용하여 최종적으로 3,159,226개의 독일어-영어 및 143,042개의 중국어-영어 쌍을 확보한다.
  • 추출된 이중어 MWE를 NMT 훈련 데이터에 통합하여 모델이 MWE를 더 잘 학습하도록 한다.
  • 코퍼스 생성 및 평가의 일관성을 확보하기 위해 표준 실험 파이프라인(Rikters & Bojar, 2017)을 사용한다.
  • BLEU 점수와 MWE 번역 성능에 대한 정성적 분석을 통해 번역 품질을 평가한다.

실험 결과

연구 질문

  • RQ1형태학적으로 다를 수 있는 언어 간 병렬 코퍼스에서 확장 가능한 규칙 기반 방법으로 고품질의 이중어 MWE를 추출할 수 있는가?
  • RQ2NMT 훈련에 추출된 이중어 MWE를 통합하면 MWE 번역 품질이 어떻게 향상되는가?
  • RQ3MWE 강화 모델이 독일어-영어 및 중국어-영어 번역 작업에서 BLEU와 같은 자동 평가 지표에 얼마나 기여하는가?
  • RQ4BLEU와 같은 현재 자동 평가 지표가 MWE 번역의 의미 정확성을 얼마나 잘 반영하는가?
  • RQ5MultiMWE 코퍼스는 다른 언어 쌍으로 확장 가능하며, 다국어 NLP 응용 프로그램을 지원할 수 있는가?

주요 결과

  • 필터링 이후 MultiMWE 코퍼스는 3,159,226개의 독일어-영어 및 143,042개의 중국어-영어 MWE 쌍을 포함하며, 기존의 이중어 MWE 코퍼스보다 훨씬 크다.
  • 정성적 분석 결과, 개선된 NMT 모델에서 MWE 번역이 향상되었으며, 특히 'war of words'와 'so-called friend'와 같은 관용어 표현에서 두드러진다.
  • 정량적 평가 결과, 전체 BLEU 점수는 약간 향상되었으며, 중국어-영어 번역에서 MWEpruned0.85+Base 모델은 18.49점, 베이스라인은 18.39점이었다.
  • 표면 형태 일치도가 낮은 경우에도 의미 정확도가 향상된 점을 감안하면 BLEU 지표가 MWE 번역 향상 여부를 항상 반영하지는 않았다.
  • 코퍼스는 https://github.com/poethan/MWE4MT 에서 무료로 이용 가능하여 NLP 모델 및 지식 기반 시스템에서의 재사용을 가능하게 한다.
  • 향후 연구에서는 끊어진 MWE를 포함하고, 중국어 문자 성분(한자 구성요소, 획 등)을 통합하여 형태학적 모델링을 향상시키는 것을 목표로 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.