Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Pidgin Text Generation By Pivoting English Data and Self-Training

Ernie Chang, David Ifeoluwa Adelani|arXiv (Cornell University)|2020. 03. 18.
Natural Language Processing Techniques참고 문헌 15인용 수 17
한 줄 요약

이 논문은 도메인 내 영어 텍스트를 피벗으로 활용하고 자기학습(self-training)을 적용하여 구조화된 데이터로부터 피진 영어 텍스트를 비지도 학습 방식으로 생성하는 방법을 제안한다. 기존의 비지도 학습 모델 대비 더 자연스럽고 관련성이 높은 텍스트 생성을 달성하여, 병렬 데이터가 제한된 저자원 피진 자연어 생성(NLG)에 실현 가능한 길을 제시한다.

ABSTRACT

West African Pidgin English is a language that is significantly spoken in West Africa, consisting of at least 75 million speakers. Nevertheless, proper machine translation systems and relevant NLP datasets for pidgin English are virtually absent. In this work, we develop techniques targeted at bridging the gap between Pidgin English and English in the context of natural language generation. %As a proof of concept, we explore the proposed techniques in the area of data-to-text generation. By building upon the previously released monolingual Pidgin English text and parallel English data-to-text corpus, we hope to build a system that can automatically generate Pidgin English descriptions from structured data. We first train a data-to-English text generation system, before employing techniques in unsupervised neural machine translation and self-training to establish the Pidgin-to-English cross-lingual alignment. The human evaluation performed on the generated Pidgin texts shows that, though still far from being practically usable, the pivoting + self-training technique improves both Pidgin text fluency and relevance.

연구 동기 및 목표

  • 서아프리카 피진 영어에 대한 병렬 훈련 데이터와 기계 번역 시스템의 부족을 해결하기 위해 자연어 생성 작업에서의 문제를 해결한다.
  • 도메인 외부 영어 → 피진 번역 모델과 도메인 내 데이터 → 텍스트 생성 요구사항 사이의 도메인 격차를 해소한다.
  • 구조화된 데이터로부터 자연스럽고 관련성이 높은 피진 영어 텍스트를 생성할 수 있는 비지도 신경망 텍스트 생성 시스템을 개발한다.
  • 자기학습을 통한 피봇(pivoting)을 통해 저자원 피진 텍스트 생성을 향상시킨다.

제안 방법

  • 도메인 내 영어 텍스트와 도메인 외부 단일 언어 피진 데이터를 사용하여 비지도 신경 기계 번역(NMT) 모델($model_{unsup}$)을 훈련한다.
  • 모델$\text{model}_{\text{unsup}}$를 사용하여 도메인 내 영어 입력에서 가짜 병렬 피진 번역을 생성하고, 확장된 병렬 훈련 쌍을 만든다.
  • 가짜 병렬 데이터와 단일 언어 코퍼스를 결합하여 $\text{model}_{\text{unsup}}$를 재학습함으로써 $\text{model}_{\text{self}}$를 얻는다.
  • 영어와 피진 간의 교차 언어 표현 학습을 위해 FastText 임베딩을 활용한다.
  • 식당 도메인에 집중하여 도메인 내 훈련 및 평가를 위해 E2E 데이터 → 텍스트 코퍼스를 사용한다.
  • 현지 피진 어원어 사용자를 대상으로 인간 평가를 수행하여 출력 품질을 평가한다.

실험 결과

연구 질문

  • RQ1도메인 내 영어 텍스트가 비지도 피진 영어 텍스트 생성 향상에 효과적으로 피벗으로 사용될 수 있는가?
  • RQ2가짜 병렬 데이터에 대한 자기학습이 피진 텍스트 생성의 자연스러움과 관련성에 어느 정도 향상시키는가?
  • RQ3사전 훈련된 비지도 NMT 모델과 최종 NLG 작업 사이의 도메인 불일치가 생성 품질에 어떤 영향을 미치는가?
  • RQ4비지도 기법을 통해 자연스럽고 의미적으로 입력 데이터와 관련성이 높은 피진 영어 출력을 생성할 수 있는가?

주요 결과

  • 자기학습 모델($\text{model}_{\text{self}}$)은 테스트 세트에서 관련성 점수 0.434를 기록하여 $\text{model}_{\text{unsup}}$(0.319)와 PidginUNMT(0.038)를 크게 앞서나갔다.
  • 자연스러움 점수는 $\text{model}_{\text{self}}$가 0.814로 $\text{model}_{\text{unsup}}$(0.788)를 능가했고, PidginUNMT(0.827)와 유사한 성능을 보였다.
  • 인간 평가 결과, $\text{model}_{\text{self}}$는 기준 비지도 모델 대비 더 관련성 있고 독해가 쉬운 피진 텍스트를 생성하는 것으로 확인되었다.
  • 도메인 내 영어를 피벗 언어로 사용함으로써 저자원 피진 생성에서 도메인 불일치 문제를 효과적으로 완화시켰다.
  • 자기학습을 통해 생성된 가짜 병렬 데이터는 특히 관련성 향상 측면에서 모델 성능 향상에 기여하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.