Skip to main content
QUICK REVIEW

[논문 리뷰] Code-switching Sentence Generation by Generative Adversarial Networks and its Application to Data Augmentation

Ching-Ting Chang, Shun-Po Chuang|arXiv (Cornell University)|2018. 11. 06.
Topic Modeling참고 문헌 26인용 수 8
한 줄 요약

이 논문은 문법 규칙 없이 코드 스위칭 패턴을 암묵적으로 학습할 수 있도록 적대적 학습을 사용해 조건부 생성자로 단일 언어 텍스트에서 문장 내 코드 스위칭 문장을 생성하는 GAN 기반 방법을 제안한다. 이 방법은 데이터 증강을 통해 코드 스위칭 언어 모델 성능을 크게 향상시키며, +pos 특징 통합이 도메인 특화 코퍼스에서 가장 우수한 성과를 내었다.

ABSTRACT

Code-switching is about dealing with alternative languages in speech or text. It is partially speaker-depend and domain-related, so completely explaining the phenomenon by linguistic rules is challenging. Compared to most monolingual tasks, insufficient data is an issue for code-switching. To mitigate the issue without expensive human annotation, we proposed an unsupervised method for code-switching data augmentation. By utilizing a generative adversarial network, we can generate intra-sentential code-switching sentences from monolingual sentences. We applied proposed method on two corpora, and the result shows that the generated code-switching sentences improve the performance of code-switching language models.

연구 동기 및 목표

  • ASR 및 NLP 분야에서 자원이 부족한 환경에서 코드 스위칭 학습 데이터의 부족 문제를 해결하기 위해.
  • 표준화된 데이터나 언어학적 규칙에 의존하지 않고, 비지도 방법으로 현실적인 문장 내 코드 스위칭 문장을 생성하기 위해.
  • 생성된 문장을 사용한 데이터 증강을 통해 코드 스위칭 언어 모델 성능을 향상시키기 위해.
  • 다양한 언어적 특성과 도메인 특성을 지닌 다양한 코드 스위칭 코퍼스에 대해 제안된 방법의 일반화 능력을 평가하기 위해.

제안 방법

  • 조건부 생성 적대적 네트워크(cGAN)를 사용하며, 생성자는 단일 언어 문장을 코드 스위칭 문장으로 변환한다.
  • 생성자는 실제 코드 스위칭 문장과 생성된 문장을 구별하는 판별자와 함께 학습되며, 적대적 손실을 사용해 현실성 향상을 도모한다.
  • 생성자는 문맥적으로 적절한 코드 스위칭 결정을 유도하기 위해 품사 태그(POS)를 입력 특징으로 통합한다.
  • 단일 언어 문장을 입력으로 사용하며, 생성자는 특정 단어나 어구를 보조 언어(예: 중국어에서 영어로)로의 번역어로 선택적으로 교체한다.
  • 더 나은 코드 스위칭 지점 선택을 위해 생성자의 정책을 최적화하기 위해 강화 학습을 적용한다.
  • 기존 학습 데이터와 생성된 코드 스위칭 문장을 조합하여 데이터 증강을 수행하고, 이를 통해 향상된 언어 모델을 학습한다.

실험 결과

연구 질문

  • RQ1수동으로 제작된 언어학적 규칙 없이, GAN 기반 생성자가 단일 언어 입력에서 신뢰할 수 있는 문장 내 코드 스위칭 문장을 생성할 수 있는가?
  • RQ2POS 특징의 통합은 생성된 코드 스위칭 문장의 품질과 유용성에 어떤 영향을 미치는가?
  • RQ3생성된 코드 스위칭 문장을 사용한 데이터 증강이 후속 언어 모델링 성능을 어느 정도 향상시키는가?
  • RQ4다양한 언어 패턴과 도메인 특성을 지닌 다양한 코드 스위칭 코퍼스에 대해 제안된 방법의 일반화 능력은 어떠한가?

주요 결과

  • POS 태깅을 통합한 제안된 방법(proposed+pos)은 SEAME 테스트 세트에서 퍼플렉서티 69.185를 기록하여 무작위 및 규칙 기반 베이스라인을 모두 앞섰다.
  • LectureSS 코퍼스에서는 제안된+pos 방법이 테스트 퍼플렉서티를 69.185로 낮추어, RNNLM 기반 베이스라인(71.974) 대비 4.1% 향상되었고, 무작위 베이스라인(71.779) 대비 3.0% 향상되었다.
  • 이 방법은 두 가지 상이한 코퍼스인 LectureSS(학술 강의)와 SEAME(일상 대화) 모두에 대해 잘 일반화되었으며, 도메인 차이에 대해 강건함을 보였다.
  • POS 특징 통합은 내용 특화된 명사를 자주 스위칭하는 LectureSS에서는 성능 향상을 이끌었지만, 코드 스위칭가 더 어휘적으로 다양한 SEAME에서는 영향이 적었다.
  • 무작위로 코드 스위칭 지점을 선택하는 것조차도 기반 모델 대비 퍼플렉서티 향상을 보였으며, 이는 데이터 증강 자체가 유의미한 이점을 제공한다는 것을 시사하지만, 제안된 방법은 더 뛰어난 성능 향상을 제공한다.
  • 대체로 생성된 문장은 질적으로 타당했으나, 실패 원인은 주로 중국어에서 영어로의 번역 품질이 열 劣한 데 기인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.