Skip to main content
QUICK REVIEW

[논문 리뷰] The Galactic Dependencies Treebanks: Getting More Data by Synthesizing New Languages

Dingquan Wang, Jason Eisner|arXiv (Cornell University)|2017. 10. 10.
Natural Language Processing Techniques참고 문헌 25인용 수 4
한 줄 요약

이 논문은 실존하는 Universal Dependencies 트리뱅크에서 의존 구조를 확률적으로 재정렬하여 유도한 약 50,000개의 인공 언어로 구성된 합성 트리뱅크인 Galactic Dependencies 1.0을 소개한다. 이러한 합성 언어로 파서를 훈련시킴으로써 단일 소스 전이 학습이 다양한 목표 언어에서 UAS를 크게 향상시키며, 실존하는 언어 특유의 특징에 과적합되지 않고 저자원 언어로의 일반화 능력을 향상시킴을 보여준다.

ABSTRACT

We release Galactic Dependencies 1.0---a large set of synthetic languages not found on Earth, but annotated in Universal Dependencies format. This new resource aims to provide training and development data for NLP methods that aim to adapt to unfamiliar languages. Each synthetic treebank is produced from a real treebank by stochastically permuting the dependents of nouns and/or verbs to match the word order of other real languages. We discuss the usefulness, realism, parsability, perplexity, and diversity of the synthetic languages. As a simple demonstration of the use of Galactic Dependencies, we consider single-source transfer, which attempts to parse a real target language using a parser trained on a "nearby" source language. We find that including synthetic source languages somewhat increases the diversity of the source pool, which significantly improves results for most target languages.

연구 동기 및 목표

  • 저자원 또는 알려지지 않은 언어에서 비지도적 언어적 구조 탐색을 위한 훈련 데이터 부족 문제를 해결하기 위해.
  • 구문적 및 형태적 현실성을 유지하면서 다양한 고자원 합성 언어를 생성할 수 있는 확장 가능한 방법을 개발하기 위해.
  • 합성 언어가 파서의 전이 학습 성능을 향상시키는지 평가하기 위해, 특히 실존하는 소스 언어가 제한된 경우에 유의미한 영향을 미치는지 확인하기 위해.
  • 이未知 언어적 구조에서 NLP 시스템을 훈련하고 평가하기 위한 재사용 가능하고 확장 가능한 자원을 제공하기 위해.

제안 방법

  • 실존하는 Universal Dependencies 트리뱅크의 명사와 동사의 종속어를 확률적으로 순열화하여 다른 실제 언어의 어순을 모방하는 합성 트리뱅크를 생성한다.
  • 언어학적 현실성을 유지하고 특징 학습을 지원하기 위해 품사 태그, 형태적 특징, 어휘 공존 패턴을 유지한다.
  • 합성 언어의 어순에 따라 단어를 재정렬함으로써 기존의 애너테이션된 코퍼스를 합성 언어로 변환하는 파이프라인을 제공한다.
  • 의존 구조를 유지하면서 선형 어순을 변경하는 제어된 재정렬 과정을 사용하여 어순에 대한 체계적인 변량을 가능하게 한다.
  • 모델이 인간 언어 간의 일반화를 추구하는 데 사용될 수 있도록 다양한, 해독 가능한, 충분히 현실적인 합성 언어를 설계한다.
  • 기울기 상승과 같은 최적화 기법을 사용해 합성 언어를 목표 언어의 표면 통계에 더 잘 맞출 수 있도록 동적 적응을 지원한다.

실험 결과

연구 질문

  • RQ1실제 트리뱅크에서 유도된 합성 언어가 저자원 목표 언어에서 파서의 전이 학습 성능을 향상시키는가?
  • RQ2합성 소스 언어의 포함이 단일 소스 전이 학습의 다양성과 성능에 어떤 영향을 미치는가?
  • RQ3합성 언어가 실제 언어와 비교해 언어학적 현실성, 해독 가능성, 퍼플렉서티를 어느 정도 유지하는가?
  • RQ4합성 데이터가 다국어 NLP 모델에서 특정 어휘 항목에 대한 과적합을 줄이는 데 기여하는가?
  • RQ5합성 언어로 훈련된 파서의 성능가 다양한 실제 목표 언어로 일반화되는 정도는 어떠한가?

주요 결과

  • 단일 소스 전이 학습에 합성 소스 언어를 포함시킴으로써 대부분의 목표 언어에서 UAS가 유의미하게 향상되며, 평균 UAS는 실존 소스 언어만 사용할 경우 42.03%에서 합성 소스를 추가한 경우 44.55%로 상승한다.
  • 특히 에스토니아어(ET)와 같이 저자원 언어에서 성능 향상이 두드러지며, UAS는 54.81%에서 56.07%로 상승한다.
  • 이 방법은 소스 풀의 다양성을 증가시켜 모델 파rameter의 분산을 감소시키고, 알려지지 않은 언어로의 일반화 능력을 향상시킨다.
  • 정확도 약 50% 수준의 노이즈가 있는 품사 태그 조건에서도 합성 소스의 포함이 UAS 향상에 기여함을 확인하여, 약한 지도 신호에 대한 강건성을 입증한다.
  • 합성 언어는 충분히 현실적이며 해독 가능하며, 낮은 퍼플렉서티와 높은 구조적 다양성을 유지하여 훈련 및 평가에 적합하다.
  • 이 프레임워크는 기존의 애너테이션된 코퍼스에서 어떤 도메인에서도 합성 언어의 레이블 데이터를 생성할 수 있도록 하여 도메인 간 데이터 증강을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.