Skip to main content
QUICK REVIEW

[논문 리뷰] Subword Sampling for Low Resource Word Alignment

Ehsaneddin Asgari, Masoud Jalili Sabet|arXiv (Cornell University)|2020. 12. 21.
Natural Language Processing Techniques참고 문헌 27인용 수 4
한 줄 요약

이 논문은 저자원 언어 쌍에서 단어 수준의 정렬 성능을 향상시키기 위해 다수의 서브워드 분할을 집계하고, 반복적인 베이지안 최적화 프레임워크를 사용해 최적의 서브워드를 선택하는 서브워드 샘플링 방법을 제안한다. 이 방법은 6개의 언어 쌍에서 5,000개의 병렬 문장만으로도 100,000+ 문장의 단어 수준 모델과 비교할 만한 F1 점수를 달성하며, 전이 가능한 초기화 매개변수를 통해 미사용된 언어에 대해 제로샷 성능 향상을 가능하게 한다.

ABSTRACT

Annotation projection is an important area in NLP that can greatly contribute to creating language resources for low-resource languages. Word alignment plays a key role in this setting. However, most of the existing word alignment methods are designed for a high resource setting in machine translation where millions of parallel sentences are available. This amount reduces to a few thousands of sentences when dealing with low-resource languages failing the existing established IBM models. In this paper, we propose subword sampling-based alignment of text units. This method's hypothesis is that the aggregation of different granularities of text for certain language pairs can help word-level alignment. For certain languages for which gold-standard alignments exist, we propose an iterative Bayesian optimization framework to optimize selecting possible subwords from the space of possible subword representations of the source and target sentences. We show that the subword sampling method consistently outperforms word-level alignment on six language pairs: English-German, English-French, English-Romanian, English-Persian, English-Hindi, and English-Inuktitut. In addition, we show that the hyperparameters learned for certain language pairs can be applied to other languages at no supervision and consistently improve the alignment results. We observe that using $5K$ parallel sentences together with our proposed subword sampling approach, we obtain similar F1 scores to the use of $100K$'s of parallel sentences in existing word-level fast-align/eflomal alignment methods.

연구 동기 및 목표

  • 병렬 코퍼스에 수천 개의 문장만 포함된 저자원 언어 쌍에서 신뢰할 수 없는 단어 정렬 문제를 해결하기 위해.
  • 저자원 언어의 어노테이션 프로젝션을 향상시키기 위해 언어 간 언어 단위의 정확한 매핑을 가능하게 하기 위해.
  • 서브워드 수준의 해상도를 활용해 기존의 표준 단어 수준 정렬보다 저자원 환경에서 성능을 뛰어올리는 방법을 개발하기 위해.
  • 추가적인 감독 없이도 학습된 초기화 매개변수를 언어 쌍 간에 전이할 수 있도록 하기 위해.

제안 방법

  • 소스 및 타겟 문장에 대해 가능한 BPE 서브워드 분할 공간에서 샘플링하여 다양한 텍스트 해상도를 탐색한다.
  • 가용한 기준 데이터가 있는 언어의 경우, 골드 표준 정렬 기반으로 가장 효과적인 서브워드 후보를 선택하기 위해 반복적인 베이지안 최적화 프레임워크를 사용한다.
  • 서브워드 표현은 바이트-페어 인코딩(BPE)을 통해 생성되며, 다수의 분할 방식을 고려해 정렬의 강건성을 향상시킨다.
  • 서브워드 샘플링을 위한 초기화 매개변수, 예를 들어 서브워드 병합 임계값 등을 최적화하여 검증용 골드 표준 정렬에서 F1 점수를 최대화한다.
  • 특정 언어 쌍의 골드 표준 정렬을 기반으로 학습한 후, 추가적인 감독 없이 다른 언어 쌍에 적용한다.
  • 다양한 서브워드 해상도를 조합하면 특히 훈련 데이터가 부족한 경우 정렬 성능이 향상된다는 통찰을 활용한다.

실험 결과

연구 질문

  • RQ1제한된 병렬 문장이 있는 저자원 언어 쌍에서 서브워드 샘플링이 단어 수준 정렬 성능을 향상시킬 수 있는가?
  • RQ2고정된 단어 수준 정렬과 비교해 복수의 서브워드 분할을 집계함으로써 정렬 정확도는 어떻게 향상되는가?
  • RQ3한 언어 쌍에서 학습한 초기화 매개변수는 감독 없이 다른 언어 쌍으로 효과적으로 전이될 수 있는가?
  • RQ4서브워드 샘플링을 통해 성능이 고자원 단어 수준 모델과 유사한 수준에 도달하기 위해 필요한 병렬 문장 수를 얼마나 줄일 수 있는가?
  • RQ5형태학적으로 거리가 먼 언어 쌍을 포함해 다양한 언어 쌍에서 이 방법이 일관된 향상을 유지하는가?

주요 결과

  • 서브워드 샘플링 방법은 영어-독일어, 영어-프랑스어, 영어-루마니아어, 영어-페르시아어, 영어-힌두어, 영어-이누크티투트어 등 6개 언어 쌍에서 단어 수준 정렬을 일관되게 뛰어넘는다.
  • 단지 5,000개의 병렬 문장만으로도 기존의 표준 단어 수준 정렬 방법이 100,000+ 문장에서 확보한 F1 점수와 유사한 성능을 달성한다.
  • 영어-이누크티투트어 케이스에서, 이 방법은 단지 5,000개의 문장으로 340,000개 문장의 단어 수준 모델과 동일한 F1 점수를 달성했다.
  • 영어-페르시아어 케이스에서, 이 방법은 단지 5,000개의 문장으로 600,000개 문장의 단어 수준 모델과 동일한 F1 점수를 달성했다.
  • 한 언어 쌍에서 학습한 초기화 매개변수는 감독 없이도 다른 언어 쌍으로 성공적으로 전이되었으며, 일관되게 정렬 성능을 향상시켰다.
  • 이 방법은 강력한 일반화 능력을 보이며, 50,000~600,000개 문장의 중간 자원 설정에서도 고품질의 정렬을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.