Skip to main content
QUICK REVIEW

[논문 리뷰] A Supervised Word Alignment Method based on Cross-Language Span Prediction using Multilingual BERT

Masaaki Nagata, Katsuki Chousa|arXiv (Cornell University)|2020. 04. 29.
Topic Modeling참고 문헌 36인용 수 6
한 줄 요약

이 논문은 다국어 BERT를 미세조정하여 원천 언어 토큰에 대응하는 대상 언어 구간을 예측하는 방식으로, 단일 언어 간 구간 예측 작업으로서 어절 정렬을 재정의하는 지도 학습 기반 어절 정렬 방법을 제안한다. 오직 150~300개의 정답 정렬 문장과 병렬 사전학습 데이터 없이도 상태의 기술(SOTA) 수준의 F1 점수(예: 중국어-영어에서 86.7)를 달성하며, 이는 이전의 지도 학습 및 비지도 학습 방법들을 뛰어넘는 성능을 보인다.

ABSTRACT

We present a novel supervised word alignment method based on cross-language span prediction. We first formalize a word alignment problem as a collection of independent predictions from a token in the source sentence to a span in the target sentence. As this is equivalent to a SQuAD v2.0 style question answering task, we then solve this problem by using multilingual BERT, which is fine-tuned on a manually created gold word alignment data. We greatly improved the word alignment accuracy by adding the context of the token to the question. In the experiments using five word alignment datasets among Chinese, Japanese, German, Romanian, French, and English, we show that the proposed method significantly outperformed previous supervised and unsupervised word alignment methods without using any bitexts for pretraining. For example, we achieved an F1 score of 86.7 for the Chinese-English data, which is 13.3 points higher than the previous state-of-the-art supervised methods.

연구 동기 및 목표

  • 최근 20년간 신경 기반 번역 기술의 발전에도 불구하고 어절 정렬 정확도 향상이 정체되어 있는 문제를 해결하기 위해.
  • 최소한의 정답 정렬 데이터가 필요하고 병렬 단일 언어 텍스트를 통한 사전학습이 불필요한 지도 학습 기반 어절 정렬 방법을 개발하기 위해.
  • 다국어 BERT와 질문-답변 스타일의 구간 예측 프레임워크를 활용하여 자원이 적은 언어 쌍에 대해서도 정렬 정확도를 향상시키기 위해.
  • 학습 중에 볼 수 없었던 언어 쌍에 대해서도 제로샷 어절 정렬 능력을 탐색하기 위해.

제안 방법

  • 어절 정렬 문제는 원천 언어 토큰이 질문이고 대상 언어 구간이 답변인 SQuAD 스타일의 질문-답변 작업으로 재정의된다.
  • 각 정렬 인스턴스는 문맥-질문-답변 삼중조로 변환되며, 문맥은 대상 문장이고 질문은 원천 토큰이다.
  • 다국어 BERT는 정답 정렬 문장 쌍에 대해 미세조정되어 각 원천 토큰에 대응하는 대상 문장 내 구간의 시작 및 끝 위치를 예측하도록 학습된다.
  • 다중 토큰 정렬은 여러 개의 답변으로 간주하여, 대상 문장 내 정렬된 구간의 시작 및 끝 위치를 예측하도록 모델을 훈련시킨다.
  • 원천 문장 내 주변 토큰의 문맥 정보를 질문에 통합하여 정렬 정밀도를 향상시킨다.
  • 원천과 대상의 역할을 뒤바꿔서 영어→일본어 및 일본어→영어 등 양방향 정렬을 지원한다.

실험 결과

연구 질문

  • RQ1질문-답변 프레임워크를 활용하여 어절 정렬을 교차 언어적 구간 예측 작업으로 효과적으로 재정의할 수 있는가?
  • RQ2최소한의 정답 정렬 데이터와 병렬 사전학습 없이도 다국어 BERT가 뛰어난 어절 정렬 성능을 달성할 수 있는가?
  • RQ3원천 토큰의 주변 문맥을 질문에 통합할 경우, 단순히 원천 토큰만 사용하는 것보다 정렬 정확도가 향상되는가?
  • RQ4모델은 특정 정렬 데이터에 대해 미세조정 없이도 제로샷 언어 쌍에 일반화할 수 있는가?

주요 결과

  • 제안된 방법은 중국어-영어 어절 정렬에서 F1 점수 86.7을 기록하여 이전의 SOTA 지도 학습 방법보다 13.3점 향상되었다.
  • 오직 150~300개의 정답 정렬 문장만으로도, 수백만 개의 병렬 문장을 사전학습에 사용하는 이전의 지도 학습 및 비지도 학습 방법들을 모두 능가하는 성능을 보였다.
  • 제로샷 설정에서 모델은 일본어-영어에서 F1 58.8점을 기록했으며(GIZA++ 대비 57.6점), 루마니아어-영어에서는 F1 77.8점(73.6점)을 기록하여 강력한 일반화 능력을 입증했다.
  • 원천 토큰 주변의 문맥을 질문에 통합함으로써, 특히 모호하거나 빈도가 높은 단어의 경우 정렬 정확도가 향상되었다.
  • 정답 문장 수와 병렬 사전학습 데이터가 훨씬 적은 상황에서도, Garg 등(2019)과 Stengel-Eskin 등(2019)의 방법보다 뚜렷이 뛰어난 성능을 보였다.
  • 형태소가 풍부하고 자원이 적은 언어 쌍(예: 루마니아어, 일본어 포함)에 대해서도 모델의 성능은 뛰어난 안정성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.