Skip to main content
QUICK REVIEW

[논문 리뷰] Korean-to-Chinese Machine Translation using Chinese Character as Pivot Clue

Jeonghyeok Park, Hai Zhao|arXiv (Cornell University)|2019. 11. 25.
Natural Language Processing Techniques참고 문헌 37인용 수 5
한 줄 요약

이 논문은 한국어-중국어 신경 기계 번역에서 Sino-한국어 어휘를 중국 문자로 변환하여 피벗 단서로 활용하는 언어학적으로 동기화된 방법을 제안한다. 학습 중에 한국어의 내용어를 해당 중국 문자로 대체함으로써, RNN 및 Transformer 아키텍처 전반에서 최대 1.5 BLEU 포인트 향상이 이루어지며, 특히 음운 동일어의 해석 불확실성 제거와 번역 품질 향상에 기여한다.

ABSTRACT

Korean-Chinese is a low resource language pair, but Korean and Chinese have a lot in common in terms of vocabulary. Sino-Korean words, which can be converted into corresponding Chinese characters, account for more than fifty of the entire Korean vocabulary. Motivated by this, we propose a simple linguistically motivated solution to improve the performance of the Korean-to-Chinese neural machine translation model by using their common vocabulary. We adopt Chinese characters as a translation pivot by converting Sino-Korean words in Korean sentences to Chinese characters and then train the machine translation model with the converted Korean sentences as source sentences. The experimental results on Korean-to-Chinese translation demonstrate that the models with the proposed method improve translation quality up to 1.5 BLEU points in comparison to the baseline models.

연구 동기 및 목표

  • 두 언어 간 공유 어휘를 활용하여 저자원 한국어-중국어 기계 번역의 과제를 해결하기 위해.
  • 대규모 병렬 코퍼스가 필요 없이 저자원 환경에서 번역 품질을 향상시키기 위해.
  • 특히 Sino-한국어 어휘와 같은 언어학적 특징이 신경 기계 번역 성능 향상에 기여할 수 있는지 탐색하기 위해.
  • RNN 및 Transformer 기반 NMT 모델에서 중국 문자를 피벗 단서로 사용할 경우의 효과를 평가하기 위해.
  • 문자 수준의 변환이 한국어-중국어 번역에서 음운 동일어의 해석 불확실성 제거에 기여하는지 조사하기 위해.

제안 방법

  • 한글-한자 변환 도구를 사용하여 한국어 문장 내 Sino-한국어 어휘를 해당 중국 문자로 변환한다.
  • 결과로 얻어진 문자 변환된 한국어 문장을 새로운 입력으로 사용하여 NMT 모델을 학습시킨다.
  • 공유된 소스 및 타겟 어휘를 사용하여 수정된 학습 데이터를 기반으로 RNN 기반 및 Transformer 기반 NMT 모델을 학습시킨다.
  • 중국 문자를 통해 한국어와 중국어 간 공유된 철자 및 어휘 표현을 활용하여 의미적 정렬을 강화한다.
  • 대규모 병렬 코퍼스가 없는 상황에서 저자원 한국어-중국어 번역에 이 방법을 적용한다.
  • BLEU 및 ROIC 지표를 사용하여 다양한 문장 길이와 음운 동일어에 대한 번역 품질과 어휘 겹침을 평가한다.

실험 결과

연구 질문

  • RQ1Sino-한국어 어휘를 중국 문자로 변환하는 것이 저자원 한국어-중국어 기계 번역에서 번역 성능 향상에 기여하는가?
  • RQ2중국 문자를 언어학적 피벗으로 사용할 경우, 한국어-중국어 번역에서 음운 동일어의 해석 불확실성 제거 능력이 향상되는가?
  • RQ3이러한 방법은 RNN 및 Transformer 기반 NMT 아키텍처 전반에서 어떻게 성능을 발휘하는가?
  • RQ4이 방법은 긴 복잡한 문장에서 번역 품질 향상에 어느 정도 기여하는가?
  • RQ5중국 문자를 통한 공유 어휘가 저자원 번역에서 효과적인 언어학적 신호로 작용할 수 있는가?

주요 결과

  • 제안된 방법은 한국어-중국어 번역 과제에서 기준 모델 대비 최대 1.5 BLEU 포인트 향상으로 번역 품질을 향상시킨다.
  • 기준 모델이 동일한 단어의 여러 의미를 구분하지 못하는 데 비해, 이 방법은 한국어의 음운 동일어에 대한 해석 불확실성 제거 능력이 뚜렷하게 향상된다.
  • RNN 기반 및 Transformer 기반 NMT 모델 전반에서 성능 향상이 일관되게 관찰되어 광범위한 적용 가능성을 보여준다.
  • 모든 문장 길이에서 번역 품질 향상이 이루어지며, 문장 길이가 200 토큰까지 증가함에 따라 성능 향상이 더욱 두드러진다.
  • 중국 문자를 피벗 단서로 사용함으로써 소스어 및 타겟어 어휘 간 의미적 정렬이 강화되며, 특히 Sino-한국어 어휘 항목에서 두드러진다.
  • 이 방법은 저자원 한국어-중국어 NMT에 언어학적으로 동기화된 문자 수준의 피벗 전략을 적용한 최초의 사례로, 다른 공유 어휘가 있는 언어 조합에도 잠재적 적용 가능성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.