Skip to main content
QUICK REVIEW

[논문 리뷰] Machine Transliteration

Kevin Knight, Jonathan Graehl|ArXiv.org|1997. 04. 14.
Natural Language Processing Techniques인용 수 7
한 줄 요약

이 논문은 기계학습 기반의 역역자화 기법을 제시한다. 즉, 외래어 이름을 음소적으로 표기한 형태(예: 일본어 'konpyuutaa')를 원본 언어(예: 영어 'computer')로 복원하는 작업을 다룬다. 본 논문은 다단계로 구성된 생성 모델을 사용하여 음소 분할, 소리 매핑, 언어 모델링을 수행하며, 기준 방법 대비 뚜렷한 성능 향상을 이룩하였다. 이는 역역자화된 텍스트로부터 원본 형태를 재구성하는 데서 유의미한 성과를 거두었다.

ABSTRACT

It is challenging to translate names and technical terms across languages with different alphabets and sound inventories. These items are commonly transliterated, i.e., replaced with approximate phonetic equivalents. For example, "computer" in English comes out as "konpyuutaa" in Japanese. Translating such items from Japanese back to English is even more challenging, and of practical interest, as transliterated items make up the bulk of text phrases not found in bilingual dictionaries. We describe and evaluate a method for performing backwards transliterations by machine. This method uses a generative model, incorporating several distinct stages in the transliteration process.

연구 동기 및 목표

  • 다국어 텍스트에서 흔히 나타나는 역역자화된 이름을 원본 언어 형태로 복원하는 문제를 해결하기 위함이다.
  • 일본어와 같은 언어에서 음소적으로 표기된 형태를 영어와 같은 원본 언어 형태로 매핑할 수 있는 시스템을 개발하기 위함이다.
  • 음소 표기법과 원본 언어 이름 사이의 복잡한 비단대응 관계를 체계적이고 단계적인 생성 방법으로 모델링하기 위함이다.
  • 이중어사전의 OOV(Out-of-Vocabulary) 영역를 지배하는 실제 데이터에서의 역역자화 방법을 평가하기 위함이다.
  • 기계 번역 및 정보 검색 시스템에서 이름 재구성 정확도를 향상시키기 위해 역역자화 문제를 핵심 문제로 다루기 위함이다.

제안 방법

  • 본 방법은 역역자화 과정을 분할, 소리 매핑, 언어 모델링 등 별도의 단계로 나누어 구현하는 생성 모델을 사용한다.
  • 다른 언어 간 음소 세그먼트와 그 매핑 관계를 계층적 구조로 모델링하여 비선형적 소리 대응을 포착한다.
  • 후보 재구성 결과를 평가하기 위해 언어 모델을 통합하여 자연스럽고 타당한 원본 언어 형태를 선호한다.
  • 음소 정렬 가능성과 n-gram 언어 모델 확률을 조합한 판별적 점수 함수를 적용한다.
  • 최대우도 추정을 통해 파라미터 학습을 위한 병렬 데이터(역역자화된 이름과 원본 형태)를 사용하여 시스템을 훈련시킨다.
  • 동적 프ogram밍 알고리즘을 활용하여 주어진 역역자화된 입력에 대해 가장 가능성이 높은 원본 형태를 추론한다.

실험 결과

연구 질문

  • RQ1생성 모델이 목표 언어에서의 역역자화된 형태로부터 원본 언어 이름을 효과적으로 재구성할 수 있는가?
  • RQ2분할, 소리 매핑, 언어 모델링의 단계적 접근 방식이 간단한 기준 방법 대비 얼마나 우수한 성능을 보이는가?
  • RQ3학습 중에 볼 수 없었던 OOV 이름에 대해 모델이 얼마나 잘 일반화되는가?
  • RQ4언어 모델을 통합함으로써 재구성된 원본 형태의 품질에 어떤 영향을 미치는가?
  • RQ5다양한 역역자화 체계에서의 철자 및 음소 표현의 변동성에 대해 이 방법은 얼마나 강인한가?

주요 결과

  • 제안된 생성 모델은 기준 방법 대비 역역자화된 형태로부터 원본 언어 이름을 재구성하는 데서 뚜렷한 성능 향상을 보였다.
  • 분할, 소리 매핑, 언어 모델링으로 나누어진 단계적 접근 방식이 더 정확하고 강인한 재구성 결과를 도출하였다.
  • 언어 모델을 통합함으로써 타당한 원본 언어 형태의 선별이 향상되어 잘못된 재구성 수를 줄였다.
  • 특히 복잡한 음소 매핑을 가진 이름에 대해 테스트 데이터에서 오류율이 뚜렷이 감소하였다.
  • 학습 중에 볼 수 없었던 이름에 대해서도 강력한 일반화 능력을 보이며, 기계 번역 및 정보 검색 분야의 실제 응용에 적합함을 입증하였다.
  • 역역자화를 체계적이고 다단계적인 과정으로 모델링할 경우, 단일 모델이나 히ュ리스틱 기반 접근보다 더 높은 성능을 낼 수 있음을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.