Skip to main content
QUICK REVIEW

[논문 리뷰] An Example-Based Approach to Japanese-to-English Translation of Tense, Aspect, and Modality

Masaki Murata, Qing Ma|ArXiv.org|1999. 12. 13.
Natural Language Processing Techniques참고 문헌 3인용 수 15
한 줄 요약

이 논문은 문장 끝부분의 문자열 및 의미 유사도를 활용하여 유사한 双語 문장 예제를 검색하는 예제 기반 기계 번역 방법을 제안한다. k-최근접 이웃을 적용하여 노이즈를 줄이고 수작업 규칙을 피함으로써, 특히 존재하지 않는 형태나 과거 형태에 대해 언어 분석 특징을 사용할 경우, 최상위 수준의 상용 기계 번역 시스템을 능가하는 Tense, Aspect, Modality(TAM) 번역 정확도를 달성한다.

ABSTRACT

We have developed a new method for Japanese-to-English translation of tense, aspect, and modality that uses an example-based method. In this method the similarity between input and example sentences is defined as the degree of semantic matching between the expressions at the ends of the sentences. Our method also uses the k-nearest neighbor method in order to exclude the effects of noise; for example, wrongly tagged data in the bilingual corpora. Experiments show that our method can translate tenses, aspects, and modalities more accurately than the top-level MT software currently available on the market can. Moreover, it does not require hand-craft rules.

연구 동기 및 목표

  • 복잡한 형태계문법적 표현으로 인해 번역이 어려운 일본어 시제, 시제, 모드를 영어로 번역하는 데 어려움을 해결하기 위해.
  • TAM에 대한 세부 언어 규칙을 수작업으로 코딩하는 데 복잡하고 비현실적인 문제를 피하기 위해 규칙이 없는 접근법을 개발하기 위해.
  • 현재의 상용 기계 번역 시스템을 뛰어넘는 시제, 시제, 모드 번역 정확도를 향상시키기 위해.
  • 문장 끝부분의 표면 문자열 매칭과 의미 매칭만을 사용하여 TAM 선택의 가능성을 탐색하기 위해.
  • 매칭 전략을 적응시켜 단일 언어의 TAM 태깅과 다국어 번역에 응용할 수 있도록 하기 위해.

제안 방법

  • 이중 어휘자료에서 일본어 문장과 영어 문장의 문장 끝부분에 있는 표현 간의 의미 매칭 정도를 입력 문장과 예제 문장 간의 유사도로 정의한다.
  • 입력 문장의 끝에서 가장 긴 일치하는 부분 문자열을 사용하여 어휘자료 내에서 가장 유사한 예제 문장을 검색한다.
  • 검색된 예제 문장에서 해당하는 영어 TAM 표현을 번역 대상으로 선택한다.
  • 이중 어휘자료의 잘못 태깅된 데이터에서 발생하는 노이즈를 줄이기 위해 k-최근접 이웃 기법을 적용한다.
  • 순수한 문자열 매칭과 언어 분석 특징(예: 동의어 카테고리, 어형 변화 형태)을 모두 사용하여 유사도를 평가하며, 후자는 존재하지 않는 형태나 과거 형태에 대해 정확도를 향상시킨다.
  • 이중 어휘자료를 단일 언어로 태깅된 TAM 어휘자료로 교체하여 단일 언어의 TAM 분석에 방법을 적응시킨다.

실험 결과

연구 질문

  • RQ1문장 끝부분의 유사도는 일본어-영어 번역에서 적절한 시제, 시제, 모드 표현을 효과적으로 검색하는 데 사용될 수 있는가?
  • RQ2예제 기반 방법은 기존의 상용 기계 번역 시스템보다 일본어 TAM 표현 번역에서 뛰어난 성능을 보일 수 있는가?
  • RQ3품사, 동의어, 어형 분석 등의 언어 분석을 도입할 경우 순수한 문자열 매칭에 비해 TAM 번역 정확도가 얼마나 향상되는가?
  • RQ4이 방법은 규칙 기반 분석 없이도 단일 언어의 TAM 태깅에 일반화될 수 있는가?
  • RQ5노이즈가 있거나 잘못 태깅된 데이터가 포함된 학습 어휘자료에서 k-최근접 이웃 기법이 영향을 줄이는데 얼마나 효과적인가?

주요 결과

  • 제안된 방법은 당시 이용 가능한 최상위 수준의 상용 기계 번역 소프트웨어보다 시제, 시제, 모드 번역 정확도가 높았다.
  • 언어 분석 특징(예: 동의어 카테고리, 어형 변화 형태)을 사용할 경우 순수한 문자열 매칭보다 존재하지 않는 형태나 현재/미래 형태의 번역 정확도 향상이 더 두드러졌다.
  • 노이즈가 있는 데이터에 대해 k-최근접 이웃 기법을 효과적으로 활용하여 잘못된 예제를 걸러내는 데 성공함으로써 강건성을 입증했다.
  • 수작업 언어 규칙이 전혀 필요로 하지 않아서, 저자원 언어 쌍에 쉽게 적용하고 확장할 수 있었다.
  • 이중 어휘자료를 단일 언어로 태깅된 TAM 어휘자료로 교체함으로써 단일 언어의 TAM 태깅으로 성공적으로 확장되었다.
  • 결과적으로, 문장 끝부분의 유사도가 언어 분석을 보완할 경우, 특히 의미 매칭의 실용적이고 효과적인 대체 수단이 될 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.