[논문 리뷰] Statistical Machine Translation for Indian Languages: Mission Hindi
이 논문은 인도의 어감어형 언어(벵골어, 마라티어, 타밀어, 텔루구어)에서 히누디어로의 통계적 기계 번역(SMT)을 위한 사전 처리 기법으로 접미사 분리(SS)와 복합어 분할(CS)을 제안하며, 기준 시스템 대비 BLEU 점수를 크게 향상시킨다. 영어-힌두어 번역에서는 원천 측 재정렬과 요인 기반 SMT가 성능을 추가로 향상시키며, 최고의 시스템은 테스트 세트에서 22.83 BLEU를 기록한다.
This paper discusses Centre for Development of Advanced Computing Mumbai's (CDACM) submission to the NLP Tools Contest on Statistical Machine Translation in Indian Languages (ILSMT) 2014 (collocated with ICON 2014). The objective of the contest was to explore the effectiveness of Statistical Machine Translation (SMT) for Indian language to Indian language and English-Hindi machine translation. In this paper, we have proposed that suffix separation and word splitting for SMT from agglutinative languages to Hindi significantly improves over the baseline (BL). We have also shown that the factored model with reordering outperforms the phrase-based SMT for English-Hindi (\enhi). We report our work on all five pairs of languages, namely Bengali-Hindi (\bnhi), Marathi-Hindi (\mrhi), Tamil-Hindi ( ahi), Telugu-Hindi ( ehi), and \enhi for Health, Tourism, and General domains.
연구 동기 및 목표
- 어감어형 인도 원천 언어와 히누디어 사이의 형태학적 차이를 해결하기 위해 통계적 기계 번역에서 접근한다.
- 접미사 분리 및 복합어 분할과 같은 사전 처리 기법을 통해 알 수 없는 단어를 줄임으로써 번역 품질을 향상시킨다.
- 벵골어-힌두어, 마라티어-힌두어, 타밀어-힌두어, 텔루구어-힌두어, 영어-힌두어 등 다수의 언어 쌍에서 이러한 기법의 효과를 평가한다.
- 특히 영어-힌두어 번역에서 어순 및 어순 정렬의 구조적 차이를 조사한다.
- ILSMT 2014 공동 과제에 최적화된 시스템을 제출하고 건강, 관광, 일반 분야 등 다양한 도메인에서의 성능을 분석한다.
제안 방법
- 접미사 분리(SS)는 수동으로 작성된 접미사 목록을 사용하여, 히누디어의 후치어에 대응하는 알려진 접미사를 매칭하고 분리함으로써 원천 언어 단어에 적용된다.
- 복합어 분할(CS)은 단일 언어 코퍼스에서 추출한 빈도 높은 접미사를 식별하여, 복잡한 원천 단어를 형태적으로 유효한 구성요소로 반복적으로 분해한다.
- 영어-힌두어 번역에서는 원천 측 재정렬을 적용하여 영어 문법을 히누디어의 SOV 어순과 일치시켜 정렬과 디코딩을 향상시킨다.
- 기본 시스템으로 문장 기반 SMT 시스템을 사용하며, 어간 정렬을 정렬 요인으로 사용하는 요인 기반 모델을 추가로 적용한다.
- 공동 과제 데이터와 단일 언어 코퍼스를 사용해 시스템을 훈련시키며, 개발 및 테스트 세트에서 BLEU, NIST, TER 지표를 사용해 평가한다.
- 과잉으로 전문 명사 분할이나 잘못된 분할로 인한 데이터 희소성 감소 문제를 진단하기 위해 오류 분석을 수행한다.
실험 결과
연구 질문
- RQ1어감어형 인도 원천 언어에서 히누디어로의 SMT 성능을 기준 시스템 대비 접미사 분리가 유의미하게 향상시키는가?
- RQ2마라티어나 텔루구어처럼 형태학적으로 복잡한 원천 언어에서 복합어 분할이 번역 품질을 얼마나 향상시키는가?
- RQ3영어-힌두어 SMT에서 원천 측 재정렬이 정렬과 번역 품질 향상에 얼마나 효과적인가?
- RQ4왜 접미사 분리와 복합어 분할을 병행 적용하면 벵골어와 마라티어에서 성능이 악화되는가? 이 문제의 원인은 무엇인가?
- RQ5어간 정렬을 요인으로 사용하는 요인 기반 SMT가 영어-힌두어 번역에서 재정렬 기반 시스템을 능가할 수 있는가?
주요 결과
- 벵골어-힌두어 번역에서 접미사 분리만으로 BLEU 점수가 30.16에서 31.73으로 상승하여 기준 시스템 대비 1.57점 향상되었다.
- 마라티어-힌두어 번역에서는 접미사 분리로 BLEU 점수가 35.56에서 39.84로 상승하여 4.28점 향상되었으며, 뚜렷한 효과를 보였다.
- 텔루구어-힌두어 번역에서는 복합어 분할로 BLEU 점수가 16.76에서 20.16으로 상승하여 3.4점 향상되었으며, 매우 어감어형인 언어에 있어 가치가 있음을 시사한다.
- 영어-힌두어 번역에서는 원천 측 재정렬로 BLEU 점수가 18.52에서 22.72로 상승하여 4.2점 향상되었으며, 뚜렷한 영향을 미쳤다.
- 재정렬을 적용한 요인 기반 SMT 시스템은 22.83 BLEU를 기록하여 재정렬 전용 시스템(22.72 BLEU)을 略로 뛰어넘었지만, 다른 지표는 재정렬 시스템을 선호했다.
- 최종 제출된 영어-힌두어 번역 시스템은 BL+RO+FACT를 사용하여 테스트 세트에서 22.83 BLEU를 달성했으며, 평가된 모든 시스템 중에서 가장 높은 성능을 기록했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.