[논문 리뷰] Extracting an English-Persian Parallel Corpus from Comparable Corpora
이 논문은 양방향 기계 번역과 정보 검색(IR) 시스템을 활용하여 비교 가능한 위키백과 문서에서 고품질의 영어-페르시아어 병렬 코퍼스를 추출하기 위한 이원적 방법을 제안한다. 이 방법은 문장 수준의 정렬을 식별하고 SMT 성능을 햖थ하며, 유사도 점수 순으로 정렬된 무료로 이용 가능한 200,000문장 병렬 코퍼스를 제공한다. 단방향 방법보다 뛰어난 성능을 보인다.
Parallel data are an important part of a reliable Statistical Machine Translation (SMT) system. The more of these data are available, the better the quality of the SMT system. However, for some language pairs such as Persian-English, parallel sources of this kind are scarce. In this paper, a bidirectional method is proposed to extract parallel sentences from English and Persian document aligned Wikipedia. Two machine translation systems are employed to translate from Persian to English and the reverse after which an IR system is used to measure the similarity of the translated sentences. Adding the extracted sentences to the training data of the existing SMT systems is shown to improve the quality of the translation. Furthermore, the proposed method slightly outperforms the one-directional approach. The extracted corpus consists of about 200,000 sentences which have been sorted by their degree of similarity calculated by the IR system and is freely available for public access on the Web.
연구 동기 및 목표
- 통계적 기계 번역(SMT)을 위한 영어-페르시아어 병렬 학습 데이터 부족 문제를 해결하기 위해.
- 일치된 위키백과 에디션과 같은 비교 가능한 코퍼스에서 병렬 문장을 광범위하게 추출할 수 있는 확장 가능한 방법을 개발하기 위해.
- 기존 학습 데이터에 자동으로 추출된 병렬 문장을 추가하여 SMT 번역 품질을 향상시키기 위해.
- 정렬 품질과 후속 번역 성능 측면에서 이원적 대비 단방향 추출 전략을 평가하고 비교하기 위해.
제안 방법
- 문서 수준 정렬을 통해 영어와 페르시아어 위키백과 문서를 일치시켜 비교 가능한 코퍼스를 구성한다.
- 각 언어의 텍스트를 상대 언어로 번역하기 위해 별도의 두 개의 기계 번역 시스템(페르시아어 → 영어, 영어 → 페르시아어)을 적용한다.
- 번역된 문장과 원본 단일 언어 문장 간의 문장 수준 유사도를 계산하기 위해 정보 검색(IR) 시스템을 사용한다.
- 유사도 점수에 따라 추출된 문장 쌍을 순위 매겨 고품질 병렬 문장을 걸러내고 우선순위를 정한다.
- 높은 유사도 점수를 가진 문장 쌍만 선택하여 최종 병렬 코퍼스를 구성한다.
- 최종적으로 생성된 200,000문장 병렬 코퍼스를 연구 목적을 위해 공개한다.
실험 결과
연구 질문
- RQ1이원적 기계 번역과 IR 기반 매칭은 비교 가능한 영어-페르시아어 위키백과 코퍼스에서 고품질 병렬 문장을 효과적으로 추출할 수 있는가?
- RQ2정렬 품질과 SMT 향상 측면에서 이원적 추출 방법은 단방향 접근에 비해 얼마나 우수한가?
- RQ3추출된 병렬 코퍼스는 기존 SMT 시스템의 번역 품질을 어느 정도 향상시키는가?
- RQ4유사도 점수는 추출된 병렬 데이터의 신뢰성과 활용도에 어떤 영향을 미치는가?
주요 결과
- 제안된 이원적 방법은 고품질 병렬 문장 쌍을 추출하는 데 단방향 방법보다 略히 뛰어난 성능을 보였다.
- 추출된 코퍼스에는 약 200,000개의 문장 쌍이 포함되어 있으며, 사용성 향상을 위해 유사도 점수 순으로 정렬되어 있다.
- 기존 SMT 학습 데이터에 추출된 문장을 추가함으로써 번역 품질이 향상되었으며, 이는 코퍼스의 유용성을 입증한다.
- 코퍼스는 연구 목적을 위해 공개되어 있으며, 페르시아어-영어와 같은 저자원 언어 쌍의 향후 연구를 지원한다.
- IR 기반의 유사도 측정은 사전에 병렬 텍스트가 없는 상황에서도 유효한 병렬 문장 쌍을 효과적으로 식별한다.
- 페르시아어-영어에 대한 병렬 데이터 부족에도 불구하고 이 방법은 저자원 기계 번역 환경에서 실용적인 해결책을 제공함을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.