[논문 리뷰] SMT vs NMT: A Comparison over Hindi & Bengali Simple Sentences.
이 연구는 영어-힌두어 및 영어-벵골어 단순 문장에 대해 통계적 기계 번역(SMT)과 신경 기계 번역(NMT)을 비교한다. SMT에는 Moses를, NMT에는 문자 수준 및 단어 수준 모델에 부드러운 어텐션을 적용한다. 결과적으로 단순 문장에서는 NMT가 SMT를 능가하지만, 혼합 복잡도 코퍼스로 훈련된 경우 SMT가 NMT를 능가함을 확인하여 데이터 복잡도와 훈련 데이터 구성이 번역 성능에 결정적인 요소임을 시사한다.
In the present article, we identified the qualitative differences between Statistical Machine Translation (SMT) and Neural Machine Translation (NMT) outputs. We have tried to answer two important questions: 1. Does NMT perform equivalently well with respect to SMT and 2. Does it add extra flavor in improving the quality of MT output by employing simple sentences as training units. In order to obtain insights, we have developed three core models viz., SMT model based on Moses toolkit, followed by character and word level NMT models. All of the systems use English-Hindi and English-Bengali language pairs containing simple sentences as well as sentences of other complexity. In order to preserve the translations semantics with respect to the target words of a sentence, we have employed soft-attention into our word level NMT model. We have further evaluated all the systems with respect to the scenarios where they succeed and fail. Finally, the quality of translation has been validated using BLEU and TER metrics along with manual parameters like fluency, adequacy etc. We observed that NMT outperforms SMT in case of simple sentences whereas SMT outperforms in case of all types of sentence.
연구 동기 및 목표
- 영어-힌두어 및 영어-벵골어와 같은 저자원 언어 쌍에서 단순 문장 번역 성능을 고려할 때 NMT가 SMT를 능가하는지 평가하기 위해.
- 단순 문장으로만 훈련된 MT 모델이 혼합 복잡도 훈련 데이터에 비해 번역 품질을 향상시키는지 조사하기 위해.
- 다양한 데이터 복잡도와 모델 아키텍처 조건에서 SMT와 NMT 간의 성능 차이를 분석하기 위해.
- 자동 평가와 인간 평가를 통합하여 번역 품질을 검증하기 위해, BLEU, TER, 어휘 흐름성, 적절성 지표를 사용한다.
제안 방법
- 단일 절 문장 구조를 식별하기 위해 스탠포드 의존성 파서를 사용한 규칙 기반 접근 방식을 통해 TDIL 라이센스를 받은 영어-힌두어 및 영어-벵골어 병렬 코퍼스에서 단순 문장을 추출하였다.
- 모든 단순 문장 및 전체 복잡도 코퍼스에 대해 Moses 툴킷을 사용해 SMT 시스템을 훈련시켰다.
- 문자 수준 NMT(CNMT)와 단어 수준 NMT(WNMT) 모델을 개발하였으며, 후자의 경우 정렬 성능 향상을 위해 부드러운 어텐션을 적용하였다.
- 어텐션의 영향을 평가하기 위해, 어텐션을 적용한(WNMT(A)) 및 적용하지 않은(WNMT(NA)) 단어 수준 NMT를 각각 적용하였다.
- 자동 평가 지표(BLEU 및 TER)와 원어민 평가자들이 어휘 흐름성과 적절성에 대해 평가한 결과를 기반으로 시스템을 평가하였다.
- 수동 평가에는 5점 척도를 사용하였으며, 각 언어별로 2명씩 총 4명의 언어학자들이 여러 테스트 세트에서 번역 결과를 평가하였다.
실험 결과
연구 질문
- RQ1영어-힌두어 및 영어-벵골어 번역에서 단순 문장으로 훈련된 NMT가 SMT를 능가하는가?
- RQ2혼합 복잡도 훈련 데이터에 비해 단순 문장으로만 훈련된 MT 모델이 번역 품질을 향상시키는가?
- RQ3저자원 언어 쌍에서 문자 수준과 단어 수준 NMT 모델 간의 성능 차이는 어떻게 되는가?
- RQ4부드러운 어텐션 메커니즘이 이 언어 쌍의 단어 수준 NMT 출력 품질에 어떤 영향을 미치는가?
- RQ5어떤 상황에서 SMT가 NMT를 능가하며, 이러한 성과에 기여하는 요인은 무엇인가?
주요 결과
- NMT는 단순 문장에서 SMT를 능가한다: 영어-벵골어 단순 문장에서 어텐션을 적용한 단어 수준 NMT는 BLEU 9.95, TER 85.66을 기록했고, SMT는 BLEU 0, TER 117.67을 기록했다.
- 혼합 복잡도 코퍼스에서는 SMT가 NMT를 능가한다: 영어-벵골어 번역에서 SMT는 BLEU 85.26, TER 15.9를 기록했고, 최고의 NMT 모델(WNMT 어텐션 포함)은 BLEU 9.95, TER 85.66를 기록했다.
- 어텐션을 적용한 단어 수준 NMT(WNMT(A))는 벵골어 번역에서 평균 적절성(2.08)과 어휘 흐름성(2.12)이 가장 높았으며, SMT와 문자 수준 NMT를 모두 능가했다.
- 문자 수준 NMT(CNMT)는 단어 수준 NMT보다 성능이 열 劣하였으며, 영어-벵골어 단순 문장에서 BLEU 점수 8.69를 기록하여 저자원 환경에서의 한계를 보여주었다.
- 영어-힌두어 번역에서 SMT는 전체 코퍼스 기준 BLEU 12.86을 기록했고, 최고의 NMT 모델(WNMT 어텐션 포함)은 BLEU 10.54를 기록하여, 복잡한 데이터에서 SMT의 우월성을 확인했다.
- 수동 평가 결과, SMT는 복잡한 문장에서 더 어휘 흐름성 있고 적절한 번역을 제공했고, NMT는 특히 어텐션 메커니즘을 적용한 경우 단순 문장에서 더 뛰어난 어휘 흐름성과 적절성을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.