Skip to main content
QUICK REVIEW

[논문 리뷰] Connecting Phrase based Statistical Machine Translation Adaptation

Rui Wang, Hai Zhao|arXiv (Cornell University)|2016. 07. 29.
Natural Language Processing Techniques참고 문헌 26인용 수 10
한 줄 요약

이 논문은 도메인 외 데이터에서 유용한 연결 어구(연결어구)를 식별하고 통합하여 번역 성능을 햖थ한 문장 기반 통계적 기계 번역(SMT) 적응 방법을 제안한다. 이 방법은 번역 모델 및 언어 모델 적응을 동시에 향상시키며, 기존의 신경망 기반 대안보다 뛰어난 성능(기준 대비 최대 +1.6 BLEU)과 높은 효율성을 확보한다.

ABSTRACT

Although more additional corpora are now available for Statistical Machine Translation (SMT), only the ones which belong to the same or similar domains with the original corpus can indeed enhance SMT performance directly. Most of the existing adaptation methods focus on sentence selection. In comparison, phrase is a smaller and more fine grained unit for data selection, therefore we propose a straightforward and efficient connecting phrase based adaptation method, which is applied to both bilingual phrase pair and monolingual n-gram adaptation. The proposed method is evaluated on IWSLT/NIST data sets, and the results show that phrase based SMT performance are significantly improved (up to +1.6 in comparison with phrase based SMT baseline system and +0.9 in comparison with existing methods).

연구 동기 및 목표

  • 문장 수준의 SMT 적응 기법은 도메인 내 내용을 포함한 문장에서도 유용한 정보를 손실할 수 있다는 한계를 해결한다.
  • 문장 수준의 선택에만 의존하는 대신, 혼합 도메인 코퍼스에서 세분화된 어구 수준의 단위를 활용하여 SMT 성능을 향상시킨다.
  • 복잡한 신경망을 피하면서도 높은 성능을 유지하는 선형적이고 효율적인 어구 기반 적응 방법을 개발한다.
  • IWSLT 및 NIST 벤치마크에서 번역 모델 및 언어 모델 적응에 대해 평가하여 일관된 성능 향상을 입증한다.

제안 방법

  • 한 어구의 끝부분이 다른 어구의 시작부분과 겹칠 때, 두 도메인 내 어구 쌍을 조합하여 도메인 외 데이터에 나타날 수 있는 새로운 어구(연결어구)를 생성한다.
  • 도메인 외 어구 테이블 또는 n-gram 언어 모델에 등장하는 연결어구만 선택하여 관련성과 신뢰도를 확보한다.
  • 신경망 기반 확률 추정(도메인 내 및 도메인 외 신경망 모델 사용)과 발생 빈도(Probability, OP) 순위 기반 두 가지 필터링 전략을 적용하여 높은 빈도와 신뢰도를 가진 어구를 우선순위로 정렬한다.
  • 선택된 연결어구를 원래 또는 추정된 번역 확률과 함께 도메인 내 번역 모델 및 언어 모델에 통합한다.
  • 어구 쌍과 n-gram에 대해 도메인 내 신경망 확률($Q_{in}$)을 추가 특징으로 통합하여 디코딩 성능을 향상시킨다.
  • OP 기반 또는 NN 기반 순위를 활용해 적응된 어구 집합의 크기를 조정하여 성능과 모델 복잡도 사이의 균형을 맞춘다.

실험 결과

연구 질문

  • RQ1도메인 외 코퍼스에서 유도된 도메인 내 어구 쌍으로 구성된 연결어구가 SMT 성능 향상에 기여할 수 있는가?
  • RQ2BLEU 점수 및 계산 효율성 측면에서 어구 수준의 적응은 문장 수준 또는 모델 수준의 적응보다 어떻게 비교되는가?
  • RQ3연결어구를 통해 도메인 내 및 도메인 외 어구 정보를 융합할 경우, 직접 모델 조합 또는 단일 모델 적응보다 더 높은 번역 품질을 달성할 수 있는가?
  • RQ4정확도와 속도 측면에서 복잡한 신경망 기반 적응 기법을 능가하는 단순한 선형 방법이 가능한가?
  • RQ5적응된 어구와 함께 사용될 때, 도메인 내 신경망 확률 특징($Q_{in}$)이 최종 SMT 성능에 기여하는 정도는 어떠한가?

주요 결과

  • 제안된 연결어구 기반 적응 방법은 IWSLT 프랑스어-영어 번역 작업에서 기준 문장 기반 SMT 대비 +1.6 BLEU 향상을 달성한다.
  • NIST 중국어-영어 번역 작업에서는 기존 방법 대비 +0.9 BLEU 향상을 기록하여 다양한 언어 쌍에서 일관된 성능 향상을 입증한다.
  • Koehn, Sennrich, Hoang 등의 최신 적응 기법보다 BLEU 점수와 적응 속도 측면에서 모두 뛰어난 성능을 보인다.
  • in+connect+OP 버전은 IWSLT FR-EN에서 최고의 BLEU 점수 33.67을 기록했으며, 모델 크기는 단지 122.0M로 다른 고성능 방법보다 훨씬 작다.
  • 적응 시간이 크게 단축되었다: in+connect 방법은 2시간으로, in+NN 방법의 10일 대비 극적으로 빠른 속도를 확보하여 뚜렷한 효율성 우위를 보였다.
  • 도메인 내 신경망 확률 특징($Q_{in}$)을 추가 디코딩 특징으로 통합함으로써 성능이 추가로 향상되었으며, in+connect+OP에 $Q_{in}$을 적용할 경우 IWSLT FR-EN test10 세트에서 +0.31 BLEU 향상을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.