Skip to main content
QUICK REVIEW

[논문 리뷰] Translating Terminological Expressions in Knowledge Bases with Neural Machine Translation

Mihael Arčan, Daniel Torregrosa|arXiv (Cornell University)|2017. 09. 07.
Natural Language Processing Techniques참고 문헌 43인용 수 5
한 줄 요약

이 논문은 의료(ICD) 및 금융(IFRS) 온톨로지에서 고도로 전문적인 용어 표현을 독일어로 번역하기 위해 신경 기계 번역(NMT)과 통계 기계 번역(SMT)을 평가한다. 전용 용어 표현을 사용한 도메인 적응이 번역 품질을 크게 향상시키며, 특히 도메인 특화 레이블에서 NMT가 SMT를 능가하고, 어절 기반 모델보다 서브워드 모델이 용어 번역에서 더 우수한 성능을 보임을 입증한다.

ABSTRACT

Our work presented in this paper focuses on the translation of terminological expressions represented in semantically structured resources, like ontologies or knowledge graphs. The challenge of translating ontology labels or terminological expressions documented in knowledge bases lies in the highly specific vocabulary and the lack of contextual information, which can guide a machine translation system to translate ambiguous words into the targeted domain. Due to these challenges, we evaluate the translation quality of domain-specific expressions in the medical and financial domain with statistical as well as with neural machine translation methods and experiment domain adaptation of the translation models with terminological expressions only. Furthermore, we perform experiments on the injection of external terminological expressions into the translation systems. Through these experiments, we observed a significant advantage in domain adaptation for the domain-specific resource in the medical and financial domain and the benefit of subword models over word-based neural machine translation models for terminology translation.

연구 동기 및 목표

  • 지식 기반 자료 내 도메인 특화 용어 표현 번역을 위한 신경 및 통계 기계 번역의 효과성을 평가하는 것.
  • 의료 및 금융 온톨로지에서 전용 용어 표현만을 사용한 도메인 적응이 번역 품질을 향상시키는지 조사하는 것.
  • 저자원 도메인 특화 용어에 대해 외부 용어 지식(예: 위키백과에서의 정보)을 번역 모델에 통합함으로써 영향을 미치는지 평가하는 것.
  • 서브워드 기반 NMT 모델과 어절 기반 모델 간의 성능을 비교하여 희귀 도메인 특화 용어 번역에 대한 영향을 분석하는 것.
  • 온톨로지 및 지식 그래프와 같은 의미적으로 구조화된 자료의 번역 품질 향상에 최적의 전략을 규명하는 것.

제안 방법

  • 영어-독일어 번역을 위한 일반적 병렬 코퍼스를 기반으로 신경 기계 번역(NMT) 및 통계 기계 번역(SMT) 모델을 훈련시켰다.
  • 도메인 적응을 위해 ICD 및 IFRS 온톨로지의 전용 용어 표현만을 사용하여 모델을 미세 조정했다.
  • 어휘 일치 또는 임베딩 유사도 기반 번역 확률을 할당하여 위키백과 제목 및 概要에서 유래한 외부 지식을 번역 과정에 통합했다.
  • 유니그램 대체 및 어휘 정렬 기법을 사용해 NMT 시스템에 외부 용어를 통합하였으며, 단어 임베딩 간余弦 유사도를 활용해 확률을 조정했다.
  • 도메인 내 테스트 세트 및 개발 세트에서 BLEU 점수를 사용해 번역 품질을 평가하였으며, 일반 모델, 적응 모델, 외부 지식 통합 변형 모델 간 비교를 수행했다.
  • OOV(어휘 외어) 어휘에 대한 성능을 평가하기 위해 서브워드 기반 NMT(sentencepiece)와 어절 기반 NMT 및 SMT를 비교했다.

실험 결과

연구 질문

  • RQ1의료 및 금융 온톨로지 레이블 번역에 대해 전용 용어 표현만을 사용한 도메인 적응이 번역 품질을 향상시키는가?
  • RQ2고립된 도메인 특화 용어 번역에서 신경 기계 번역이 통계 기계 번역보다 어떻게 비교되는가?
  • RQ3외부 용어 지식(예: 위키백과에서의 정보)을 도메인 특화 표현에 통합할 경우 번역 성능에 어떤 영향을 미치는가?
  • RQ4희귀 도메인 특화 용어 번역에서 서브워드 기반 NMT가 어절 기반 NMT를 능가하는가?
  • RQ5목표 도메인의 어휘가 일반 목적 코퍼스와 크게 다를 경우, 외부 지식 통합이 번역 품질 향상에 기여하는가?

주요 결과

  • ICD 및 IFRS 온톨로지의 전용 용어 표현만을 사용한 도메인 적응이 NMT 및 SMT 양쪽 모두의 번역 품질을 크게 향상시켰으며, 특히 도메인 특화 레이블에서 NMT가 더 뛰어난 성능을 보였다.
  • 서브워드 기반 NMT 모델이 도메인 특화 용어 번역에서 어절 기반 NMT 모델보다 뛰어난 성능을 보였으며, 이는 주로 OOV(어휘 외어) 어휘를 더 잘 처리하기 때문이었다.
  • ICD 온톨로지의 경우, 도메인 내 개발 세트 번역을 통합함으로써 NMT에서 BLEU 점수가 3점 상승(8.05 → 10.41)했지만, 위키백과 통합은 성능 저하를 초래함(8.05 → 5.03).
  • IFRS 온톨로지의 경우, 도메인 내 개발 세트를 통합함으로써 SMT의 BLEU 점수는 14.66에서 29.69로 상승했으며, NMT는 29.69로 상승하여 도메인 적응의 강력한 성과를 보였다.
  • 위키백과에서 유래한 외부 지식 통합은 최소한의 이점을 보였으며, ICD의 경우 BLEU 점수가 6.39에서 5.03으로 하락했고, IFRS의 경우 10.54에서 10.51로 약간 하락하여 위키백과 어휘와 도메인 특화 용어 간의 정렬이 열악함을 확인했다.
  • 전체 1,000개의 ICD 용어 중 23개와 IFRS 용어 중 1개만이 위키백과 지식 기반에서 정확한 용어 쌍으로 발견되어 일반 목적 자원과 도메인 특화 자원 간 어휘 불일치가 뚜렷하게 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.