Skip to main content
QUICK REVIEW

[논문 리뷰] Sentence Level Human Translation Quality Estimation with Attention-based Neural Networks

Yu Yuan, Serge Sharoff|arXiv (Cornell University)|2020. 03. 13.
Natural Language Processing Techniques참고 문헌 25인용 수 6
한 줄 요약

이 논문은 참조 없는 세분화된 인간 번역 품질 평가(HTQE)를 위한 엔드 투 엔드 주의 기반 신경망을 제안한다. 교차주의를 활용하여 품질 평가에 적합한 소스-타겟 문장 쌍을 식별한다. 모델은 네 가지 품질 측면에서 인간 평가와의 상관계수에서 기능 기반 방법보다 0.22 이상 높은 성능을 보이며, 수동적 기능 설계 없이도 뛰어난 성능을 입증한다.

ABSTRACT

This paper explores the use of Deep Learning methods for automatic estimation of quality of human translations. Automatic estimation can provide useful feedback for translation teaching, examination and quality control. Conventional methods for solving this task rely on manually engineered features and external knowledge. This paper presents an end-to-end neural model without feature engineering, incorporating a cross attention mechanism to detect which parts in sentence pairs are most relevant for assessing quality. Another contribution concerns of prediction of fine-grained scores for measuring different aspects of translation quality. Empirical results on a large human annotated dataset show that the neural model outperforms feature-based methods significantly. The dataset and the tools are available.

연구 동기 및 목표

  • 수동적으로 설계된 기능에 의존하지 않고 자동으로 인간 번역 품질 평가를 수행할 수 있는 엔드 투 엔드 신경 모델을 개발하는 것.
  • 품질 판단에 적합한 소스-타겟 문장 부분을 식별하는 가중치가 부여된 교차주의 메커니즘을 통합하여 HTQE의 정확도를 향상시키는 것.
  • 일반적인 평가보다 더 세분화된 품질 점수(예: 유창성, 적절성 등)를 다수의 측면에서 예측하는 것.
  • 특히 참조 없는 설정에서 자동 HTQE에 관한 이전 연구가 제한적인 도전 과제를 해결하는 것.
  • 교육, 자격 시험, 품질 관리 응용 분야에서 전문가의 인간 평가에 비해 확장 가능하고 일관되며 저비용 대안을 제공하는 것.

제안 방법

  • 모델은 소스 문장과 타겟 문장을 별도로 학습된 임bedding을 사용하여 인코딩하는 듀얼 인코더 트랜스포머 유사 아키텍처를 사용한다.
  • 가중치가 부여된 교차주의 메커니즘이 소스와 타겟 문장 간의 관련 부분을 동적으로 정렬하여 双어 품질 관련 정보를 포착한다.
  • 주의를 통해 생성된 표현은 풀링되어 다차원에 걸쳐 세분화된 품질 점수를 예측하기 위한 회귀 헤드로 입력된다.
  • 예측된 점수와 인간이 평가한 점수 간의 차이를 최소화하기 위해 평균 제곱오차 손실을 사용하여 엔드 투 엔드로 모델을 훈련한다.
  • 외부 언어학적 기능이나 병렬 참조에 의존하지 않아 참조 없는 예측이 가능하다.
  • 모델은 문장 단위로 세분화된 품질 평가가 내재된 대규모 전문가가 평가한 영어-중어 번역 데이터셋에서 평가된다.

실험 결과

연구 질문

  • RQ1교차주의를 갖춘 신경망이 기존의 기능 기반 방법보다 参照 없는 인간 번역 품질 평가에서 더 나은 성능을 내는가?
  • RQ2엔드 투 엔드 신경 모델이 수동 기능 설계 없이도 세분화된 품질 측면(예: 유창성, 적절성 등)을 얼마나 잘 예측할 수 있는가?
  • RQ3주의 메커니즘이 품질 판단에 적합한 소스-타겟 문장 조각을 식별하는 데 얼마나 효과적인가?
  • RQ4기본 모델 대비 다양한 품질 차원에서 안정적인 성능을 유지하는가?
  • RQ5번역 교육 및 자격 시험과 같은 실생활 응용 분야로 일반화 가능한가?

주요 결과

  • 제안된 신경 모델은 인간 평가와의 상관계수에서 0.82를 기록하며, 네 가지 품질 측면에서 기능 기반 기준보다 0.22 이상 높은 성능을 보였다.
  • 모델은 유창성, 적절성, 어휘 정확도, 자연스러움의 네 가지 품질 차원에서 일관된 성능을 보이며, 작업별 특화 기능 조정이 필요하지 않았다.
  • 주의 메커니즘이 잘못 번역된 관용구나 누락된 수식어와 같은 관련 있는 소스-타겟 조각을 성공적으로 식별하여 국소적 품질 검출을 향상시켰다.
  • 기본 신경망과 두 가지 기능 기반 방법보다도 모델이 뛰어난 성능을 보이며, 주의 기반 엔드 투 엔드 학습의 우수성을 확인했다.
  • 데이터셋과 코드는 허용성 있는 라이선스 하에 공개되어 재현성과 HTQE 분야의 향후 연구를 가능하게 했다.
  • BERT를 사용한 초도 실험에서는 성능 향상이 없었으며, 이는 교차 언어 사전 학습이 더 큰 데이터나 더 정교한 정렬 메커니즘을 필요로 할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.