Skip to main content
QUICK REVIEW

[논문 리뷰] MoverScore: Text Generation Evaluating with Contextualized Embeddings and Earth Mover Distance

Wei Zhao, Maxime Peyrard|arXiv (Cornell University)|2019. 09. 05.
Multimodal Machine Learning Applications참고 문헌 48인용 수 19
한 줄 요약

이 논문은 문맥을 고려한 임베딩(예: BERT)과 지구이동거리(EMD)를 조합하여 시스템 출력과 기준 텍스트 간의 의미 유사도를 측정하는 새로운 텍스트 생성 평가 지표인 MoverScore를 제안한다. 이는 요약, 기계 번역, 이미지 캡션 생성, 데이터에서 텍스트 생성 등 다양한 작업에서 인간 평가와의 상관관계가 최고 수준이며, 강력한 기준 지표를 능가하고, 기계 번역 분야에서는 평균 5.8점까지 초과하는 감독 학습 기반 지표와 경쟁한다.

ABSTRACT

A robust evaluation metric has a profound impact on the development of text generation systems. A desirable metric compares system output against references based on their semantics rather than surface forms. In this paper we investigate strategies to encode system and reference texts to devise a metric that shows a high correlation with human judgment of text quality. We validate our new metric, namely MoverScore, on a number of text generation tasks including summarization, machine translation, image captioning, and data-to-text generation, where the outputs are produced by a variety of neural and non-neural systems. Our findings suggest that metrics combining contextualized representations with a distance measure perform the best. Such metrics also demonstrate strong generalization capability across tasks. For ease-of-use we make our metrics available as web service.

연구 동기 및 목표

  • 텍스트 품질에 대한 인간 평가와 높은 상관관계를 가지는 강력하고 비지도 학습 기반의 텍스트 생성 평가 지표를 개발하기.
  • BLEU나 ROUGE와 같은 n-gram 기반 지표가 다양한 표면 형태 간의 의미 유사도를 포착하지 못하는 한계를 극복하기.
  • 문맥 기반 임베딩과 지구이동거리를 조합하면 더 포괄적이고 일반화된 평가 지표를 도출할 수 있는지 탐구하기.
  • 요약, 기계 번역, 이미지 캡션 생성, 데이터에서 텍스트 생성 등 다양한 텍스트 생성 작업에서 지표의 성능 평가하기.
  • 지표가 작업 간 및 언어 쌍 간에 잘 일반화되는지, 심지어 일부 감독 학습 기반 지표를 능가하는지 입증하기.

제안 방법

  • 시스템 텍스트와 기준 텍스트의 단어를 문맥 기반 단어 임베딩(예: BERT)으로 표현하여 풍부한 의미적 및 문법적 정보를 포착한다.
  • 지구이동거리(WMD)를 적용하여 시스템 텍스트의 단어 분포를 기준 텍스트의 분포로 변환하는 최소 비용을 계산함으로써 의미 일치를 모델링한다.
  • 지표는 문장 수준 정렬(문장 이동)과 단어 수준 정렬(단어 이동)의 두 가지 변형으로 구현되며, 후자가 더 뛰어난 성능을 보였다.
  • 대규모 자연어 추론(NLI) 데이터셋(예: MNLI)에서 BERT를 미세조정하면 문맥 기반 임베딩의 품질이 향상되고 인간 평가와의 상관관계가 증가한다.
  • 다양한 BERT 레이어의 임베딩을 효과적으로 통합하기 위해 레이어별 통합 기법(예: p-means, 라우팅)을 사용한다.
  • 최종 점수는 시스템 텍스트와 기준 텍스트의 가중치가 부여된 단어 임베딩 간의 WMD 거리로 계산되며, 높은 점수일수록 더 좋은 의미 일치를 의미한다.

실험 결과

연구 질문

  • RQ1문맥 기반 임베딩과 지구이동거리를 기반으로 한 지표가 기존의 n-gram 기반 또는 임베딩 기반 지표보다 인간 평가와 더 높은 상관관계를 달성할 수 있는가?
  • RQ2임베딩 모델의 선택(예: BERT 대비 ELMo 또는 word2vec)이 다양한 텍스트 생성 작업에서 평가 지표의 성능에 미치는 영향은 어떠한가?
  • RQ3NLI 데이터에서 BERT를 미세조정하면 평가를 위한 임베딩 품질이 향상되는가? 만약 그렇다면, 그 정도는 어느 정도인가?
  • RQ4특히 중국어-영어와 같은 거리가 먼 언어 쌍에서 지표의 성능은 어떠한가?
  • RQ5MoverScore와 같은 비지도 학습 지표가 평가 성능에서 감독 학습 기반 지표를 뛰어넘거나 대체할 수 있는가?

주요 결과

  • 기계 번역 분야에서 MoverScore는 인간 평가와 평균 상관관계 0.743을 기록했으며, 최고 성능을 보이는 감독 학습 기반 지표를 5.8점 초과하여 뛰어넘었다.
  • 기계 번역 분야에서 METEOR++보다 5.7점, 이미지 캡션 생성 분야에서 SPICE보다 3.0점, 대화 응답 생성 분야에서 METEOR보다 2.2점 높은 성능을 보였다.
  • MNLI 데이터에서 BERT를 미세조정하면 7개 언어 쌍에서 평균 1.8점 상관관계 향상을 기록하여, 작업에 특화된 사전 훈련의 유용성을 입증했다.
  • 문맥 기반 임베딩(BERT)은 비문맥 기반 임베딩(예: word2vec, ELMo)보다 뚜렷이 뛰어난 성능을 보였으며, BERT 기반 MoverScore가 가장 높은 성능을 기록했다.
  • MoverScore의 부드러운 정렬 방식이 BERTScore의 딱딱한 정렬 방식보다 약간 더 뛰어난 성능을 보였으며, 이는 단어 매칭의 유연성이 평가 성능 향상에 기여함을 시사한다.
  • Lexical 기반 지표인 SentBLEU와 달리, MoverScore는 고품질과 저품질 번역을 명확히 구분할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.