Skip to main content
QUICK REVIEW

[논문 리뷰] Better Summarization Evaluation with Word Embeddings for ROUGE

Jun-Ping Ng, Viktoria Abrecht|arXiv (Cornell University)|2015. 08. 25.
Topic Modeling참고 문헌 13인용 수 12
한 줄 요약

이 논문은 텍스트 요약 평가를 향상시키기 위해 사전 훈련된 단어 임베딩을 사용해 어휘 일치를 의미적 유사성으로 대체하는 ROUGE-WE라는 ROUGE 메트릭의 향상된 버전을 제안한다. 표면적 단어 일치가 아닌 의미적 유사성을 측정함으로써, ROUGE-WE는 인간 평가와 유의미하게 높은 상관관계를 보이며, TAC AESOP 평가에서 C_S_IIITH3와 같은 최신 기술 시스템을 능가한다.

ABSTRACT

ROUGE is a widely adopted, automatic evaluation measure for text summarization. While it has been shown to correlate well with human judgements, it is biased towards surface lexical similarities. This makes it unsuitable for the evaluation of abstractive summarization, or summaries with substantial paraphrasing. We study the effectiveness of word embeddings to overcome this disadvantage of ROUGE. Specifically, instead of measuring lexical overlaps, word embeddings are used to compute the semantic similarity of the words used in summaries instead. Our experimental results show that our proposal is able to achieve better correlations with human judgements when measured with the Spearman and Kendall rank coefficients.

연구 동기 및 목표

  • 요약문에서 어휘 유사성에 치우친 ROUGE의 편향을 해결하여, 어휘가 다를 수 있지만 의미적으로 동일한 요약문 평가에 효과를 높이기 위해.
  • 표면적 n-그램 일치에만 의존하는 것 대신 의미적 유사성을 단어 임베딩을 통해 통합함으로써 자동 요약 평가를 향상시키기 위해.
  • 어휘적으로 다를 수 있지만 의미적으로 동일한 요약문에 대해 인간 평가와의 상관관계를 높이기 위해 ROUGE의 인간 평가와의 상관관계를 향상시키기 위해.
  • 정확한 단어 일치에 의존도를 줄임으로써 ROUGE의 요약 생성 요약 평가 적용 범위를 확장하기 위해.
  • 의미적 유사성 측정을 통해 단어 임베딩를 활용할 경우, 전통적인 ROUGE 버전보다 더 강력하고 인간의 평가와 일치하는 평가 메트릭이 가능하다는 것을 입증하기 위해.

제안 방법

  • 어휘 유사성과 벡터 거리 간의 상관관계를 반영하는 밀도 벡터 공간에 단어를 매핑하기 위해 word2vec 임베딩을 도입한다.
  • ROUGE의 어휘 일치 계산 방식을 단어 임베딩 간의 의미적 유사성으로 대체하여, 유니그램, 바이그램, 스킵-바이그램에 적용한다.
  • 문장 수준 비교에서 의미를 유지하기 위해 유니그램 단어 임베딩의 원소별 곱셈을 통해 바이그램 표현을 구성한다.
  • 향상된 의미적 유사성을 ROUGE 변형에 통합함: ROUGE-WE-1, ROUGE-WE-2, ROUGE-WE-SU4.
  • 시스템 점수와 인간 평가 간의 일치도를 평가하기 위해 비모수적 순위 상관관계(스피어만 및 켄달)를 사용한다.
  • TAC AESOP 2011 데이터셋에서 기준 ROUGE 및 최고 성능을 보인 AESOP 시스템과의 비교를 통해 평가한다.

실험 결과

연구 질문

  • RQ1어휘 일치를 넘어서 의미적 유사성을 캡처함으로써 단어 임베딩이 ROUGE의 인간 평가와의 상관관계를 향상시킬 수 있는가?
  • RQ2ROUGE-WE는 인간 주석과의 순위 상관관계에서 C_S_IIITH3 및 BE-HM과 같은 최신 기술 시스템에 비해 어떻게 성능을 내는가?
  • RQ3단어 임베딩의 사용이 어휘가 다를 수 있지만 다량의 어휘 재구성(파araphrasing)이 포함된 요약문 평가에 적합성을 높이는가?
  • RQ4왜 ROUGE-WE-2와 ROUGE-WE-SU4는 특히 스킵-바이그램(SU4) 설정에서 성능 패턴이 다를까?
  • RQ5단어 임베딩 곱셈을 통한 의미 조합이 요약 평가에서 어휘 수준의 의미를 효과적으로 표현할 수 있는가?

주요 결과

  • ROUGE-WE-1은 인간 피라미드 점수와 스피어만 상관계수 0.9138을 기록하여 최고의 AESOP 시스템인 C_S_IIITH3(0.9033)를 능가한다.
  • ROUGE-WE-1은 켄달 타우 계수 0.7534를 기록하여 켄달 계수에서 C_S_IIITH3(0.7582)를 약간 뛰어넘는다. 이는 인간 평가와의 강력한 일치를 시사한다.
  • ROUGE-WE-2는 모든 상관관계 지표에서 ROUGE-2를 일관되게 향상시키며, 연속된 바이그램 평가에서 의미적 유사성의 이점이 있음을 입증한다.
  • ROUGE-WE-SU4는 피라미드 평가 및 반응성 평가에서 ROUGE-SU4보다 성능이 열 劣하나, 비연속적 스킵-바이그램에 대한 의미 조합의 어려움이 원인일 수 있다.
  • 단어 임베딩 곱셈은 연속된 바이그램(Rouge-WE-2)에 비해 스킵-바이그램(Rouge-WE-SU4)에서는 성능이 떨어지며, 이는 현재의 조합 모델에 한계가 있음을 시사한다.
  • 기준 ROUGE 및 다른 최고 성능 시스템에 비해 ROUGE-WE-1은 뛰어난 성능을 보이며, 요약 평가에서 의미적 유사성의 효과성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.