Skip to main content
QUICK REVIEW

[논문 리뷰] Ranking Sentences for Extractive Summarization with Reinforcement Learning

Shashi Narayan, Shay B. Cohen|arXiv (Cornell University)|2018. 02. 23.
Topic Modeling인용 수 6
한 줄 요약

이 논문은 추출적 요약에서 ROUGE 평가 지표를 직접 최적화하는 강화학습 기반 문장 순위 지정 모델을 제안하며, 자동 평가 및 인간 평가 모두에서 CNN/DailyMail 데이터셋에서 최신 기술보다 뛰어난 성능을 보였다. 정책 그래디언트와 ROUGE 기반 보상함수를 사용하여 계층적 신경망을 훈련시켜 문장을 순위 매기는 방식으로, 교차 엔트로피로 훈련된 기준 모델보다 더 간결하고 정보량이 많으며 유창한 요약을 생성한다.

ABSTRACT

Single document summarization is the task of producing a shorter version of a document while preserving its principal information content. In this paper we conceptualize extractive summarization as a sentence ranking task and propose a novel training algorithm which globally optimizes the ROUGE evaluation metric through a reinforcement learning objective. We use our algorithm to train a neural summarization model on the CNN and DailyMail datasets and demonstrate experimentally that it outperforms state-of-the-art extractive and abstractive systems when evaluated automatically and by humans.

연구 동기 및 목표

  • 추출적 요약에서 표준 교차 엔트로피 훈련과 ROUGE 평가 지표 사이의 불일치 문제를 해결하기 위해.
  • 강화학습을 통해 ROUGE를 전역적으로 최적화함으로써 요약 품질을 향상시키기 위해.
  • 전역적으로 훈련된 추출적 모델이 정보량과 완전성 면에서 추상적 모델을 능가할 수 있음을 보여주기 위해.
  • 정책 그래디언트 기반 강화학습을 통한 문장 순위 지정이 더 간결하고 정보량 많은 요약을 생성함을 보여주기 위해.
  • 추출적 및 추상적 시스템을 비교하는 대규모 인간 평가를 통해 방법의 타당성을 검증하기 위해.

제안 방법

  • 모델는 문서 인코더와 문장 추출기로 구성된 계층적 인코더-디코더 아키텍처를 사용하여 각 문장의 추출 가능성 점수를 평가한다.
  • 최대우도 기반 교차 엔트로피 손실과 REINFORCE 알고리즘을 사용한 정책 그래디언트 목표 함수를 결합한다.
  • 보상 함수는 후보 요약과 정답 요약 간의 ROUGE 점수에 기반하여, 문장 순위 지정에 대한 조밀한 피드백을 제공한다.
  • 후보 요약은 상위 순위 문장을 선택하여 구성되며, 모델는 정책 그래디언트를 통해 고-ROUGE 선택의 가능성을 높이도록 업데이트된다.
  • 훈련 과정은 후보 요약의 공간을 탐색하며, 자주 고점수 요약에 포함되는 문장을 순위 매기는 데 학습한다.
  • 언어적 특징이나 수동 히ュ리스틱에 의존하지 않고, 데이터에서 직접 연속적인 표현을 학습한다.

실험 결과

연구 질문

  • RQ1ROUGE 기반 보상함수를 사용한 강화학습이 교차 엔트로피 훈련을 넘어서 추출적 요약 성능을 향상시킬 수 있는가?
  • RQ2ROUGE 지표를 전역적으로 최적화하면 표준 훈련 목표함수보다 더 정보량 많고 간결한 요약을 생성하는가?
  • RQ3인간 평가에서 전역적으로 훈련된 추출적 모델은 최신 기술의 추상적 모델과 비교해 어떻게 성과를 내는가?
  • RQ4정책 그래디언트 기반으로 훈련된 문장 순위 지정 모델이 표준 벤치마크에서 기존의 추출적 및 추상적 시스템을 모두 능가할 수 있는가?
  • RQ5인간 평가에서 모델는 원본 문서의 핵심 정보를 어느 정도 유지하는가?

주요 결과

  • 제안된 모델은 CNN 및 DailyMail 데이터셋에서 자동 ROUGE 평가에서 최신 기술의 추출적 및 추상적 모델을 모두 능가한다.
  • 인간 평가 결과, 참가자들이 제안된 모델이 생성한 요약이 추상적 시스템의 요약보다 정보량과 완전성 면에서 더 우수하다고 평가했다.
  • 교차 엔트로피로 훈련된 모델에 비해 더 간결하고 중복 요소가 적은 요약을 생성한다.
  • 강화학습 목표 함수는 모델의 문장 순위 지정이 ROUGE 지표와 잘 일치하도록 성공적으로 조정하여 요약의 전반적 품질을 향상시켰다.
  • 결과적으로 인간 평가에서 볼 때, 유연성은 있지만 일관되게 승리하지는 못하는 추상적 모델이 전역 최적화된 추출적 모델에 비해 뒤처질 수 있음을 보여주었다.
  • 강화학습을 통한 평가 지표 직접 최적화가 추출적 요약에 효과적임을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.