Skip to main content
QUICK REVIEW

[논문 리뷰] Better Rewards Yield Better Summaries: Learning to Summarise Without References

Florian Böhm, Yang Gao|TUbilio (Technical University of Darmstadt)|2019. 09. 03.
Topic Modeling참고 문헌 18인용 수 9
한 줄 요약

이 논문은 기준 요약문이 필요 없이 인간 평가 점수 2,500개에서 직접 보상 함수를 학습하는 강화학습(RL)-기반 문서 요약 방법을 제안한다. 인간 평가와 비교했을 때 ROUGE보다 인간 선호도와 상관관계가 뚜렷이 높은 보상 함수를 학습함으로써, 최신의 지도학습 또는 ROUGE 보상 기반 RL 시스템보다 인간 평가에서 훨씬 높은 점수를 받는 요약문을 생성한다.

ABSTRACT

Reinforcement Learning (RL) based document summarisation systems yield state-of-the-art performance in terms of ROUGE scores, because they directly use ROUGE as the rewards during training. However, summaries with high ROUGE scores often receive low human judgement. To find a better reward function that can guide RL to generate human-appealing summaries, we learn a reward function from human ratings on 2,500 summaries. Our reward function only takes the document and system summary as input. Hence, once trained, it can be used to train RL-based summarisation systems without using any reference summaries. We show that our learned rewards have significantly higher correlation with human ratings than previous approaches. Human evaluation experiments show that, compared to the state-of-the-art supervised-learning systems and ROUGE-as-rewards RL summarisation systems, the RL systems using our learned rewards during training generate summarieswith higher human ratings. The learned reward function and our source code are available at https://github.com/yg211/summary-reward-no-reference.

연구 동기 및 목표

  • 요약 수준에서 ROUGE가 인간 판단과 상관관계가 떨어져 강화학습 기반 요약 시스템을 잘못 이끄는 문제를 해결하기 위해.
  • 생성된 요약문에 대한 인간 평가에서 직접 학습함으로써 인간 선호도와 더 잘 상관관계가 되는 보상 함수를 개발하기 위해.
  • 기준 요약문에 접근할 수 없으며, 소스 문서와 생성된 요약문만을 입력으로 사용하여 RL 기반 요약 시스템을 훈련하기 위해.
  • 학습된 보상 함수가 추출형 요약 및 추상적 요약 설정 모두에서 요약 품질을 향상시킨다는 것을 입증하기 위해.

제안 방법

  • 500개의 CNN/DailyMail 기사에서 유래한 2,500개 요약문에 대한 인간 평가 점수를 바탕으로 신경망 보상 모델을 훈련하며, 입력은 소스 문서와 생성된 요약문 뿐이다.
  • 다양한 텍스트 인코더와 신경망 아키텍처를 사용하여 보상 학습 문제를 회귀 또는 선호도 학습으로 설정한다.
  • 학습된 보상 함수를 사용하여 교차 입력 및 입력 전용 설정에서 추출형 및 추상적 RL 기반 요약 시스템을 훈련한다.
  • 요약문의 정보성, 간결성, 문법성, 소스 문서에 대한 충실도를 기준으로 인간 평가를 통해 요약문을 평가한다.
  • 학습된 보상 함수를 사용한 RL 에이전트의 성능을 ROUGE나 지도학습 기반 베이스라인을 사용한 에이전트와 비교한다.
  • 전체 평가보다 저비용인 선호도 피드백(예: 쌍대 비교)을 사용하여 효율적인 보상 학습을 가능하게 한다.

실험 결과

연구 질문

  • RQ1인간 평가에서 학습된 보상 함수가 요약 수준에서 ROUGE보다 인간 판단과 더 강한 상관관계를 가지는가?
  • RQ2기준 요약문 없이도 보상 모델을 학습시킨 후에도 RL 에이전트가 더 높은 품질의 요약문을 생성하도록 이끌 수 있는가?
  • RQ3학습된 보상 함수를 사용한 RL 기반 요약 시스템의 성능이 인간 평가에서 최신의 지도학습 및 ROUGE 보상 기반 시스템과 비교해 어떻게 되는가?
  • RQ4학습된 보상 함수가 생성된 요약문의 중복을 어느 정도 줄이고 충실도를 향상시키는가?

주요 결과

  • 학습된 보상 함수는 특히 ROUGE가 품질 차이를 구분하지 못하는 요약 수준에서 인간 평가와 상관관계가 뚜렷이 더 높다.
  • 학습된 보상 함수를 사용한 RL 기반 요약 시스템은 인간 평가에서 2.20점의 점수를 기록했으며, 이는 ROUGE를 보상으로 사용한 경우의 1.75점보다 유의미하게 높다(p = 0.0057).
  • 선호도 기반 평가에서 학습된 보상 함수를 사용한 시스템은 75%의 비교에서 선호되었고, ROUGE 보상 기반 베이스라인은 단지 15%에 그쳤다.
  • 학습된 보상 함수는 중복을 줄였다: ROUGE 보상 기반 시스템은 여섯 개의 중복 요약문을 생성한 반면, 학습된 보상 기반 시스템은 오직 두 개의 중복 요약문만 생성했다.
  • 이 방법은 충실도를 향상시켜 소스 텍스트의 시기나 사건에 대한 잘못된 주장과 같은 환각 현상을 줄였다.
  • 보상 모델은 추출형 요약과 추상적 요약 모두에 일반화되며, 기준 요약문이 필요 없이 두 설정 모두에서 최신 기술보다 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.