Skip to main content
QUICK REVIEW

[논문 리뷰] Towards the Use of Deep Reinforcement Learning with Global Policy For Query-based Extractive Summarisation

Diego Mollá|arXiv (Cornell University)|2017. 11. 10.
Topic Modeling참고 문헌 8인용 수 4
한 줄 요약

이 논문은 ROUGE-L 점수를 최종 보상으로 사용하여 요약 품질을 직접 최적화하는 전역 정책(global policy)을 갖춘 딥 강화학습 접근법을 제안한다. 할당된 보상 없이 보상이 없이 문장 선택 과정을 거치며, 최종적으로는 ROUGE-L 점수를 보상으로 사용하여 정책 기반 강화학습을 통해 단순한 신경망 정책을 학습시킨다. 이는 간단한 특징과 제한된 학습 데이터에도 불구하고 테스트 데이터에서 향상된 ROUGE-L 점수를 달성한다.

ABSTRACT

Supervised approaches for text summarisation suffer from the problem of mismatch between the target labels/scores of individual sentences and the evaluation score of the final summary. Reinforcement learning can solve this problem by providing a learning mechanism that uses the score of the final summary as a guide to determine the decisions made at the time of selection of each sentence. In this paper we present a proof-of-concept approach that applies a policy-gradient algorithm to learn a stochastic policy using an undiscounted reward. The method has been applied to a policy consisting of a simple neural network and simple features. The resulting deep reinforcement learning system is able to learn a global policy and obtain encouraging results.

연구 동기 및 목표

  • 감독 요약에서 개별 문장 레이블링과 최종 요약 평가 간의 불일치 문제를 해결하기 위해.
  • 문장 수준의 레이블이 아닌 최종 요약 ROUGE-L 점수를 최적화하는 엔드 투 엔드 학습을 가능하게 하기 위해.
  • 각 요약마다 재학습이 필요 없이 입력 간에 일반화 가능한 전역 정책을 개발하기 위해.
  • 추출 요약에 대해 딥 강화학습 프레임워크 내에서 직접 ROUGE-L 보상을 사용할 수 있는지의 타당성을 입증하기 위해.
  • 간단한 특징과 최소한의 신경망을 강화학습 환경에서 요약에 적용할 수 있는지 탐색하기 위해.

제안 방법

  • 환경은 문장 선택 과정 동안 보상 없이 작동하며, 최종적으로 전체 요약의 ROUGE-L 점수를 보상으로 반환한다.
  • 스토케스틱 정책은 각 문장을 선택할 확률을 출력하는 피드포워드 신경망으로 모델링된다.
  • 최종 ROUGE-L 점수로 스케일된 교차 엔트로피 기반 경사하강법을 사용한 REINFORCE 알고리즘의 변종을 통해 정책을 학습시킨다.
  • 학습 중에 액션의 베르누이 샘플링에 감소하는 편향을 도입하여 탐색을 촉진한다.
  • 위치나 길이 정보 없이 문장 유사도, TF-IDF 등의 간단한 특징을 사용해 상태를 표현한다.
  • 학습 후 추론 과정에서는 각 문장에 대해 가장 높은 확률을 가진 액션을 선택하여 빠른 요약 생성을 가능하게 한다.

실험 결과

연구 질문

  • RQ1딥 강화학습 모델은 추출 요약에서 ROUGE-L 점수를 직접 최적화하는 전역 정책을 학습할 수 있는가?
  • RQ2기본 특징을 사용하는 단순한 신경망 정책은 높은 ROUGE-L 점수를 갖는 요약을 생성하는 데 얼마나 효과적인가?
  • RQ3실제 ROUGE-L 점수를 최종 보상으로 사용할 경우, 근사 보상보다 성능 향상이 이루어지는가?
  • RQ4재학습 없이도 전역 정책이 새로운 질의와 문서 간에 일반화 가능한가?
  • RQ5상태 표현에서 문장 위치와 같은 핵심 요약 신호를 제외했을 경우 모델의 성능은 어떻게 되는가?

주요 결과

  • 모델는 훈련 및 테스트 데이터에서 모두 ROUGE-L 점수를 향상시키는 전역 정책을 성공적으로 학습하여 훈련 분포를 초월한 일반화 능력을 보였다.
  • 200,000 단계 동안의 학습 과정에서 평균 ROUGE-L 점수는 점진적으로 향상되었으며, 이와 함께 테스트 성능도 함께 상승했다.
  • 약 200,000개의 훈련 단계 이후 과적합 현상이 나타나기 시작하여 정규화 또는 조기 종료가 필요함을 시사한다.
  • 기본 특징과 단순한 네트워크를 사용했음에도 불구하고 유의미한 성과를 달성하여 직접 ROUGE-L 최적화의 실현 가능성을 입증했다.
  • 초기 실험 결과에 따르면, 상태 표현에 요약 길이를 추가하면 수렴 속도와 최종 성능 향상에 기여할 수 있다.
  • 할인되지 않은 보상과 정책 기반 경사하강법을 사용함으로써, 서브티튜션 문장 수준의 레이블에 의존하지 않고 효과적인 엔드 투 엔드 학습이 가능했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.