Skip to main content
QUICK REVIEW

[논문 리뷰] GoSum: Extractive Summarization of Long Documents by Reinforcement Learning and Graph Organized discourse state

Junyi Bian, Xiaodi Huang|arXiv (Cornell University)|2022. 11. 18.
Topic Modeling인용 수 4
한 줄 요약

GoSum는 계층적 논의 구조를 인코딩하기 위해 강화학습과 이질적 그래프 신경망을 통합함으로써 장문의 과학적 문서를 위한 새로운 추출 요약 모델을 제안한다. 문장과 단락을 논의 인식형 엣지가 있는 노드로 모델링함으로써 GoSum는 PubMed와 arXiv에서 최신 기준 성능을 달성하여, 논의 계층이 요약 품질을 크게 향상시킨다는 것을 입증한다.

ABSTRACT

Extracting summaries from long documents can be regarded as sentence classification using the structural information of the documents. How to use such structural information to summarize a document is challenging. In this paper, we propose GoSum, a novel graph and reinforcement learning based extractive model for long-paper summarization. In particular, GoSum encodes sentence states in reinforcement learning by building a heterogeneous graph for each input document at different discourse levels. An edge in the graph reflects the discourse hierarchy of a document for restraining the semantic drifts across section boundaries. We evaluate GoSum on two datasets of scientific articles summarization: PubMed and arXiv. The experimental results have demonstrated that GoSum achieve state-of-the-art results compared with strong baselines of both extractive and abstractive models. The ablation studies further validate that the performance of our GoSum benefits from the use of discourse information.

연구 동기 및 목표

  • 기존 모델이 기억 비용과 복잡한 논의 구조로 인해 어려움을 겪는 장문의 과학적 문서에서의 추출 요약 문제를 해결한다.
  • 탐욕적 탐색에서 유도된 비최적의 비결정적 레이블에 의존하는 추출 모델의 한계를 극복하기 위해 강화학습을 활용해 더 나은 훈련 신호를 확보한다.
  • 문장 표현에 단락 경계와 제목과 같은 계층적 논의 정보를 통합하여 문서 단락 간의 의미 이탈을 줄인다.
  • 로컬 문장 맥락과 글로벌 문서 구조를 효율적으로 포착하는 그래프 기반 방법을 개발하여 장입 입력에 대해 선형 확장 가능성을 확보한다.
  • 논의 인식 모델링이 과학 문헌 데이터셋에서 베이스라인 대비 추출 요약 성능을 크게 향상시킨다는 것을 입증한다.

제안 방법

  • 각 문장과 단락을 노드로 하고, 논의 계층을 나타내는 엣지를 통해 구조적 관계를 인코딩하는 이질적 그래프를 구성한다.
  • 그래프 신경망(GNNs)을 사용하여 국소 문장 특징, 글로벌 문서 맥락, 추출 이력이 포함된 문장 상태를 인코딩한다.
  • 요약을 강화학습에서의 순차적 의사결정 과정으로 프레임화하여, 현재 상태에 기반한 문장 선택을 행동으로 간주한다.
  • ROUGE 점수를 기반으로 한 보상 함수를 사용해 강화학습으로 훈련하며, 여러 샘플된 레이블 시퀀스를 통해 데이터 증강을 실현한다.
  • 커리큘럼 학습을 적용하여 단계적으로 단락 정보를 손상시켜 모델의 강인성과 논의 구조의 중요성을 평가한다.
  • 정책 네트워크를 사용해 문장 선택 확률을 예측하고, 골드 요약의 ROUGE 점수에서 유도된 보상으로 정책 기반 강화학습을 최적화한다.

실험 결과

연구 질문

  • RQ1논의 계층의 그래프 구조적 표현이 장문의 과학적 문서 요약 품질을 향상시키는가?
  • RQ2강화학습과 GNN의 통합이 지도학습 또는 비그래프 기반 베이스라인 대비 성능 향상에 기여하는가?
  • RQ3특히 단락 제목과 계층적 구조를 포함한 논의 정보가 요약 품질에 어느 정도 기여하는가?
  • RQ4문단 제목이 누락되거나 잘못 할당된 경우와 같은 논의 구조의 정확성 부족에 모델이 얼마나 민감한가?
  • RQ5강화학습 훈련 중에 샘플된 레이블 시퀀스의 수를 늘리면 일반화 능력과 성능 향상에 기여하는가?

주요 결과

  • GoSum는 PubMed와 arXiv 데이터셋 모두에서 최신 기준 성능을 달성하였으며, PubMed에서 ROUGE-1, ROUGE-2, ROUGE-L 점수는 각각 49.83, 23.56, 45.10이고, arXiv에서는 48.61, 20.53, 42.80을 기록하였다.
  • 단락 제목을 "section #id"로 대체하면 성능에 약간의 측정 가능한 하락이 발생한다—PubMed에서 ROUGE-1, ROUGE-2, ROUGE-L 점수 각각 0.20, 0.11, 0.12 하락하여, 단락 제목의 의미 정보가 약간이지만 유용한 신호를 제공한다는 것을 시사한다.
  • 단락 할당이 손상되면 성능이 뚜렷이 악화되며, 특히 높은 손상 비율에서 심각한 성능 저하가 발생함으로써 논의 계층이 GoSum 성공의 핵심임을 확인한다.
  • 제거 실험 결과, 모델의 성능은 단순히 단락 제목이 아닌 정확한 논의 구조에 가장 민감함을 보이며, 단락 경계가 손상될 경우 성능 하락 폭이 더 큼을 확인한다.
  • 강화학습 중에 여러 샘플된 레이블 시퀀스(top-k)를 사용하면 성능이 크게 향상된다—top-4 샘플링은 49.64의 ROUGE-1 점수를 기록하여 완전한 RL 모델의 49.83에 근접한다.
  • 보상 메커니즘을 제거하고 모든 보상을 1로 설정하면 성능이 약간 감소함을 확인하여, 보상 기반 피드백이 훈련 중 고성능 요약을 구분하는 데 필수적임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.