Skip to main content
QUICK REVIEW

[논문 리뷰] HipoRank: Incorporating Hierarchical and Positional Information into Graph-based Unsupervised Long Document Extractive Summarization

Yue Dong, Andrei Romascanu|arXiv (Cornell University)|2020. 05. 01.
Topic Modeling참고 문헌 45인용 수 10
한 줄 요약

HipoRank는 문단 구조의 계층적이고 위치 정보를 통합하여 문서 표현을 향상시키는 그래프 기반의 비지도 추출 요약 모델을 제안한다. 이는 문장 간 그래프에 방향성과 계층성을 도입함으로써 성능을 향상시킨다. HipoRank는 장문 요약에서 최신 기술 수준의 성능을 달성하여 강력한 비지도 기반 기준 모델을 능가하고, PubMed 및 arXiv 데이터셋에서 지도 학습 모델과 유사한 성능을 기록한다.

ABSTRACT

We propose a novel graph-based ranking model for unsupervised extractive summarization of long documents. Graph-based ranking models typically represent documents as undirected fully-connected graphs, where a node is a sentence, an edge is weighted based on sentence-pair similarity, and sentence importance is measured via node centrality. Our method leverages positional and hierarchical information grounded in discourse structure to augment a document's graph representation with hierarchy and directionality. Experimental results on PubMed and arXiv datasets show that our approach outperforms strong unsupervised baselines by wide margins and performs comparably to some of the state-of-the-art supervised models that are trained on hundreds of thousands of examples. In addition, we find that our method provides comparable improvements with various distributional sentence representations; including BERT and RoBERTa models fine-tuned on sentence similarity.

연구 동기 및 목표

  • 장문의 비지도 추출 요약 성능을 향상시키기 위해 논의 수준의 계층적 및 위치 정보를 통합한다.
  • 표준적인 완전 연결, 무방향 그래프를 초월하여 방향성과 구조적 계층성을 도입함으로써 그래프 기반 순위 산정 모델을 향상시킨다.
  • 대규모 애너테이션된 학습 데이터가 필요 없이 지도 학습 모델과 유사한 성능을 달성한다.
  • BERT 및 RoBERTa와 같은 다양한 문장 표현 모델에 대해 강건성을 확보한다.

제안 방법

  • 모델은 문장 간 유사도를 엣지로 사용하며, 논의 구조에서 유도된 방향성을 가진 유도 그래프를 구성한다.
  • 계층적 관계는 섹션과 단락과 같은 논의 수준으로 문장을 조직하여 그래프 구축을 안내한다.
  • 문장의 위치에 따라 초기 중심성 점수를 높게 부여함으로써 위치 편향을 통합한다 (예: 섹션의 시작과 끝에 위치한 문장).
  • 유도 및 계층적 그래프 구조를 고려한 수정된 PageRank 알고리즘을 사용하여 노드 중요도를 계산한다.
  • 사전 학습된 모델인 BERT 및 RoBERTa의 문장 임베딩을 사용하여 문장 유사도에 대해 피지테이닝된 엔드 투 엔드 학습을 수행한다.
  • 최종 요약은 중심성 점수 기반으로 상위 랭킹을 받은 문장을 선택하여 생성한다.

실험 결과

연구 질문

  • RQ1논의 계층성과 문장 위치를 통합함으로써 비지도 장문 요약 성능 향상이 가능할까?
  • RQ2장문 과학 문서에서 HipoRank는 강력한 비지도 기준 모델보다 어떻게 비교되는가?
  • RQ3대규모 애너테이션된 데이터가 없이 HipoRank가 지도 학습 모델의 성능을 어느 정도 따라갈 수 있을까?
  • RQ4BERT 및 RoBERTa와 같은 다양한 문장 표현 모델에 대해 이 방법은 일반화 가능한가?

주요 결과

  • HipoRank는 PubMed 및 arXiv 데이터셋에서 ROUGE-1, ROUGE-2, ROUGE-L 지표에서 강력한 비지도 기준 모델을 뛰어넘는 성능을 기록한다.
  • 수천만 개의 애너테이션된 예제로 훈련된 최신 기술 수준의 지도 학습 모델과 유사한 성능을 달성한다.
  • 문장 유사도에 대해 피지테이닝된 BERT 및 RoBERTa를 포함한 다양한 문장 표현 모델에 대해 일관된 향상 효과를 유지한다.
  • 계층적 및 위치 정보 통합은 특히 장문이고 구조화된 문서에서 더 일관되고 맥락에 부합하는 요약을 이끌어낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.