[논문 리뷰] Combining Word Embeddings and N-grams for Unsupervised Document Summarization
이 논문은 사전 학습된 단어 임베딩(Word2Vec, BERT)과 n-그램 특징의 융합을 통해 문장 유사도를 향상시켜 그래프 기반의 서브모듈러(summarization)를 개선하는 비지도 추출적 문서 요약 방법을 제안한다. 또한 DUC04에서 최고 성능을 기록하는 트랜스포머 기반 문장 압축 모델을 도입하여 지도 학습이 필요 없이도 상태의 최고 성능을 달성하고, CNN/DM 및 NYT 데이터셋에서 지도 학습 모델과 비교할 만한 성능을 확보한다.
Graph-based extractive document summarization relies on the quality of the sentence similarity graph. Bag-of-words or tf-idf based sentence similarity uses exact word matching, but fails to measure the semantic similarity between individual words or to consider the semantic structure of sentences. In order to improve the similarity measure between sentences, we employ off-the-shelf deep embedding features and tf-idf features, and introduce a new text similarity metric. An improved sentence similarity graph is built and used in a submodular objective function for extractive summarization, which consists of a weighted coverage term and a diversity term. A Transformer based compression model is developed for sentence compression to aid in document summarization. Our summarization approach is extractive and unsupervised. Experiments demonstrate that our approach can outperform the tf-idf based approach and achieve state-of-the-art performance on the DUC04 dataset, and comparable performance to the fully supervised learning methods on the CNN/DM and NYT datasets.
연구 동기 및 목표
- 기존의 tf-idf 대신 심층적 의미 특징을 사용하여 그래프 기반 추출적 요약에서 문장 유사도 측정을 향상시키기 위해.
- 사전 학습된 단어 임베딩(Word2Vec, BERT)과 n-그램 특징을 융합하여 비지도 요약에서 더 나은 의미 표현을 달성할 수 있는지 조사하기 위해.
- 트랜스포머 모델을 사용한 문장 압축이 추출적 요약 성능에 미치는 영향을 평가하기 위해.
- 레이블이 부여된 요약 쌍이 필요 없이도 벤치마크 데이터셋에서 최고 성능 또는 경쟁 가능한 성능을 달성하기 위해.
제안 방법
- tf-idf와 사전 학습된 단어 임베딩(Word2Vec, BERT)을 융합한 새로운 측정법을 사용하여 문장 유사도 그래프를 구축하여 의미 유사도 추정을 향상시킨다.
- 가중치 부여된 커버리지와 다양성 항목을 포함한 서브모듈러 목적 함수를 적용하여 예산 제약 하에 대표적이고 다양한 문장을 선택한다.
- 지역 이웃 통계를 기반으로 문장 비용을 정규화하여 서브모듈러 목적 함수를 근사적으로 최대화하는 근사 알고리즘을 적용한다.
- Gigaword 및 Google 문장 압축 데이터셋을 사용해 트랜스포머 기반 모델을 학습하여 요약 전에 입력 문장을 압축한다.
- 문장 유사도 계산에서 단어 임베딩과 n-그램 특징을 후기 융합 전략(early fusion)으로 융합한다.
- DUC04, CNN/DM, NYT50 데이터셋에서 ROUGE 점수(R-1, R-2, R-L)를 평가 지표로 사용하며, 요약 문장 수 제약을 3개 문장으로 설정한다.
실험 결과
연구 질문
- RQ1사용 가능한 단어 임베딩과 n-그램 특징을 융합하면 비지도 요약에서 문장 유사도 측정을 향상시킬 수 있는가?
- RQ2심층적 의미 특징(Word2Vec, BERT)과 희박한 tf-idf 특징을 융합하면 단독으로 사용할 경우보다 더 나은 요약 성능을 달성할 수 있는가?
- RQ3트랜스포머 기반 문장 압축 모델을 적용할 경우 추출적 요약 성능에 어느 정도 향상이 이루어지는가?
- RQ4비지도 요약 시스템이 CNN/DM 및 NYT 데이터셋에서 지도 학습 기반 최고 성능 모델과 비교해 유사한 성능을 달성할 수 있는가?
주요 결과
- Word2Vec과 tf-idf 특징을 융합한 제안된 GraphFusion 방법은 CNN/DM 데이터셋에서 R-1 39.0, R-2 16.8, R-L 32.0의 F-점수를 기록하여 tf-idf 및 기타 임베딩 전용 기준 모델을 모두 초월한다.
- DUC04 데이터셋에서, Gigaword 외에 Google 문장 압축 데이터셋까지 활용함으로써 현재 기준 모델 대비 모든 세 ROUGE 지표(R-1, R-2, R-L)에서 1점의 절대적 향상을 달성한다.
- Word2Vec과 n-그램 특징을 융합한 LateFusion 접근 방식은 CNN/DM에서 최고 성능을 기록하여 R-1 39.2, R-2 17.1, R-L 32.2의 F-점수를 기록한다.
- 트랜스포머 기반 문장 압축 모델은 DUC04에서 요약 성능을 향상시키며, 기준 압축 모델 대비 ROUGE-1, ROUGE-2, ROUGE-L에서 거의 2점의 절대적 향상을 기록한다.
- 학습 데이터를 사용하지 않고도 비지도로 동작하는 점을 감안할 때, Pointer 및 Refresh와 같은 지도 학습 모델과 비교해도 CNN/DM 및 NYT 데이터셋에서 유사한 성능을 달성한다.
- CNN/DM에서는 문장 압축이 성능 향상에 기여하지 않았는데, 이는 고정된 3문장 요약 제약 조건에서 정보 손실가능성이 높기 때문일 것으로 보인다. 반면 DUC04에서는 성능 향상이 뚜렷하게 관찰된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.