[논문 리뷰] Abstractive Summarization with Combination of Pre-trained Sequence-to-Sequence and Saliency Models
본 논문은 토큰/문장 수준의 주목도(saliency) 모델과 프리트레인된 시퀀스-투-시퀀스(seq-to-seq) 모델의 아홉 가지 조합을 조사하고, 중요한 토큰을 입력으로 피드하는 새로운 CIT 모델을 도입하며 CNN/DM과 XSum 데이터셋에서 개선을 보이고, 특히 CNN/DM에서 파인튜닝된 베이스라인을 능가한다.
Pre-trained sequence-to-sequence (seq-to-seq) models have significantly improved the accuracy of several language generation tasks, including abstractive summarization. Although the fluency of abstractive summarization has been greatly improved by fine-tuning these models, it is not clear whether they can also identify the important parts of the source text to be included in the summary. In this study, we investigated the effectiveness of combining saliency models that identify the important parts of the source text with the pre-trained seq-to-seq models through extensive experiments. We also proposed a new combination model consisting of a saliency model that extracts a token sequence from a source text and a seq-to-seq model that takes the sequence as an additional input text. Experimental results showed that most of the combination models outperformed a simple fine-tuned seq-to-seq model on both the CNN/DM and XSum datasets even if the seq-to-seq model is pre-trained on large-scale corpora. Moreover, for the CNN/DM dataset, the proposed combination model exceeded the previous best-performed model by 1.33 points on ROUGE-L.
연구 동기 및 목표
- 주목도 모델이 추상적 요약을 위한 프리트레인된 seq-to-seq 모델을 보완할 수 있는지 평가한다.
- 표준 데이터셋에서 주목도 모델과 사전학습된 모델의 아홉 가지 조합을 평가한다.
- 요약 모델의 입력으로 중요한 토큰을 명시적으로 포함하는 새로운 CIT 모델을 제안한다.
제안 방법
- 대규모 비라벨 데이터로 사전 학습된 Transformer 기반 인코더-디코더(BART LARGE 등)를 seq-to-seq 백본으로 사용한다.
- 두 가지 주목도 모델 유형을 개발한다: seq-to-seq 모델과 공동으로 학습하는 공유 인코더와 중요한 토큰/문장을 선택하는 추출기.
- 소스 요약과 참조 요약 사이의 정렬에서 도출된 의사 참조(label)로 주목도 모델을 학습시키고, 주목도에 대해 이진 교차 엔트로피 손실을 사용한다.
- 다양한 조합 아키텍처를 정의한다: 다중 작업(MT), 선택적 인코딩(SE), 선택적 주의(SA), 그리고 추출기와의 조합인 SEG, CIT, CIT+SE, CIT+SA.
- CIT를 제안한다: 소스 텍스트와 함께 상위 K개의 주목도 토큰 C를 추가 입력으로 seq-to-seq 모델에 피드한다.
실험 결과
연구 질문
- RQ1주목도 모델이 추출적 데이터셋 vs 추상적 데이터셷에서 프리트레인된 seq-to-seq 모델과 함께 사용할 때 추상적 요약을 향상시키는가?
- RQ2어떤 주목도 전략 조합(공유 인코더 대 추출기)이 CNN/DM와 XSum에서 최상의 ROUGE 점수를 얻는가?
- RQ3제안된 CIT 모델이 추가 사전 학습 데이터 없이 다른 파인튜닝 및 조합 모델보다 성능이 우수한가?
- RQ4의사 주목도 레이블의 품질이 CNN/DM 대 XSum에서 성능에 어떤 영향을 미치는가?
주요 결과
- 모든 조합 모델이 CNN/DM에서 간단한 파인튜닝된 BART를 능가했으며, CIT와 CIT+SE가 가장 높은 ROUGE 점수를 달성했다.
- CNN/DM에서 CIT가 R1=45.74, R2=22.50, RL=42.44를 달성하며 파인튜닝된 베이스라인을 능가했다.
- CNN/DM에서 CIT+SE가 R1=45.80, R2=22.53, RL=42.48를 달성했고 CNN/DM에서 보고된 방법 중 최상이다.
- XSum에서 CIT는 조합 중에서 다수의 최상 성능을 보여 Top-K 토큰 추출 구성의 R1=46.72, R2=20.53, RL=37.73으로 나타났으며, 전반적인 개선은 CNN/DM보다 작았다.
- 추가 사전 학습 데이터 없이도 CIT가 다른 조합 모델보다 성능을 앞섰으며, 주목도 기반 입력이 필요 데이터를 보완해 추출적 데이터셋에서 특히 효과적일 수 있음을 시사한다.
- 최신 프리트레인 모델과 비교했을 때, CNN/DM에서 CIT가 다수의 모델을 능가했지만 XSum에서 PEGASUS HugeNews가 최고 점수를 달성하여 데이터셋 의존적 이점을 강조한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.