Skip to main content
QUICK REVIEW

[논문 리뷰] SimCLS: A Simple Framework for Contrastive Learning of Abstractive Summarization

Yixin Liu, Pengfei Liu|arXiv (Cornell University)|2021. 06. 03.
Topic Modeling참고 문헌 38인용 수 11
한 줄 요약

SimCLS는 추상적 요약에서 품질 평가와 텍스트 생성을 분리하기 위해 대조 학습을 사용하는 이단계 프레임워크를 제안한다. 이는 ROUGE 점수를 크게 향상시키며, BART와 PEGASUS에 비해 CNN/DailyMail에서 각각 ROUGE-1 점수를 2.51, 2.50 향상시킨다. 학습 목표와 평가 지표 간 격차를 줄인다.

ABSTRACT

In this paper, we present a conceptually simple while empirically powerful framework for abstractive summarization, SimCLS, which can bridge the gap between the learning objective and evaluation metrics resulting from the currently dominated sequence-to-sequence learning framework by formulating text generation as a reference-free evaluation problem (i.e., quality estimation) assisted by contrastive learning. Experimental results show that, with minor modification over existing top-scoring systems, SimCLS can improve the performance of existing top-performing models by a large margin. Particularly, 2.51 absolute improvement against BART and 2.50 over PEGASUS w.r.t ROUGE-1 on the CNN/DailyMail dataset, driving the state-of-the-art performance to a new level. We have open-sourced our codes and results: https://github.com/yixinL7/SimCLS. Results of our proposed models have been deployed into ExplainaBoard platform, which allows researchers to understand our systems in a more fine-grained way.

연구 동기 및 목표

  • 추상적 요약에서 학습 목표(예: MLE)와 평가 지표(예: ROUGE) 간 격차를 해결하기 위해.
  • 자기회귀적 생성에서 노출 편향과 오류 누적 문제를 완화하기 위해 생성과 품질 평가를 분리하기 위해.
  • 불안정한 강화 학습을 피하고 대조 학습을 통해 요약의 종합적 품질을 직접 최적화하기 위해.
  • 적절히 평가될 경우, 후보 요약이 원본 모델 출력보다 훨씬 나을 수 있음을 보여주기 위해.
  • 최대우도추정을 초월해 지표 중심의 훈련 방향을 열기 위해.

제안 방법

  • 이단계 프레임워크: 첫 번째 단계에서 사전 훈련된 Seq2Seq 모델(예: BART 또는 PEGASUS)이 빔 서치를 사용해 다수의 후보 요약을 생성한다.
  • 두 번째 단계에서, 참조 없는 평가 모델(예: RoBERTa)이 대조 학습을 통해 후보 요약을 평가하도록 훈련된다.
  • 대조 학습은 긍정 쌍(후보 요약과 기준 요약)과 부정 쌍(후보 요약과 비기준 요약)을 사용하여 평가 모델을 최적화한다.
  • 평가 모델은 후보 요약과 기준 요약 간 유사도를 최대화하고, 비기준 후보 요약과의 유사도를 최소화하도록 훈련된다.
  • 다양한 빔 서치를 통해 후보 요약을 생성함으로써 다양성을 증가시키고, 훈련 신호의 품질을 향상시킨다.
  • 최종 요약은 원본 모델의 출력이 아닌, 훈련된 평가 모델이 예측한 최고 점수를 기반으로 선택된다.

실험 결과

연구 질문

  • RQ1생성과 평가를 분리하는 이단계 프레임워크가 추상적 요약 성능을 향상시킬 수 있는가?
  • RQ2대조 학습이 학습 목표와 ROUGE 기반 평가 지표 간 격차를 어느 정도 메울 수 있는가?
  • RQ3대조 학습을 통한 参조 없는 품질 평가가 장문 문서에서 위치 편향을 줄이는가?
  • RQ4학습된 평가 모델로 평가할 경우, Seq2Seq 모델의 후보 요약이 원본 모델 출력보다 훨씬 나을 수 있는가?
  • RQ5XSum처럼 더 짧고 더 추상적인 요약을 가진 다른 데이터셋에 이 방법이 어떻게 일반화되는가?

주요 결과

  • SimCLS는 CNN/DailyMail 데이터셋에서 BART에 비해 ROUGE-1 점수를 2.51 점 향상시키고, PEGASUS에 비해 2.50 점 향상시켜 새로운 최고 성능을 기록했다.
  • XSum 데이터셋에서는 ROUGE-L 점수를 0.19점(39.23에서 39.44로) 향상시키고, ROUGE-1 점수를 0.50점(47.10에서 47.61로) 향상시켰으며, 통계적으로 유의미하다(p < 0.05).
  • 위치 편향이 감소했다: 기준 모델이 장문 문서에서 머리 문장에 더 기울어지는 데 비해, SimCLS는 기준 요약의 문장 위치와 더 밀접하게 일치한다.
  • 다양한 빔 서치로 생성된 후보 요약이 대조 모델에 의해 평가된 결과, 원본 모델 출력보다 일관되게 뛰어난 성능을 보였다. 이는 원본 모델가 자신의 생성 잠재력을 제대로 발휘하지 못하고 있음을 시사한다.
  • 프레임워크는 참조가 없는 상황에서 골드 기준 요약에 접근하지 않아도, 별도로 대조적으로 훈련된 평가 모델이 더 나은 요약을 효과적으로 식별할 수 있음을 보여준다.
  • 다양한 기본 모델에 대해 안정적인 성능 향상을 보였으며, CNN/DailyMail와 XSum 양쪽 데이터셋에서 BART와 PEGASUS에 적용했을 때 일관되게 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.