Skip to main content
QUICK REVIEW

[논문 리뷰] COLO: A Contrastive Learning based Re-ranking Framework for One-Stage Summarization

Chenxin An, Ming Zhong|arXiv (Cornell University)|2022. 09. 29.
Topic Modeling인용 수 10
한 줄 요약

CoLo는 일괄 처리 텍스트 요약을 위한 대trastive 학습 기반 재순서 정렬 프레임워크를 제안하며, 추가 모듈 없이 요약 수준 점수를 직접 최적화함으로써 CNN/DailyMail에서 추출형 요약의 경우 ROUGE-1 점수 44.58, 생성형 요약의 경우 46.33을 달성하여 최신 기준 성능을 확보하였다. 이는 파rameter 및 추론 효율성을 유지하면서도 3배에서 8배 빠른 추론 속도를 제공하고 학습에 100시간 이상의 GPU 시간을 절약한다.

ABSTRACT

Traditional training paradigms for extractive and abstractive summarization systems always only use token-level or sentence-level training objectives. However, the output summary is always evaluated from summary-level which leads to the inconsistency in training and evaluation. In this paper, we propose a Contrastive Learning based re-ranking framework for one-stage summarization called COLO. By modeling a contrastive objective, we show that the summarization model is able to directly generate summaries according to the summary-level score without additional modules and parameters. Extensive experiments demonstrate that COLO boosts the extractive and abstractive results of one-stage systems on CNN/DailyMail benchmark to 44.58 and 46.33 ROUGE-1 score while preserving the parameter efficiency and inference efficiency. Compared with state-of-the-art multi-stage systems, we save more than 100 GPU training hours and obtaining 3~8 speed-up ratio during inference while maintaining comparable results.

연구 동기 및 목표

  • 추출형 및 생성형 요약에서 문장/토큰 수준의 학습 목표와 요약 수준 평가 간 격차를 해소하기 위해.
  • 두 단계 요약 시스템에서 별도의 재순서 정렬 모듈이 필요 없도록 하되 성능은 유지하거나 향상시키기 위해.
  • 온라인 샘플링을 사용한 대비 학습을 통해 요약 수준 점수를 직접 최적화하는 일괄 처리 프레임워크를 개발하기 위해.
  • 모델 품질을 훼손하지 않으면서도 높은 추론 효율성을 확보하여 실시간 배포를 가능하게 하기 위해.
  • 요약 수준 최적화를 위한 대비 학습이 기존의 토큰/문장 수준 학습 목표보다 우월한 성능을 낼 수 있음을 입증하기 위해.

제안 방법

  • 학습 중 모델 자체의 출력 분포에서 동적으로 양성 및 음성 후보 요약을 생성하는 온라인 샘플링 전략을 도입하여 고정된 오프라인 샘플링을 대체한다.
  • 고품질 후보 요약(양성 쌍)은 임베딩 공간에서 가까이 모이게 하고, 저품질 요약(음성 쌍)은 멀어지게 하는 대비 학습 목표를 적용한다.
  • 요약 수준의 판별기(예: BERTScore, MoverScore, ROUGE)를 손실 함수로 사용하여 모델이 직접 고점수 요약을 생성할 수 있도록 능력을 최적화한다.
  • 추가 파rameter나 모듈 없이도 추출형 및 생성형 모델 모두에 대비 목표를 적용하여 엔드 투 엔드 학습을 가능하게 한다.
  • t-SNE 시각화를 통해 고점수 후보들이 입력(기사) 임베딩 주변에 밀집해 있음을 확인하여 대비 학습 목표의 효과를 검증한다.
  • 표준 문장 수준 손실(예: BCE, NLL)과 대비 손실을 조합하여 어법성과 요약 수준의 품질을 동시에 최적화한다.

실험 결과

연구 질문

  • RQ1추가 모듈 없이도 두 단계 재순서 정렬 시스템과 유사한 성능을 내는 일괄 처리 요약 모델이 가능할 수 있는가?
  • RQ2오프라인 후보 생성에 의존하지 않고도 온라인 샘플링을 통한 대비 학습이 요약 수준 평가 지표를 효과적으로 최적화할 수 있는가?
  • RQ3표준 토큰/문장 수준 학습 대비 요약 수준 점수를 직접 최적화함으로써 ROUGE 및 인간 평가 지표가 향상되는가?
  • RQ4CoLo는 요약 품질 향상과 함께 추론 효율성을 어느 정도 유지하는가?
  • RQ5다양한 신경 평가 지표(예: BERTScore, MoverScore)는 대비 재순서 정렬 프레임워크의 성능과 학습 비용에 어떤 영향을 미치는가?

주요 결과

  • CoLo는 CNN/DailyMail 추출형 벤치마크에서 ROUGE-1 점수 44.58을 기록하여 이전의 일괄 처리 모델을 초월하고 두 단계 시스템과도 맞먹거나 뛰어넘는 성능을 보였다.
  • 생성형 요약에서는 ROUGE-1 점수 46.33을 달성하여 도전적인 벤치마크에서 뛰어난 성능을 입증하였다.
  • 단일 GPU에서 높은 추론 속도(~42.0 samples/second)를 유지하여 두 단계 시스템(~7.0 samples/second) 대비 3배에서 8배 빠른 속도를 확보하였다.
  • 판별기로 BERTScore를 사용할 경우 인간 평가 결과가 가장 우수했으며, 평균 순위 2.90을 기록하여 모든 다른 자동 시스템을 앞섰다.
  • t-SNE 시각화 결과 고점수 후보들이 입력 임베딩 주변에 밀집해 있음을 확인하여 대비 학습 목표의 효과를 검증하였다.
  • BERTScore 및 MoverScore와 같은 신경 평가 지표 기반 판별기를 사용할 경우 어휘 기반 지표보다 성능 향상이 더 크지만, 학습 시간이 증가하는 비용이 수반된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.