[논문 리뷰] RetrievalSum: A Retrieval Enhanced Framework for Abstractive Summarization
RetrievalSum는 훈련 코퍼스에서 의미적으로 유사한 예시를 검색함으로써 개괄적 요약 모델을 향상시키는 검색 증강 프레임워크를 제안한다. 밀도 높은 검색기와 두 가지 새로운 메커니즘인 그룹 정렬 및 ROUGE 신용을 통해 통합함으로써, BART나 BERT와 같은 강력한 베이스라인 대비 사실 일관성, 작문 스타일, ROUGE 점수를 최대 4.66점 향상시킨다.
Existing summarization systems mostly generate summaries purely relying on the content of the source document. However, even for humans, we usually need some references or exemplars to help us fully understand the source document and write summaries in a particular format. But how to find the high-quality exemplars and incorporate them into summarization systems is still challenging and worth exploring. In this paper, we propose RetrievalSum, a novel retrieval enhanced abstractive summarization framework consisting of a dense Retriever and a Summarizer. At first, several closely related exemplars are retrieved as supplementary input to help the generation model understand the text more comprehensively. Furthermore, retrieved exemplars can also play a role in guiding the model to capture the writing style of a specific corpus. We validate our method on a wide range of summarization datasets across multiple domains and two backbone models: BERT and BART. Results show that our framework obtains significant improvement by 1.38~4.66 in ROUGE-1 score when compared with the powerful pre-trained models, and achieve new state-of-the-art on BillSum. Human evaluation demonstrates that our retrieval enhanced model can better capture the domain-specific writing style.
연구 동기 및 목표
- 외부 예시를 통합함으로써 개괄적 요약에서의 내용 이탈과 일관되지 않은 작문 스타일 문제를 해결하기 위해.
- 훈련 코퍼스에서 의미적으로 유사한 요약을 고품질로 검색함으로써 소스 문서에 대한 모델 이해도를 향상시키기 위해.
- 예시를 스타일 템플릿으로 활용하여 요약 모델이 도메인 특화된 작문 스타일을 학습할 수 있도록 하기 위해.
- 기존의 사전 훈련된 모델에 아키텍처 수정 없이 통합할 수 있는 플러그 앤 플레이 프레임워크를 개발하기 위해.
- 전통적인 희박한 방법(예: TF-IDF, BM25)에 비해 밀도 높은 검색이 요약 작업에서 더 효과적인지 검증하기 위해.
제안 방법
- 질의-문서 임베딩 유사도를 기반으로 훈련 세트에서 의미적으로 관련성이 높은 예시를 검색하기 위해 밀도 높은 파assage 검색기(DPR 스타일)를 사용한다.
- 검색된 예시를 요약 생성기의 인코더 입력에 통합하여 생성에 대한 추가적인 맥락으로 간주한다.
- 훈련 중 그룹 정렬을 적용하여 예시의 각 문장을 생성된 요약의 해당 스파닝과 정렬함으로써 구조적 및 의미적 일치를 유지한다.
- 빔 서치 중 ROUGE 신용을 사용하여 검색된 예시의 작문 스타일과 밀접하게 일치하는 빔을 보상함으로써 높은 스타일 일관성 유지에 유도한다.
- 모델에 종속되지 않는 프레임워크를 설계하여 BERT, BART 등 어떤 사전 훈련된 인코더-디코더 모델에도 아키텍처 내부 수정 없이 통합 가능하도록 한다.
- 생성 손실과 정렬 손실을 균형 잡는 다중 작업 목표를 사용하여 검색기와 요약기를 함께 훈련한다.
실험 결과
연구 질문
- RQ1훈련 코퍼스에서 고품질의 의미적으로 유사한 예시를 검색하면 개괄적 요약 성능이 향상되는가?
- RQ2요약 작업에서 밀도 높은 검색(의미 매칭)이 기존의 희박한 검색(예: TF-IDF, BM25)보다 우수한가?
- RQ3검색된 예시가 요약의 작문 스타일 일관성 향상과 내용 이탈 감소에 어느 정도 기여하는가?
- RQ4제안된 메커니즘인 그룹 정렬 및 ROUGE 신용이 아키텍처 수정 없이도 효과적으로 모델이 예시에서 학습하도록 이끌 수 있는가?
- RQ5다양한 데이터셋과 백본 모델에서 검색 증강 모델의 성능이 GSum 및 BART와 같은 최신 기술 모델과 비교해 어떻게 되는가?
주요 결과
- RetrievalSum은 일곱 개의 다양한 요약 데이터셋에서 BART나 BERT와 같은 강력한 베이스라인 대비 ROUGE-1 점수를 1.38에서 4.66점까지 향상시켰다.
- 밀도 높은 검색기가 TF-IDF와 Elastic Search보다 우수하여, BART와 함께 사용했을 때 XSum에서 ROUGE-1 점수 23.04를 기록했고, Elastic Search는 20.81을 기록했다.
- CNNDM 데이터셋에서 밀도 높은 검색기를 사용한 Retrieval(BART)는 ROUGE-1 42.91을 기록했으며, GSum(BERT)보다 ROUGE-1 0.76점, ROUGE-L 0.87점 높게 기록했다.
- BillSum에서의 인간 평가 결과, 검색 증강 모델은 작문 스타일 점수 4.72를 기록했으며, 인간이 작성한 요약보다 오직 0.20점 아래에 머물러 강력한 스타일 일관성을 보였다.
- BART 대비 정보성(4.15 vs. 3.98)과 유창성(4.63 vs. 4.52)이 유의미하게 향상되었고, 신뢰성은 하락하지 않아 요약 품질 향상을 시사했다.
- 예시를 '프롬프트'로 사용함으로써 모델이 도메인 특화 표현(예: '내부 수익 코드를 개정한다...')으로 시작하는 데 익숙해져 내용 이탈을 줄이고 더 정보적인 요약을 생성하는 데 기여했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.