Skip to main content
QUICK REVIEW

[논문 리뷰] Noisy Self-Knowledge Distillation for Text Summarization

Yang Liu, Sheng Shen|arXiv (Cornell University)|2020. 09. 15.
Topic Modeling참고 문헌 60인용 수 11
한 줄 요약

이 논문은 추상적 텍스트 요약을 위해 노이즈가 섞인 자기 지식 정착(Noisy Self-Knowledge Distillation, Noisy SKD)을 제안한다. 여기서 학생 모델은 교사 모델의 부드러운 출력 분포를 모방하도록 훈련되며, 훈련 중에 교사 및 학생 양쪽에 노이즈를 주입하여 강건성을 향상시킨다. 이 방법은 노이즈가 많거나 단일 참조 데이터셋에서 일반화 능력을 향상시키고 환각 현상을 감소시켜 CNN/DailyMail, XSum, WikiCatSum에서 최고 성능을 기록한다.

ABSTRACT

In this paper we apply self-knowledge distillation to text summarization which we argue can alleviate problems with maximum-likelihood training on single reference and noisy datasets. Instead of relying on one-hot annotation labels, our student summarization model is trained with guidance from a teacher which generates smoothed labels to help regularize training. Furthermore, to better model uncertainty during training, we introduce multiple noise signals for both teacher and student models. We demonstrate experimentally on three benchmarks that our framework boosts the performance of both pretrained and non-pretrained summarizers achieving state-of-the-art results.

연구 동기 및 목표

  • 추상적 요약에서 최대우도 훈련의 한계, 특히 노이즈가 많거나 단일 참조 데이터셋에서의 한계를 해결하기 위해.
  • 부드러운 레이블 분포를 활용한 지식 정착을 통해 환각 현상을 줄이고 일반화 능력을 향상시키기 위해.
  • 훈련 중에 교사 및 학생 모델 양쪽에 다수의 노이즈 신호를 도입하여 강건성을 향상시키기 위해.
  • 단일 및 다중 문서 설정을 포함한 다양한 요약 벤치마크에서 성능을 향상시키기 위해.
  • 사전 훈련된 및 사전 훈련되지 않은 요약 모델 아키텍처 모두에서 최고 성능을 달성하기 위해.

제안 방법

  • 학생 모델은 지식 정착을 통해 훈련되며, 교사 모델이 목표 토큰에 대한 부드러운 확률 분포를 생성하여 학생을 안내한다.
  • 훈련 신호에 노이즈를 주입하기 위해, 정방향 전파 중에 교사 및 학생 모델 양쪽에 드롭아웃과 단어 마스킹을 적용한다.
  • 다양한 노이즈 신호를 훈련 중에 적용하여 불확실성을 시뮬레이션하고 모델의 일반화 능력을 향상시킨다.
  • 프레임워크는 훈련 중에 단일 참조를 사용하지만, 교사의 출력 분포를 활용하여 요약에서 인간의 다양성을 반영한다.
  • 이 방법은 사전 훈련되지 않은 모델과 사전 훈련된 모델(예: UniLMv2) 모두에 적용되며, 미세조정 중에 정착이 적용된다.
  • 교사 모델은 동일한 데이터에서 사전 훈련된 후, 학생의 소프트 레이블로 사용되는 출력 분포를 제공한다.

실험 결과

연구 질문

  • RQ1부드러운 레이블 분포를 사용한 자기 지식 정착이 노이즈가 많거나 단일 참조 데이터셋에서 요약 성능을 향상시킬 수 있는가?
  • RQ2교사 및 학생 모델 양쪽에 노이즈를 주입함으로써 추상적 요약에서 모델의 일반화 능력과 강건성이 어떻게 영향을 받는가?
  • RQ3교사 모델을 사용한 지식 정착이 생성된 요약의 사실 일관성과 환각 현상을 줄이는 데 기여하는가?
  • RQ4제안된 프레임워크는 CNN/DailyMail, XSum, WikiCatSum를 포함한 다양한 요약 벤치마크에서 최고 성능을 달성할 수 있는가?
  • RQ5더 작음에도 불구하고, 정착된 학생 모델이 정보량과 간결성 측면에서 교사 모델을 능가하는가?

주요 결과

  • Noisy SKD 프레임워크는 CNN/DailyMail, XSum, WikiCatSum에서 최고 성능을 기록한 ROUGE 점수를 달성했으며, 교사 모델( UniLMv2 BASE)과 기존 정착 방법을 모두 초월했다.
  • CNN/DailyMail 및 XSum에서 인간 평가자들은 정착된 학생 모델이 교사 모델보다 유의미하게 더 간결하고 정보량이 많다고 평가했다(p < 0.05), 다만 약간 덜 유창한 편이었다.
  • WikiCatSum 데이터셋에서 학생 모델은 동물 및 영화 분야에서 교사 모델을 능가했지만, 기업 분야에선 엔티티 과다 생성 문제로 어려움을 겪었다.
  • 이 방법은 사전 훈련되지 않은 모델과 사전 훈련된 모델 모두에서 성능 향상을 이끌어내어 광범위한 적용 가능성을 입증했다.
  • 다양한 노이즈 신호의 도입이 모델의 일반화 능력을 향상시켜 과적합을 줄이고 노이즈가 많은 훈련 데이터에 대한 강건성을 향상시켰다.
  • 학생 모델은 크기가 작음에도 불구하고 ROUGE 점수와 인간 평가에서 정보량과 간결성 측면에서 교사 모델을 능가하는 성능을 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.