Skip to main content
QUICK REVIEW

[논문 리뷰] Language Model as an Annotator: Exploring DialoGPT for Dialogue Summarization

Xiachong Feng, Xiaocheng Feng|arXiv (Cornell University)|2021. 05. 26.
Topic Modeling참고 문헌 40인용 수 10
한 줄 요약

이 논문은 대화 요약 향상을 위해 DialoGPT를 비지도 주석자로 활용하여 키워드를 자동으로 추출하고, 중복 발화를 탐지하며, 주제 분할을 수행하는 방법을 제안한다. 사전 훈련된(BART) 및 비사전 훈련된(PGN) 요약 모델에 이러한 주석을 통합함으로써, SAMSum 데이터셋에서 최신 기준 성능을 달성하며, 강력한 베이스라인 대비 ROUGE 점수 향상이 뚜렷하다.

ABSTRACT

Current dialogue summarization systems usually encode the text with a number of general semantic features (e.g., keywords and topics) to gain more powerful dialogue modeling capabilities. However, these features are obtained via open-domain toolkits that are dialog-agnostic or heavily relied on human annotations. In this paper, we show how DialoGPT, a pre-trained model for conversational response generation, can be developed as an unsupervised dialogue annotator, which takes advantage of dialogue background knowledge encoded in DialoGPT. We apply DialoGPT to label three types of features on two dialogue summarization datasets, SAMSum and AMI, and employ pre-trained and non pre-trained models as our summarizes. Experimental results show that our proposed method can obtain remarkable improvements on both datasets and achieves new state-of-the-art performance on the SAMSum dataset.

연구 동기 및 목표

  • 대화 요약에서 수동 또는 개방형 도구 기반 주석의 한계를 해결하기 위해, 노동 집약적이거나 대화에 무관한 주석 방식을 개선하고자 한다.
  • DialoGPT의 사전 훈련된 대화 전용 지식을 활용하여 키워드, 중복성 지표, 주제 세그먼트의 세 가지 유형의 보조 주석을 자동으로 생성하고자 한다.
  • 사전 훈련된 및 비사전 훈련된 요약 모델에 이러한 비지도 주석을 통합하여 대화 요약 성능을 향상시키고자 한다.
  • DialoGPT에서 유도된 비지도 주석만을 사용하여 SAMSum 데이터셋에서 최신 기준 성능을 달성하고자 한다.

제안 방법

  • DialoGPT 주석자 모델은 모델의 자동회귀 생성에서 단어 수준 및 발화 수준의 예측 손실을 계산하여 주석 신호로 활용한다.
  • 키워드는 맥락에서 예측 가능성(예측 가능성 저하)이 높은 단어(정보량 높음)로 추출된다.
  • 중복성 탐지는 맥락 표현에 대한 변화가 최소한일 때, 해당 발화를 삽입했을 때 맥락 표현 변화가 미미한 발화를 식별함으로써 수행된다.
  • 주제 분할은 예측하기 어려운 발화 앞에 주제 경계 토큰을 삽입하여 시행되며, 이는 논의 주제의 전환을 나타낸다.
  • 키워드, 중복성 마커, 주제 세그먼트로 구성된 주석은 요약 모델에 입력하기 전에 대화에 특수 토큰(#KEY#, [RD], [TS])으로 삽입된다.
  • 이 방법은 BART(사전 훈련된) 및 PGN(비사전 훈련된) 요약 모델을 사용하여 SAMSum 및 AMI 데이터셋에서 평가되며, 주요 평가 지표로 ROUGE 점수를 사용한다.

실험 결과

연구 질문

  • RQ1DialoGPT와 같은 사전 훈련된 대화 모델이 대화 요약을 위한 비지도 주석자로 효과적으로 재사용될 수 있는가?
  • RQ2자동으로 생성된 주석(키워드, 중복성, 주제)을 통합하면 다양한 요약 모델 아키텍처에서 요약 성능이 향상되는가?
  • RQ3제안된 방법의 성능는 표준 대화 요약 벤치마크에서 강력한 베이스라인 및 인간 주석 기반 특징과 비교해 볼 때 어떻게 되는가?
  • RQ4키워드, 중복성, 주제의 세 가지 유형의 주석이 개별적으로나 종합적으로 요약 품질에 기여하는 정도는 어느 정도인가?

주요 결과

  • 제안된 방법은 SAMSum 데이터셋에서 새로운 최신 기준 성능을 달성하였으며, 모든 세 가지 주석을 사용할 경우 ROUGE-L 점수가 49.64를 기록하였다.
  • SAMSum에서, 최고의 베이스라인(C99 + DialoGPT 임베딩) 대비 ROUGE-L 점수를 0.14점 향상시켜, 다양한 지표에서 일관된 성능 향상을 보였다.
  • AMI 데이터셋에서는 경쟁력 있는 성능을 기록하였으며, 모든 주석을 사용할 경우 ROUGE-L 점수가 24.05를 기록하여, C99 + DialoGPT 임베딩 베이스라인을 초월하였다.
  • 모든 세 가지 주석(키워드, 중복성, 주제)의 통합은 가장 높은 성능을 이끌어내었으며, 요약에 대해 상호 보완적인 이점이 있음을 시사한다.
  • 비사전 훈련된 모델(PGN)을 사용할 경우에도 뚜렷한 성능 향상이 이루어져, 주석 품질이 다양한 요약 모델 유형에 대해 강건함을 보였다.
  • 사례 연구 결과, BART 및 MV-BART 대비 더 간결하고 주제에 부합하는 요약을 생성하는 것으로 나타났지만, 일부 중복성은 여전히 존재하여, 훈련 데이터가 제한되어 있음을 고려할 필요가 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.