Skip to main content
QUICK REVIEW

[논문 리뷰] Automatic Text Summarization of COVID-19 Medical Research Articles using BERT and GPT-2

Virapat Kieuvongngam, Bowen Tan|arXiv (Cornell University)|2020. 06. 03.
Topic Modeling참고 문헌 8인용 수 82
한 줄 요약

이 논문은 COVID-19 논문의 추상적 요약을 위해 DistilGPT-2를 미세 조정하고 키워드 집합을 요약으로 매핑하며 다중 작업 로스와 ROUGE 평가를 사용합니다. 또한 CORD-19 데이터에서 추상적 요약을 추출적 베이스라인과 비교합니다.

ABSTRACT

With the COVID-19 pandemic, there is a growing urgency for medical community to keep up with the accelerating growth in the new coronavirus-related literature. As a result, the COVID-19 Open Research Dataset Challenge has released a corpus of scholarly articles and is calling for machine learning approaches to help bridging the gap between the researchers and the rapidly growing publications. Here, we take advantage of the recent advances in pre-trained NLP models, BERT and OpenAI GPT-2, to solve this challenge by performing text summarization on this dataset. We evaluate the results using ROUGE scores and visual inspection. Our model provides abstractive and comprehensive information based on keywords extracted from the original articles. Our work can help the the medical community, by providing succinct summaries of articles for which the abstract are not already available.

연구 동기 및 목표

  • COVID-19 문헌의 급속한 증가에 대응하고 초록이 없는 기사에 대해 간결한 요약을 제공한다.
  • 사전 학습된 NLP 모델(BERT는 추출에, GPT-2는 생성에)을 활용하여 추상적 요약을 생산한다.
  • 다중 작업 로스를 갖는 keyword-to-summary 미세 조정 접근법을 개발한다.
  • ROUGE와 정성적 검사를 사용하여 추상적 요약을 골드 초록과 비교 평가한다.

제안 방법

  • 비지도 추출 문장 임베딩 및 K-medoid 클러스터링을 추출적 요약의 기준선으로 사용한다.
  • DistilGPT-2를 명사와 동사에서 파생된 키워드 입력으로부터 추상적 요약을 생성하도록 미세 조정한다.
  • 언어 모델링 손실과 다지 선다 손실을 결합한 다중 작업 손실로 학습하되, 키워드와 요약을 구분하기 위한 특별한 <|summarize|> 토큰을 사용한다.
  • 4-option 다지선다 구성의 학습 샘플을 만들기 위해 키워드와 골드 요약, 그리고 오답 요약을 짝지어 생성한다.
  • 생성에 top-p 샘플링과 온도 스케일링을 통합하고 ROUGE 점수로 평가한다.

실험 결과

연구 질문

  • RQ1사전 학습된 GPT-2 모델의 keyword-to-summary 미세 조정이 COVID-19 문헌에 대해 일관된 추상적 요약을 생성할 수 있는가?
  • RQ2명사, 동사, 혹은 이 둘 다의 키워드 유형이 추상적 요약 품질에 어떤 영향을 미치는가?
  • RQ3DistilGPT-2가 생성한 추상적 요약은 ROUGE 점수에서 추출적 베이스라인과 어떻게 비교되는가?
  • RQ4더 긴 미세 조정이 입력 키워드와 생성 요약 간의 정렬을 개선하는가?

주요 결과

  • 60% 압축의 추출적 요약은 40% 압축보다 더 높은 ROUGE 점수를 얻고 ROUGE에서 추상적 결과를 능가한다.
  • 더 많은 에포크와 더 많은 키워드로 추상적 GPT-2 요약은 개선되지만 ROUGE 이득은 추출적 베이스라인에 비해 제한될 수 있다.
  • 명사(동사 포함 여부와 무관)를 키워드로 사용하는 것이 일반적으로 동사만 사용할 때보다 ROUGE 점수를 향상시킨다.
  • Top-p 샘플링은 가독성과 추상적 품질에서 그리디 디코딩보다 우수하며 ROUGE 점수는 비슷하다.
  • 어텐션 시각화는 미세 조정이 나중 계층에서 키워드–요약 관계를 강화함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.