Skip to main content
QUICK REVIEW

[논문 리뷰] Clustering of Deep Contextualized Representations for Summarization of Biomedical Texts

Milad Moradi, Matthias Samwald|arXiv (Cornell University)|2019. 08. 06.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 외부 도메인 지식이 필요 없이 생물의학 텍스트 요약을 위해 깊이 있는 문맥 기반 표현을 활용하여 문장을 군집화하고 순위를 매기는 BERT 기반 요약기를 제안한다. BERT 임베딩를 통해 문장 유사도와 정보성 내용을 측정함으로써, 기준 방법에 비해 향상된 요약 성능를 달성하며, 문맥 기반 표현만으로도 생물의학적 맥락을 효과적으로 포착할 수 있음을 입증한다.

ABSTRACT

In recent years, summarizers that incorporate domain knowledge into the process of text summarization have outperformed generic methods, especially for summarization of biomedical texts. However, construction and maintenance of domain knowledge bases are resource-intense tasks requiring significant manual annotation. In this paper, we demonstrate that contextualized representations extracted from the pre-trained deep language model BERT, can be effectively used to measure the similarity between sentences and to quantify the informative content. The results show that our BERT-based summarizer can improve the performance of biomedical summarization. Although the summarizer does not use any sources of domain knowledge, it can capture the context of sentences more accurately than the comparison methods. The source code and data are available at https://github.com/BioTextSumm/BERT-based-Summ.

연구 동기 및 목표

  • 비용이 많이 드는 수동 지식 기반 구축을 피하는 저자원, 도메인 무관 요약 방법을 개발하는 것.
  • 사전 훈련된 BERT 표현이 생물의학 맥락에서 문장 유사도와 정보성 측정에 효과적으로 기여할 수 있는지 조사하는 것.
  • 기존의 일반적이고 도메인 특화된 요약 방법과 비교하여 BERT 기반 군집화 접근법의 성능을 평가하는 것.
  • 문맥 기반 임베딩만으로도 명시적인 도메인 지식 없이 경쟁 가능한 요약 결과를 달성할 수 있음을 보여주는 것.

제안 방법

  • 생물의학 도메인의 문장을 표현하기 위해 사전 훈련된 BERT 모델의 문맥 기반 임베딩을 활용한다.
  • BERT 임베딩에 군집 기법을 적용하여 의미적으로 유사한 문장을 그룹화하고 핵심 내용을 식별한다.
  • 군집 내 중심성과 임베딩 표현으로부터 유추된 정보성에 기반해 문장을 순위 매긴다.
  • 군집된 표현에서 고영향도이자 다양성이 확보된 문장을 우선 선택하는 문장 선택 전략을 적용한다.
  • 도메인 특화 데이터에 대한 미세조정 없이 표준 생물의학 요약 벤치마크에서 모델을 종합적으로 훈련하고 평가한다.
  • 문장의 관련성과 중복성 유추에 문맥적 풍부도를 갖춘 BERT 임베딩에만 의존한다.

실험 결과

연구 질문

  • RQ1추가적인 도메인 지식 없이 BERT 기반 문맥 기반 표현이 생물의학 텍스트에서 문장 유사도를 효과적으로 측정할 수 있는가?
  • RQ2BERT 임베딩의 군집화가 생물의학 문서의 자동 요약 품질 향상에 어느 정도 기여하는가?
  • RQ3외부 도메인 지식 기반 지식 기반 자료에 의존하는 방법과 비교했을 때 BERT 전용 요약기는 요약 성능에서 어떻게 다른가?
  • RQ4명시적인 특징 공학 없이 임베딩 기반 군집화로 정보성 내용을 정량화할 수 있는가?

주요 결과

  • BERT 기반 요약기는 생물의학 텍스트 요약의 자동 평가 지표에서 일반 기준 방법보다 뛰어난 성능을 보였다.
  • 수동으로 구축된 도메인 지식이나 외부 자원을 사용하지 않음에도 불구하고 경쟁 가능한 성능를 달성했다.
  • 문맥 기반 표현의 군집화가 중요한 문장과 중복되지 않은 문장을 효과적으로 식별하여 요약의 통일성과 커버리지 향상에 기여했다.
  • ROUGE 점수 향상으로 인해 비교 방법에 비해 생물의학 언어의 맥락적 특징을 더 정확히 포착하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.