Skip to main content
QUICK REVIEW

[논문 리뷰] Covid-Transformer: Detecting COVID-19 Trending Topics on Twitter Using Universal Sentence Encoder

Meysam Asgari-Chenaghlu, Narjes Nikzad-Khasmakhi|arXiv (Cornell University)|2020. 09. 08.
Advanced Text Analysis Techniques참고 문헌 19인용 수 19
한 줄 요약

이 논문은 유니버설 문장 인코더(USE) 임베딩을 활용해 의미적 표현을 구현하고, K-means 클러스터링 및 딥러닝 기반 텍스트 요약을 통해 트위터에서의 트렌딩 코로나19 주제를 비지도 학습으로 탐지하는 새로운 프레임워크를 제안한다. 이 방법은 TF-IDF 및 LDA 기준선보다 우수한 성능을 보이며, 62%의 F1@10을 기록함으로써 문맥 기반 문장 임베딩을 통해 더 뛰어난 의미적 클러스터링과 주제 일관성을 확보한다.

ABSTRACT

The novel corona-virus disease (also known as COVID-19) has led to a pandemic, impacting more than 200 countries across the globe. With its global impact, COVID-19 has become a major concern of people almost everywhere, and therefore there are a large number of tweets coming out from every corner of the world, about COVID-19 related topics. In this work, we try to analyze the tweets and detect the trending topics and major concerns of people on Twitter, which can enable us to better understand the situation, and devise better planning. More specifically we propose a model based on the universal sentence encoder to detect the main topics of Tweets in recent months. We used universal sentence encoder in order to derive the semantic representation and the similarity of tweets. We then used the sentence similarity and their embeddings, and feed them to K-means clustering algorithm to group similar tweets (in semantic sense). After that, the cluster summary is obtained using a text summarization algorithm based on deep learning, which can uncover the underlying topics of each cluster. Through experimental results, we show that our model can detect very informative topics, by processing a large number of tweets on sentence level (which can preserve the overall meaning of the tweets). Since this framework has no restriction on specific data distribution, it can be used to detect trending topics from any other social media and any other context rather than COVID-19. Experimental results show superiority of our proposed approach to other baselines, including TF-IDF, and latent Dirichlet allocation (LDA).

연구 동기 및 목표

  • 최신 자연어 처리 기법을 활용해 트위터에서 비지도 방식으로 트렌딩 코로나19 관련 주제를 탐지하는 것.
  • 단어 수준 통계에 의존하고 의미를 포착하지 못하는 전통적 주제 모델링 방법(예: TF-IDF 및 LDA)의 한계를 해결하는 것.
  • 딥 러닝 기반의 심층적 문맥 기반 문장 임베딩을 활용해 의미적으로 유사한 트윗을 일관된 클러스터로 묶는 프레임워크를 개발하는 것.
  • 딥러닝 기반 텍스트 요약을 통해 각 주제 클러스터에 대해 간결하고 인간이 읽을 수 있는 요약문을 생성하는 것.
  • 정밀도, 재현율, F1-스코어를 기준으로 기존 기준선 대비 모델 성능을 평가하는 것.

제안 방법

  • 개별 트윗에서 의미적 문장 임베딩을 생성하기 위해 유니버설 문장 인코더(USE)를 사용하여 고밀도의 의미적 문장 임베딩을 생성한다. 이는 문맥적 의미를 유지한다.
  • 문장 임베딩에 K-means 클러스터링을 적용하여 의미적으로 유사한 트윗을 별개의 클러스터로 묶는다.
  • 각 클러스터에 대해 간결하고 대표적인 요약문을 생성하기 위해 딥러닝 기반 텍스트 요약 모델을 활용한다.
  • 문장 임베딩 간 코사인 유사도를 사용해 의미적 관련성을 측정함으로써 의미 있는 클러스터 형성을 가능하게 한다.
  • 클러스터 요약문을 주제 탐지 파이프라인에 통합하여 데이터에서 고수준의 해석 가능한 주제를 추출한다.
  • 정밀도, 재현율, F1-스코어를 사용해 상위 10개 랭크 기준으로 프레임워크 성능을 평가하고, TF-IDF 및 LDA 기준선과 비교한다.

실험 결과

연구 질문

  • RQ1문장 임베딩 기반 접근법은 기존의 백오브워즈 방법(예: TF-IDF)보다 소셜 미디어 데이터에서 더 일관되고 의미적인 주제를 탐지할 수 있는가?
  • RQ2유니버설 문장 인코더를 사용할 경우, 단어 공존 확률에 기반하는 LDA와 비교해 주제 클러스터링 성능이 어떻게 향상되는가?
  • RQ3딥러닝 기반 텍스트 요약은 실시간 트위터 데이터에서 파생된 주제 클러스터의 해석 가능성을 어느 정도 향상시킬 수 있는가?
  • RQ4이 프레임워크는 아키텍처상의 특성 덕분에 코로나19 외의 맥락에서도 강건성과 일반화 능력을 유지하는가?
  • RQ5검출된 주제와 키워드는 초기 패닉 단계 동안의 공공의 실제 우려와 어떻게 비교되는가?

주요 결과

  • 제안된 모델은 F1@10 스코어 0.62를 기록하여 TF-IDF(0.35) 및 LDA(0.51)를 뛰어넘는 뛰어난 주제 탐지 성능을 입증하였다.
  • LDA 대비 11% 이상, TF-IDF 대비 27% 이상 F1-스코어가 향상되어 더 강력한 의미적 클러스터링과 주제 일관성을 보여주었다.
  • 클러스터 시각화 결과, 노이즈가 많고 겹치는 클러스터를 생성하는 TF-IDF와 달리, 잘 분리되고 의미적인 중심을 갖춘 군집이 확인되었다.
  • 의미 기반 임베딩을 활용함으로써, 단어 기반 방법이 놓쳤던 중첩 주제와 세부적인 우려(예: 의료진 감사, 오락성 정보)도 탐지할 수 있었다.
  • 클러스터 요약을 통한 텍스트 요약은 각 주제 그룹의 핵심 관심사를 정확하게 반영한 간결하고 이해하기 쉬운 요약문을 생성하였다.
  • 프레임워크는 특정 데이터 분포나 도메인에 제한되지 않아 코로나19 외의 맥락에서도 일반화 가능성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.