Skip to main content
QUICK REVIEW

[논문 리뷰] Extracting a Knowledge Base of COVID-19 Events from Social Media

Shi Zong, Ashutosh Baheti|arXiv (Cornell University)|2020. 06. 03.
Misinformation and Its Impacts참고 문헌 32인용 수 4
한 줄 요약

이 논문은 5개의 이벤트 유형—양성/음성 검사, 사망, 검사 접근 거부, 주장된 치료법/예방법—에 걸쳐 28개의 세분화된 슬롯을 포함한 총 10,000건의 코로나19 관련 트윗을 수작업으로 주석 처리한 코퍼스를 제시한다. 이 코퍼스를 기반으로 프리트레인된 BERT 기반 분류기들을 미세조정하여 수백만 건의 트윗에서 구조화된 이벤트를 추출하고, '휴스턴에 있는 어떤 기관에서 양성 반응을 보인 직원이 있었는가?'와 같은 고정밀도의 복잡한 질의를 지원하는 CovidKB라는 지식 기반을 구축하였다.

ABSTRACT

In this paper, we present a manually annotated corpus of 10,000 tweets containing public reports of five COVID-19 events, including positive and negative tests, deaths, denied access to testing, claimed cures and preventions. We designed slot-filling questions for each event type and annotated a total of 31 fine-grained slots, such as the location of events, recent travel, and close contacts. We show that our corpus can support fine-tuning BERT-based classifiers to automatically extract publicly reported events and help track the spread of a new disease. We also demonstrate that, by aggregating events extracted from millions of tweets, we achieve surprisingly high precision when answering complex queries, such as "Which organizations have employees that tested positive in Philadelphia?" We will release our corpus (with user-information removed), automatic extraction models, and the corresponding knowledge base to the research community.

연구 동기 및 목표

  • 코로나19 패닉 기간 동안 소셜 미디어에서 실시간으로 얻을 수 있는 세밀한 공중 보건 정보를 추출하는 데 도전한다.
  • 공식 데이터가 종종 지연되며 개인 또는 조직 수준의 세부 정보를 제공하지 못하는 한계를 극복한다.
  • 미래의 위기 상황을 위한 지도 학습 기반의 이벤트 추출을 지원할 수 있는 고품질, 언어학적으로 rich한 데이터셋을 개발한다.
  • 트위터에서 공개된 이벤트에 대해 복잡한, 구조화된 질의를 가능하게 하는 확장 가능한 지식 기반을 구축한다.
  • epidemiologist, 기자, 정책 입안자들이 사용할 수 있도록 공중 보건 모니터링, 오락성 정보 추적, 의사결정 지원을 지원한다.

제안 방법

  • 양성 검사, 음성 검사, 검사 접근 거부, 사망, 주장된 치료법/예방법의 5개 이벤트 유형을 설계한다.
  • 인간 주석 처리를 안내하기 위해 28개의 세분화된 의미적 슬롯(예: 위치, 해외 이동력, 밀접한 접촉자)에 대한 슬롯 채우기 질문을 제작한다.
  • 각 슬롯에 대해 스팬 수준의 레이블링을 수행하여 언어적 정밀도와 일관성을 확보하면서 총 10,000건의 트윗을 수집하고 주석 처리한다.
  • 주석 처리된 코퍼스를 기반으로 BERT 기반의 시퀀스 분류 모델을 미세조정하여 자동으로 구조화된 이벤트 정보를 추출한다.
  • 넓게 논의된 이벤트에서의 재현성에 기반하여 수백만 건의 트윗에서 추출한 결과를 집계함으로써 정밀도를 향상시킨다.
  • 추출된 이벤트를 자연어 유사 구문을 사용하는 복잡한, 구조화된 질의를 지원하는 검색 가능한 지식 기반(CovidKB)에 색인화한다.

실험 결과

연구 질문

  • RQ1소셜 미디어 트윗의 수작업 주석 처리 및 세분화된 코퍼스가 BERT 기반 모델의 구조화된 이벤트 추출을 위한 효과적인 훈련을 지원할 수 있는가?
  • RQ2대규모 트위터 데이터에서 추출한 결과를 집계함으로써 실제 공중 보건 이벤트를 높은 정밀도로 식별할 수 있는가?
  • RQ3결과 지식 기반은 위치, 조직, 노출력 역사 등과 같은 복잡한 다중 사실 기반의 질의를 높은 정확도로 답변할 수 있는가?
  • RQ4치료법 및 예방법에 대한 주장의 탐지 및 색인화는 오락성 정보 추적에 얼마나 효과적인가?
  • RQ5이 방법론은 자연재해나 향후 유행병과 같은 다른 위기 상황에 얼마나 신속하게 적용될 수 있는가?

주요 결과

  • 코퍼스는 슬롯 F1 스코어가 0.3에서 0.9 사이로, 대부분 0.5를 초과하여 세분화된 주석 처리가 이벤트 추출에 실현 가능함을 입증한다.
  • 수백만 건의 트윗에서 추출한 결과를 집계함으로써, 필라델피아에서 양성 반응을 보인 직원이 있는 기관을 식별하는 것과 같은 복잡한 질의에 대해 고정밀도의 답변을 가능하게 한다.
  • 지식 기반인 CovidKB는 두 해 동안의 트위터 데이터에서 추출한 420만 건 이상의 이벤트를 색인화하여 실시간, 구조화된 질의를 지원한다.
  • 시스템은 히드록시클로로퀸과 마스크와 같은 치료법에 대한 지속적인 언급과 함께, 백신 및 플루복사민, 단일클론 항체와 같은 약물에 대한 관심이 증가하는 것을 성공적으로 탐지하고 추적한다.
  • 치료법을 홍보하는 주요 인물들, 예를 들어 도널드 트럼프, 빌 게이츠, CDC, 파스파이어와 같은 기관, 그리고 지미 박커와 같은 논란의 중심이 되는 인물들을 식별하여 오락성 정보의 잠재적 유통 경로를 드러낸다.
  • 표본 편향(공개 트윗의 1%) 및 비표준 어조에서의 성능 격차와 같은 한계가 존재하지만, 시스템은 공중 보건 모니터링 및 위기 대응에 있어 강력한 유용성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.