Skip to main content
QUICK REVIEW

[논문 리뷰] Entity-based Claim Representation Improves Fact-Checking of Medical Content in Tweets

Amelie Wührl, Roman Klinger|arXiv (Cornell University)|2022. 09. 16.
Topic Modeling인용 수 7
한 줄 요약

이 논문은 사용자 생성 콘텐츠에서 핵심 엔터티-관계 삼중항을 추출하고 압축하여 트위터의 의료 주장에 대한 사실 확인 성능을 향상시키기 위한 엔터티 기반 주장 표현 방법을 제안한다. 기존 사실 확인 모델의 성능을 향상시키기 위해 모호하고 복잡한 트윗을 표준 데이터셋에서 볼 수 있는 구조적이고 간결한 주장으로 변환함으로써, 전체 트윗을 직접 분석하는 것보다 더 신뢰할 수 있는 판단을 가능하게 한다.

ABSTRACT

False medical information on social media poses harm to people's health. While the need for biomedical fact-checking has been recognized in recent years, user-generated medical content has received comparably little attention. At the same time, models for other text genres might not be reusable, because the claims they have been trained with are substantially different. For instance, claims in the SciFact dataset are short and focused: "Side effects associated with antidepressants increases risk of stroke". In contrast, social media holds naturally-occurring claims, often embedded in additional context: "`If you take antidepressants like SSRIs, you could be at risk of a condition called serotonin syndrome' Serotonin syndrome nearly killed me in 2010. Had symptoms of stroke and seizure." This showcases the mismatch between real-world medical claims and the input that existing fact-checking systems expect. To make user-generated content checkable by existing models, we propose to reformulate the social-media input in such a way that the resulting claim mimics the claim characteristics in established datasets. To accomplish this, our method condenses the claim with the help of relational entity information and either compiles the claim out of an entity-relation-entity triple or extracts the shortest phrase that contains these elements. We show that the reformulated input improves the performance of various fact-checking models as opposed to checking the tweet text in its entirety.

연구 동기 및 목표

  • 기존 사실 확인 모델이 기대하는 구조적이고 원자적인 주장과 실제 트위터에서 발생하는 사용자 생성 의료 주장 간의 괴리를 해소하기 위해.
  • 소셜 미디어에서 자연스럽게 발생하는 복잡하고 모호한 의료 주장에 대한 사실 확인의 신뢰성을 높이기 위해.
  • 비구조적이고 맥락이 풍부한 트윗을 시장에 유통된 사실 확인 아키텍처에 적합한 압축된 엔터티 기반 주장 표현으로 변환하는 방법을 개발하기 위해.
  • 기존 모델이 전체 트윗 텍스트를 직접 분석하는 것과 비교해, 이러한 재구성 과정이 모델 성능을 향상시키는지 평가하기 위해.

제안 방법

  • 사전 훈련된 NER 및 관계 추출 모델을 사용하여 트윗 내 핵심 엔터티와 관계를 식별한다.
  • 문서에서 가장 두드러진 엔터티와 그 관계를 바탕으로 엔터티-관계-엔터티 삼중항을 구성함으로써 주장 표현을 구축한다.
  • 식별된 엔터티와 관계를 포함하는 가장 짧은 구문을 추출하여 최소한의 자기 포함 주장으로 변환한다.
  • 재구성된 주장은 MultiVerS와 같은 기존 사실 확인 모델에 입력되어 진술의 진실성 여부를 예측한다.
  • 이 방법은 주장의 핵심 의미적 내용이 엔터티와 그 관계 구조에 암묵적으로 포함되어 있다고 가정한다.
  • 전체 트윗과 엔터티 기반 압축 주장 둘 모두를 사용한 모델의 판단을 비교하여 성능을 평가한다.

실험 결과

연구 질문

  • RQ1엔터티 기반 주장 표현 방식이 사용자 생성 의료 콘텐츠에 대한 기존 모델의 사실 확인 성능을 향상시킬 수 있는가?
  • RQ2엔터티와 관계 기반 주장 압축 방식이 전체 트윗을 직접 분석하는 것과 비교해 예측 정확도에서 어떻게 다를 수 있는가?
  • RQ3재구성 과정이 원래 주장의 의미적 의미를 얼마나 잘 유지하며, 오해의 소지가 있는 표현으로 이어지지 않는가?
  • RQ4이러한 방법이 인과관계나 복잡한 관계적 진술을 포함한 다양한 유형의 의료 주장에 일반화 가능한가?
  • RQ5증거가 모호하거나 직접 언급된 내용을 초월한 추론이 필요한 경우, 이 방법의 성능은 얼마나 견고한가?

주요 결과

  • 기존 사실 확인 모델이 전체 트윗을 직접 분석하는 것보다 엔터티 기반 주장 표현을 사용할 경우 더 높은 신뢰도를 보였다.
  • 전체 트윗 분석에서 잘못된 판단을 내렸던 케이스 중 72%에서 압축된 주장 표현을 사용함으로써 더 정확한 예측이 이루어졌다.
  • 20건의 사례에서 압축된 주장은 골드 판정에서 NEI로 판정이 변경되었으며, 이는 압축 과정에서 증거 손실의 잠재적 위험을 시사한다.
  • 예를 들어 mRNA 백신의 장기적 안전성에 대한 추론이 필요한 주장의 경우, 증거가 올바르게 해석될 경우 압축된 주장조차도 정확한 판단을 가능하게 했다.
  • 특히 복잡하거나 맥락이 풍부한 트윗에서 핵심 주장의 구조에 집중함으로써 모호성을 줄이고 모델 성능을 향상시켰다.
  • 개인 건강 경험을 담은 사례에서 보듯이, 원래 주장이 더 긴 정서적 요소가 담긴 서사 속에 포함되어 있더라도 이 방법은 효과적으로 작동함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.