[논문 리뷰] Characterizing the spread of exaggerated news content over social media
이 논문은 타이밍이 늦은 트윗에서 과장된 건강 뉴스가 어떻게 확산되는지 분석하며, 과장된 내용을 다룬 늦은 트윗은 '느끼다', '실감하다'와 같은 의견 및 인식 표현을 더 강하게 사용하지만, 부정적 또는 死에 관련된 어휘는 적게 사용하는 것으로 나타났다. 언어적 특징과 사용자 행동을 기반으로, 과장된 내용을 자주 공유하는 사용자를 F1-스코어 0.83로 분류함으로써, 이러한 사용자들 사이에는 뚜렷한 행동 및 언어적 패턴이 있음을 규명하였다.
In this paper, we consider a dataset comprising press releases about health research from different universities in the UK along with a corresponding set of news articles. First, we do an exploratory analysis to understand how the basic information published in the scientific journals get exaggerated as they are reported in these press releases or news articles. This initial analysis shows that some news agencies exaggerate almost 60\% of the articles they publish in the health domain; more than 50\% of the press releases from certain universities are exaggerated; articles in topics like lifestyle and childhood are heavily exaggerated. Motivated by the above observation we set the central objective of this paper to investigate how exaggerated news spreads over an online social network like Twitter. The LIWC analysis points to a remarkable observation these late tweets are essentially laden in words from opinion and realize categories which indicates that, given sufficient time, the wisdom of the crowd is actually able to tell apart the exaggerated news. As a second step we study the characteristics of the users who never or rarely post exaggerated news content and compare them with those who post exaggerated news content more frequently. We observe that the latter class of users have less retweets or mentions per tweet, have significantly more number of followers, use more slang words, less hyperbolic words and less word contractions. We also observe that the LIWC categories like bio, health, body and negative emotion are more pronounced in the tweets posted by the users in the latter class. As a final step we use these observations as features and automatically classify the two groups achieving an F1 score of 0.83.
연구 동기 및 목표
- 과학적 프레스 리leases 및 뉴스 기사에서 유래한 과장된 건강 뉴스가 트위터와 같은 소셜 미디어 플랫폼에서 어떻게 퍼지는지 이해하기 위해.
- 과장된 내용을 거의 또는 전혀 공유하지 않는 사용자와 자주 공유하는 사용자 간의 언어적 및 행동적 차이를 규명하기 위해.
- 언어적 및 네트워크 특징을 기반으로 사용자들이 과장된 뉴스를 공유할 가능성이 있는지 예측하는 모델을 개발하기 위해.
- 특히 늦게 올라오는 트윗에서 언어 사용의 변화를 포함한 과장된 뉴스 공유의 시간적 역학을 조사하기 위해.
제안 방법
- 연구는 영국 대학에서 온 462개의 레이블이 부여된 프레스 리leases와 668개의 뉴스 기사로 구성된 데이터셋을 사용하며, 인과적 진술의 변화, 조언의 명확성, 표본의 정체성 변화 기반으로 과장 여부를 레이블링하였다.
- 트윗의 언어적 특징을 추출하기 위해 언어 분석 도구인 LIWC(Linguistic Inquiry and Word Count)를 적용하여 감정, 인지, 사회적 과정과 관련된 특징을 추출하였으며, '승인', '느끼다', '부정적 감정', '생물학적' 등의 카테고리 포함.
- 사용자 행동 분석은 과장된 내용을 공유하는 빈도에 따라 사용자 그룹을 분류함: 공유하지 않는 경우(사용자_NEX), 거의 공유하지 않는 경우(사용자_EX1), 두 번 공유하는 경우(사용자_EX2), 세 번 이상 공유하는 경우(사용자_EX3).
- 리트윗/멘션 수, 슬랭어, 과장어, 약어, 트윗 길이 등의 특징을 사용자 타임라인에서 추출하여 게시 행동을 비교함.
- 이러한 특징을 기반으로 지도 학습 분류 모델을 훈련하였으며, 클래스 불균형을 보완하기 위해 계층적 10겹 교차검증과 클래스 가중치를 적용함.
- 랜덤 포레스트와 XGBoost 분류기가 최고의 성능을 보였으며, 과장된 뉴스를 거의 또는 전혀 공유하지 않는 사용자와 자주 공유하는 사용자를 구분하는 데 F1-스코어 0.83을 달성함.
실험 결과
연구 질문
- RQ1과장된 건강 뉴스에 관해 올라오는 트윗의 언어적 내용이 시간이 지남에 따라 어떻게 변화하는가, 특히 늦게 올라오는 트윗에서 어떻게 변화하는가?
- RQ2과장된 건강 뉴스를 자주 공유하는 사용자와 그렇지 않은 사용자 사이의 행동 및 언어적 차이는 무엇인가?
- RQ3사용자 게시 패턴과 언어적 특징을 기반으로 사용자가 과장된 뉴스를 공유할 가능성이 있는지 예측할 수 있는가?
- RQ4‘승인’, ‘불안’, ‘religion’, ‘부정적 감정’ 등의 LIWC 카테고리가 과장된 내용을 공유하는 트윗과 비과장된 내용을 공유하는 트윗 간에 어떻게 다를까?
주요 결과
- 과장된 뉴스를 공유하는 늦은 트윗에서는 ‘승인’, ‘느끼다’, ‘religion’, ‘불안’ 등의 LIWC 카테고리에 속하는 어휘가 더 강하게 나타나, 의견 표현 및 정서적 인식의 강화를 보여줌.
- 이러한 늦은 트윗들은 ‘사망’, ‘성적’, ‘슬픔’, ‘부정적 감정’과 관련된 어휘의 빈도가 낮아, 고통스럽거나 비관적인 언어 사용이 감소함을 시사함.
- 과장된 내용을 자주 공유하는 사용자들은 그렇지 않은 사용자들보다 훨씬 더 많은 팔로워를 보유하고 있으며, 더 많은 슬랭어를 사용하고, 과장어는 적게 사용하며, 약어 사용도 적은 것으로 나타남.
- 언어 분석 결과, 과장된 내용을 자주 게시하는 사용자들은 자신의 트윗에서 ‘생물학적’, ‘건강’, ‘신체’, ‘부정적 감정’ 등의 LIWC 카테고리 어휘를 더 많이 사용하는 경향이 있음.
- 분류기는 과장된 뉴스를 거의 또는 전혀 공유하지 않는 사용자와 자주 공유하는 사용자를 구분하는 데 F1-스코어 0.83를 달성하였으며, 랜덤 포레스트와 XGBoost 모델이 가장 뛰어난 성능을 보임.
- 연구는 시간이 지남에 따라 ‘다수의 지혜’가 언어적 신호를 통해 과장된 내용을 식별하는 데 기여할 수 있음을 보여주며, 특히 의견 및 인식 관련 언어 사용의 증가가 핵심 요소임을 밝힘.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.