Skip to main content
QUICK REVIEW

[논문 리뷰] Challenges and Opportunities in Information Manipulation Detection: An Examination of Wartime Russian Media

Chan Young Park, Julia Mendelsohn|arXiv (Cornell University)|2022. 05. 24.
Misinformation and Its Impacts인용 수 14
한 줄 요약

이 논문은 2022년 러시아-우크라이나 전쟁 기간 동안 트위터와 밴드카페에서 수집한 3800만 건 이상의 러시아 미디어 게시물로 구성된 VoynaSlov 데이터셋을 소개한다. 이는 일상적인 정보 조작 전략, 예를 들어 의제 설정, 프레임 설정, 프라밍 등을 연구하기 위한 것이다. 번역된 영문 텍스트를 기반으로 한 NLP 모델 분석을 통해 플랫폼 및 매체사별로 나타나는 조작 패턴을 규명하고, 실시간 위기 상황에서 미묘한 선전을 탐지하는 데 있어 현재 NLP 접근 방식의 한계를 드러낸다.

ABSTRACT

NLP research on public opinion manipulation campaigns has primarily focused on detecting overt strategies such as fake news and disinformation. However, information manipulation in the ongoing Russia-Ukraine war exemplifies how governments and media also employ more nuanced strategies. We release a new dataset, VoynaSlov, containing 38M+ posts from Russian media outlets on Twitter and VKontakte, as well as public activity and responses, immediately preceding and during the 2022 Russia-Ukraine war. We apply standard and recently-developed NLP models on VoynaSlov to examine agenda setting, framing, and priming, several strategies underlying information manipulation, and reveal variation across media outlet control, social media platform, and time. Our examination of these media effects and extensive discussion of current approaches' limitations encourage further development of NLP models for understanding information manipulation in emerging crises, as well as other real-world and interdisciplinary tasks.

연구 동기 및 목표

  • 실시간 위기 상황에서 국가가 배경이 된 정보 조작을 실질적으로 측정할 수 있는 대규모 데이터셋이 부족한 데 대비하기 위해.
  • 2022년 러시아-우크라이나 전쟁 기간 동안 미디어 매체와 플랫폼 간에 어떻게 세련된 조작 전략—의제 설정, 프레임 설정, 프라밍—이 퍼져나가는지를 연구하기 위해.
  • 기존 NLP 모델이 미묘한, 가짜 뉴스가 아닌 형태의 미디어 조작을 탐지하는 데서의 성능과 한계를 평가하기 위해.
  • 미래의 NLP 연구에 기초를 제공하여, 신속히 발생하는 갈등과 다학제적 맥락에서 정보 조작을 탐지하고 완화하는 데 기여하기 위해.

제안 방법

  • 2021년 1월 이래로 러시아 미디어 매체 43개(국가 기반 23개, 독립 20개)의 트위터 및 밴드카페 게시물을 수집하였다.
  • 모든 러시아어 콘텐츠를 Facebook WMT-ru-en 모델을 사용하여 영어로 번역하여 다국어 분석을 수행하였다.
  • MFC(Media Framing Corpus)에 맞추어 미세조정된 XLM-RoBERTa 기반 모델을 적용하여 문장 수준에서 프레임 레이블을 할당하였다.
  • 다수결 투표와 무작위 티바이크 방법을 사용하여 문장 수준의 프레임 레이블을 집계하여 게시물 및 댓글 수준의 프레임 레이블을 도출하였다.
  • 모델 성능과 번역 품질 평가를 위해 103개의 러시아어 문장(49개 게시물에서 유래)에 대해 인간 주석을 수행하였으며, 현지 러시아어 사용자들을 대상으로 프레임 및 번역 신뢰성 평가를 실시하였다.
  • 국가 기반 매체와 독립 매체, 플랫폼(VK vs. 트위터), 시간(전쟁 전 vs. 전쟁 중)에 따라 조작 전략의 다양성을 분석하였다.

실험 결과

연구 질문

  • RQ12022년 전쟁 기간 동안 러시아의 국가 기반 및 독립 매체 간에 의제 설정, 프레임 설정, 프라밍 전략은 어떻게 다를까?
  • RQ2러시아 전시 미디어 맥락에서 밴드카페와 트위터 플랫폼 간 조작 패턴은 어떻게 다를까?
  • RQ3현재 NLP 모델의 성능은 다국어, 실시간 위기 데이터에서 세련된 프레임 설정 전략을 탐지하는 데 얼마나 효과적인가?
  • RQ4기계 번역 결과가 원본의 프레임 설정 의도를 얼마나 잘 유지하는가? 이는 후속 NLP 분석에 어떤 영향을 미치는가?
  • RQ5기존 NLP 모델이 신속히 발생하는 위기 상황에서의 세련된, 가짜 뉴스가 아닌 형태의 정보 조작을 탐지하는 데에서 어떤 핵심적 한계를 지니는가?

주요 결과

  • VoynaSlov 데이터셋은 2021년 1월 이래로 수집된 트위터와 밴드카페에서의 러시아 미디어 게시물 3800만 건 이상을 포함하며, 전쟁 전과 전쟁 중 기간을 모두 포함한다.
  • NLP 모델은 '건강 및 안전' 프레임에서 매크로-F1 스코어 62.9%와 '범죄 및 처벌' 프레임에서 60.0%를 기록했지만, '능력 및 자원'과 '합법성, 헌법적 타당성, 관할권'과 같은 추상적 프레임에서는 성능이 떨어져 F1 스코어가 0%에 머물렀다.
  • 번역 품질은 매우 높았으며, 99%의 번역 결과가 '좋음' 또는 '수용 가능'으로 평가되어, 프레임 분석에 있어 영문 번역이 일반적으로 신뢰할 수 있음을 시사한다.
  • 국가 기반 매체와 독립 매체, 플랫폼 간에 프레임 설정과 의제 설정 전략에 뚜렷한 차이가 관찰되었으며, 특히 전쟁 중과 전쟁 전 기간 간의 격차가 두드러졌다.
  • 본 연구는 현재 NLP 모델이 추상적이고 복잡한 프레임 카테고리에 대해 어려움을 겪고 있음을 드러내며, 명백한 가짜 뉴스가 아닌 고도로 세련된 조작을 탐지하는 데 있어 심각한 격차가 있음을 시사한다.
  • 고품질의 번역과 구체적 프레임에서의 우수한 성능에도 불구하고, 전체적인 모델 성능은 여전히 제한되어 있다. 특히 맥락 의존적인 세련된 프레임에 대해서는 성능이 떨어지며, 이는 위기 탐지 분야에서 맥락 인식 및 해석 가능성에 초점을 맞춘 NLP 모델 개발의 필요성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.