Skip to main content
QUICK REVIEW

[논문 리뷰] Information Credibility in the Social Web: Contexts, Approaches, and Open Issues

Gabriella Pasi, Marco Viviani|arXiv (Cornell University)|2020. 01. 26.
Misinformation and Its Impacts참고 문헌 50인용 수 9
한 줄 요약

이 논문은 소셜 웹에서 정보 신뢰성 평가에 대한 접근 방식에 대한 종합적인 서베이를 제시하며, 의견 스팸, 가짜 뉴스, 건강 관련 오보정보와 같은 세 가지 핵심 맥락에 초점을 맞춘다. 데이터 기반, 모델 기반, 그래프 기반, 지식 기반의 기존 방법들을 분류하여 각각의 강점과 한계를 제시하고, 지식 기반 유지보수, 가짜 콘텐츠의 조기 탐지, 신뢰성 평가 시스템에서의 기밀 사용자 데이터 처리와 같은 열린 문제점을 규명한다.

ABSTRACT

In the Social Web scenario, large amounts of User-Generated Content (UGC) are diffused through social media often without almost any form of traditional trusted intermediaries. Therefore, the risk of running into misinformation is not negligible. For this reason, assessing and mining the credibility of online information constitutes nowadays a fundamental research issue. Credibility, also referred as believability, is a quality perceived by individuals, who are not always able to discern, with their own cognitive capacities, genuine information from fake one. Hence, in the last years, several approaches have been proposed to automatically assess credibility in social media. Many of them are based on data-driven models, i.e., they employ machine learning techniques to identify misinformation, but recently also model-driven approaches are emerging, as well as graph-based approaches focusing on credibility propagation, and knowledge-based ones exploiting Semantic Web technologies. Three of the main contexts in which the assessment of information credibility has been investigated concern: (i) the detection of opinion spam in review sites, (ii) the detection of fake news in microblogging, and (iii) the credibility assessment of online health-related information. In this article, the main issues connected to the evaluation of information credibility in the Social Web, which are shared by the above-mentioned contexts, are discussed. A concise survey of the approaches and methodologies that have been proposed in recent years to address these issues is also presented.

연구 동기 및 목표

  • 기존의 중개자들이 없어지고 오보정보가 증가함에 따라 소셜 웹에서 정보 신뢰성 평가의 과제를 분석하기 위해.
  • 의견 스팸, 가짜 뉴스, 건강 관련 정보와 같은 세 가지 핵심 맥락에서 자동화된 신뢰성 평가 접근 방식을 분류하고 비교하기 위해.
  • 이 세 맥락에서 공통적으로 나타나는 열린 문제, 즉 지식 기반 유지보수, 가짜 콘텐츠의 조기 탐지, 기밀 사용자 데이터 처리를 규명하기 위해.
  • 특히 도메인 지식, 기계 학습, 실시간 탐지 기반의 하이브리드 모델을 결합한 향후 연구 방향을 제안하기 위해.

제안 방법

  • 신뢰성 평가 접근 방식을 데이터 기반(예: 기계 학습), 모델 기반, 그래프 기반(확산 분석용), 지식 기반(Semantic Web 및 지식 기반 사용)으로 분류한다.
  • 신뢰할 수 있는 사실과 SPO(주어-서술어-목적어) 삼항관계를 비교하여 지식 기반을 활용해 정보를 검증하는 방법을 분석하며, 기존 삼항관계를 신뢰성 평가에 있어 참으로 간주한다.
  • 정보가 소셜 네트워크를 통해 어떻게 퍼지는지를 추적하는 확산 기반 방법을 평가하여 스팮 봇과 오보정보 패tern을 탐지한다.
  • 다중 기준 의사결정(MCDM) 모델을 검토하며, 여러 신뢰성 지표를 가중치를 두어 평가하지만, 해석 가능성과 확장성의 과제를 지적한다.
  • 학습 데이터가 부족하거나 편향되어 있을 경우, 지도 학습과 도메인 지식, 실시간 데이터를 통합한 하이브리드 접근 방식을 제안한다.
  • 필터링 알고리즘과 사용자 프로파일링이 에코 챔버와 필터 버블을 강화하는 데 기여하며, 이는 신뢰성 인식과 확산에 영향을 준다는 점을 고려한다.

실험 결과

연구 질문

  • RQ1데이터 기반, 모델 기반, 그래프 기반, 지식 기반 접근 방식은 소셜 미디어에서의 신뢰성 평가에서 기계적 작동 방식과 효과성 면에서 어떻게 다를까?
  • RQ2의견 스팸, 가짜 뉴스, 건강 관련 오보정보와 같은 맥락에서 공통적으로 나타나는 신뢰성 평가 과제는 무엇인가?
  • RQ3빠르게 변화하는 소셜 미디어 환경에서 정확성과 관련성을 유지하기 위해 지식 기반은 어떻게 유지하고 업데이트할 수 있는가?
  • RQ4확증 편향과 에코 챔버 효과와 같은 사용자 행동 패턴이 신뢰성 평가 시스템의 신뢰성을 떨어뜨리는 데 어떤 역할을 하는가?
  • RQ5가짜 뉴스나 혐오 발언과 같은 유해 콘텐츠의 조기 탐지를 통해 광범위한 확산 이전에 손상을 최소화할 수 있는가?

주요 결과

  • 지식 기반 접근 방식은 신뢰할 수 있는 지식 기반과 SPO 삼항관계를 비교하여 정보를 효과적으로 검증할 수 있지만, 누락된 사실 처리와 시기적 업데이트 과제에 직면해 있다.
  • 확산 기반 방법은 오보정보 확산자와 가짜 콘텐츠의 확산을 효과적으로 탐지할 수 있지만, 복잡한 그래프 분석과 사전 계산된 신뢰성 점수를 필요로 한다.
  • 지도 학습 접근 방식은 일반적으로 '블랙박스' 성격으로 인해 해석이 어렵고, 학습 데이터가 부족하거나 편향되어 있을 경우에 특히 의존도가 높다.
  • 도메인 지식과 기계 학습의 통합은 특히 정확성이 중요하고 실수의 결과가 심각한 분야(예: 건강 관련 정보)에서 유망한 방향이다.
  • 유해 콘텐츠의 조기 탐지는 여전히 주요 열린 과제이며, 널리 퍼지기 전에 오보정보를 실시간으로 식별하는 데는 진전이 미흡하다.
  • 사용자 생성 콘텐츠에 포함된 기밀 또는 민감한 정보의 처리는 여전히 부족한 분야이지만, 적절히 정제된 경우 소스 신뢰성 평가 향상에 기여할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.