Skip to main content
QUICK REVIEW

[논문 리뷰] RAProp: Ranking Tweets by Exploiting the Tweet/User/Web Ecosystem and Inter-Tweet Agreement

Srijith Ravikumar, Kartik Talamadupula|arXiv (Cornell University)|2013. 08. 11.
Misinformation and Its Impacts참고 문헌 6인용 수 7
한 줄 요약

RAProp는 소스 신뢰성(사용자, 트윗, 웹 페이지 기능을 통한)과 상호 트윗 상호관계를 통한 콘텐츠 일치를 결합하는 새로운 트윗 순위 매기기 방법이다. 신뢰 점수는 일치 그래프를 통해 전파되어 관련성 향상에 기여한다. TREC 2011 마이크로블로그 데이터셋에서 현재 가장 우수한 방법보다 상위 30개 정밀도가 53% 높다.

ABSTRACT

The increasing popularity of Twitter renders improved trustworthiness and relevance assessment of tweets much more important for search. However, given the limitations on the size of tweets, it is hard to extract measures for ranking from the tweets' content alone. We present a novel ranking method, called RAProp, which combines two orthogonal measures of relevance and trustworthiness of a tweet. The first, called Feature Score, measures the trustworthiness of the source of the tweet. This is done by extracting features from a 3-layer twitter ecosystem, consisting of users, tweets and the pages referred to in the tweets. The second measure, called agreement analysis, estimates the trustworthiness of the content of the tweet, by analyzing how and whether the content is independently corroborated by other tweets. We view the candidate result set of tweets as the vertices of a graph, with the edges measuring the estimated agreement between each pair of tweets. The feature score is propagated over this agreement graph to compute the top-k tweets that have both trustworthy sources and independent corroboration. The evaluation of our method on 16 million tweets from the TREC 2011 Microblog Dataset shows that for top-30 precision we achieve 53% higher than current best performing method on the Dataset and over 300% over current Twitter Search. We also present a detailed internal empirical evaluation of RAProp in comparison to several alternative approaches proposed by us.

연구 동기 및 목표

  • 트위터 검색 결과의 낮은 관련성과 신뢰성 문제를 해결하기 위해, 최근성과 키워드 매칭에 크게 의존하는 기존 방식을 개선하고자 한다.
  • TF-IDF와 같은 콘텐츠 중심 방법의 한계를 극복하기 위해, 짧고 정보량이 적은 트윗에 대해 보다 적절한 페널티를 적용하고자 한다.
  • 소스 신뢰성과 트윗 콘텐츠의 독립적 확인을 통합하여 순위 매기기 성능을 향상시키고자 한다.
  • 트윗/사용자/웹 생태계를 활용하여 강력한 관련성 평가를 가능하게 하는 확장 가능한 그래프 기반 방법을 개발하고자 한다.
  • 실세계 마이크로블로그 데이터에서 실제 검색 성능 기준인 정밀도와 MAP 지표에서 기존 베이스라인, 특히 트위터 검색과 USC/ISI를 능가하고자 한다.

제안 방법

  • RAProp는 사용자, 트윗, 웹 페이지로 구성된 3층 생태계 모델을 구축하여 소스 신뢰성의 척도인 특징 점수(FS)를 계산한다.
  • 정점이 트윗이고, 간선이 공통 콘텐츠와 웹 참조를 기반으로 한 쌍의 트윗 간 콘텐츠 일치도를 추정하는 일치 그래프를 구축한다.
  • 특징 점수를 일치 그래프를 통해 확산 프로세스를 이용해 전파함으로써, 확인된 콘텐츠를 가진 트윗의 신뢰 점수를 향상시킨다.
  • 이 방법은 FS 전파와 상호 트윗 간 일치도를 통합하여, 신뢰할 만한 소스에서 온 동시에 독립적으로 확인된 콘텐츠를 가진 트윗을 순위 매긴다.
  • 정밀도 상위-K와 평균 평균 정밀도(MAP)를 평가 지표로 사용하여 트위터 검색과 USC/ISI 등 기존 베이스라인과 비교한다.
  • 중개자 모델과 비중개자 모델 모두에서 검증하여, 다양한 검색 환경에서의 강건성을 입증한다.

실험 결과

연구 질문

  • RQ1소스 신뢰성과 상호 트윗 콘텐츠 일치를 융합하면 트윗 순위 정밀도가 향상되는가?
  • RQ2RAProp의 그래프 기반 신뢰 전파 방식은 관련성 측면에서 키워드 기반 또는 최근성 기반 순위 매기기 방식보다 어떻게 비교되는가?
  • RQ3소스 신뢰성 외에 독립적 확인이 추가로 제공될 경우, 얼마나 더 높은 수준의 신뢰성 향상을 기대할 수 있는가?
  • RQ4대규모 마이크로블로그 데이터에서 최첨단 방법인 USC/ISI 및 원본 트위터 검색과 비교해 RAProp는 어떤 성능을 보이는가?
  • RQ5질의에 특화된 배경 지식 없이도 RAProp는 다양한 상위-K 검색 기준에서 높은 정밀도를 유지할 수 있는가?

주요 결과

  • RAProp는 TREC 2011 마이크로블로그 데이터셋에서 현재 가장 우수한 방법보다 상위 30개 정밀도가 53% 높다.
  • 원본 트위터 검색(최근성과 키워드 매칭에만 의존) 대비 상위 30개 정밀도가 300% 이상 향상되었다.
  • 비중개자 모델에서 RAProp는 USC/ISI 기준 대비 상위 30개 정밀도가 20% 높다.
  • MAP 지표에서 RAProp는 USC/ISI 대비 4% 높은 성능을 기록하여, 전체 순위 매기기 품질이 향상됨을 시사한다.
  • 일치 그래프는 콘텐츠 확인을 효과적으로 포착하여, 높은 리트윗 수나 최근성으로 인해 오도될 수 있는 트윗에 대한 의존도를 감소시켰다.
  • 일치 그래프를 통해 특징 점수를 전파함으로써, 소스가 손상되거나 오해의 소지가 있는 경우에도 신뢰할 수 있는 트윗을 성공적으로 식별할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.