Skip to main content
QUICK REVIEW

[논문 리뷰] Agents, Bookmarks and Clicks: A topical model of Web traffic

Mark Meiss, Bruno Gonçalves|arXiv (Cornell University)|2010. 03. 27.
Complex Network Analysis Techniques참고 문헌 25인용 수 7
한 줄 요약

이 논문은 북마크, 뒤로 가기 기능, 주제 관심사를 통합한 ABC 에이전트 기반 모델을 제안하여 개인의 브라우징 행동과 집합적 웹 트래픽 패턴을 설명한다. 이 모델은 페이지/링크 트래픽, 세션 크기, 엔트로피, 시작 페이지 인기도의 실증적 분포를 성공적으로 재현하며, 마르코프 성질이 없는 메커니즘을 통해 실제 웹 탐색의 이질성을 반영함으로써 페이지랭크와 북랭크를 능가한다.

ABSTRACT

Analysis of aggregate and individual Web traffic has shown that PageRank is a poor model of how people navigate the Web. Using the empirical traffic patterns generated by a thousand users, we characterize several properties of Web traffic that cannot be reproduced by Markovian models. We examine both aggregate statistics capturing collective behavior, such as page and link traffic, and individual statistics, such as entropy and session size. No model currently explains all of these empirical observations simultaneously. We show that all of these traffic patterns can be explained by an agent-based model that takes into account several realistic browsing behaviors. First, agents maintain individual lists of bookmarks (a non-Markovian memory mechanism) that are used as teleportation targets. Second, agents can retreat along visited links, a branching mechanism that also allows us to reproduce behaviors such as the use of a back button and tabbed browsing. Finally, agents are sustained by visiting novel pages of topical interest, with adjacent pages being more topically related to each other than distant ones. This modulates the probability that an agent continues to browse or starts a new session, allowing us to recreate heterogeneous session lengths. The resulting model is capable of reproducing the collective and individual behaviors we observe in the empirical data, reconciling the narrowly focused browsing patterns of individual users with the extreme heterogeneity of aggregate traffic measurements. This result allows us to identify a few salient features that are necessary and sufficient to interpret the browsing patterns observed in our data. In addition to the descriptive and explanatory power of such a model, our results may lead the way to more sophisticated, realistic, and effective ranking and crawling algorithms.

연구 동기 및 목표

  • 페이지랭크와 같은 마르코프 모델이 실제 웹 브라우징 행동을 설명하는 데 한계가 있음을 다루기 위해.
  • 개별 사용자 세션의 좁은 초점과 집합적 트래픽 측정치에서 관찰되는 극도로 이질적인 패턴 사이의 모순을 해소하기 위해.
  • 개별 기억(북마크), 탐색 메커니즘(뒤로 가기 단추), 주제 관심사를 고려한 현실적인 에이전트 기반 모델을 개발하기 위해.
  • 개별 수준의 지표(엔트로피, 세션 크기)와 집합 수준의 트래픽 패턴(페이지/링크 인기도)을 동시에 설명하기 위해.
  • 사람의 탐색 행동에서 두드러지는 특징을 모델링함으로써 개선된 랭킹 및 크롤링 알고리즘의 기초를 마련하기 위해.

제안 방법

  • 에이전트는 개인화된 북마크 목록을 유지하여 전이 대상으로 삼고, 세션 경계와 현실적인 시작 페이지 인기도를 가능하게 한다.
  • 뒤로 가기 기능을 통해 에이전트는 방문한 링크를 따라 되돌아올 수 있으며, 탭 기반 브라우징과 분기 탐색 패턴을 모델링한다.
  • 유사한 콘텐츠를 가진 페이지 간의 연결을 통해 주제성(토닉성)을 모델링하고, 관련 주제에서의 계속 탐색 확률을 높인다.
  • 브라우징 결정은 주제 관심도에 의해 조절되며, 콘텐츠가 관련성이 있으면 계속 브라우징하고, 그렇지 않으면 새로운 세션을 시작한다.
  • 사용자가 관련 콘텐츠를 탐색하는 방식을 반영하기 위해 비균일하고 주제 인식 기반의 링크 선택 과정을 사용한다.
  • 인디アナ 대학교의 1,000명 사용자로부터 확보한 실증 데이터를 활용해 모델을 校정하고 실제 트래픽 패턴과 검증한다.

실험 결과

연구 질문

  • RQ1왜 페이지랭크와 북랭크는 개인 사용자 트래픽 엔트로피와 세션 크기 분포를 예측하지 못하는가?
  • RQ2집합적 트래픽에서 관찰되는 이질성과 집중적인 개인 브라우징이 공존하는 현상을 설명하기 위해 필요한 비마르코프 성질의 메커니즘은 무엇인가?
  • RQ3북마크, 뒤로 가기 사용, 주제 관심도가 함께 작용할 때, 개인 수준과 집합 수준 양쪽에서 관측된 트래픽 패턴을 어떻게 재현할 수 있는가?
  • RQ4기억 기반, 분기 탐색, 주제성 요소를 갖춘 에이전트 기반 모델이 메모리가 없는 모델인 페이지랭크보다 얼마나 뛰어나게 성능을 발휘할 수 있는가?
  • RQ5주제 지역성은 웹 탐색에서 세션 길이와 사용자 참여도에 어떤 역할을 하는가?

주요 결과

  • ABC 모델은 페이지 트래픽, 링크 트래픽, 세션 시작 페이지 인기도의 실증적 분포에서 페이지랭크와 북랭크를 모두 능가한다.
  • 개별 사용자 엔트로피(브라우징 다양성 측정)는 ABC 모델이 페이지랭크나 북랭크보다 더 잘 반영하며, 집중적이지만 다양한 사용자 행동을 모델링하는 데서 개선된 성능을 보인다.
  • 모델은 실사용자 데이터에서 관측된 세션 크기와 깊이의 넓고 이질적인 분포를 성공적으로 재현하며, 간단한 모델들이 이를 반영하지 못하는 데서 비롯된다.
  • 북마크만으로도 페이지랭크에서 관찰되는 집합적 트래픽 불일치 문제를 수정할 수 있지만, 개인 세션의 이질성 모델링에는 부족하다.
  • 뒤로 가기 메커니즘은 실증 데이터에서 분기 탐색 패턴과 탭 기반 브라우징 행동을 재현하는 데 필수적이다.
  • 링크 선택에서의 주제 지역성은 사용자가 관련 콘텐츠에서 계속 브라우징하는 이유를 설명하며, 직접적으로 세션 길이와 깊이에 영향을 준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.