Skip to main content
QUICK REVIEW

[論文レビュー] Remembering what we like: Toward an agent-based model of Web traffic

Bruno Gonçalves, Mark Meiss|arXiv (Cornell University)|Jan 24, 2009
Complex Network Analysis Techniques参考文献 13被引用数 9
ひとこと要約

本稿では、ブックマークリストとタブブラウジング行動を通じてユーザーの記憶を組み込むことで、現実のWebトラフィックパターンをよりよく再現するエージェントベースモデルBookRankを提案する。ブックマークの順位付けによる再接続と、戻るボタンやタブの使用による分岐を許容することで、BookRankはPageRankに比べて、個々のブラウジング多様性、リンクトラフィック分布、リターン時間分布をより正確に予測する。

ABSTRACT

Analysis of aggregate Web traffic has shown that PageRank is a poor model of how people actually navigate the Web. Using the empirical traffic patterns generated by a thousand users over the course of two months, we characterize the properties of Web traffic that cannot be reproduced by Markovian models, in which destinations are independent of past decisions. In particular, we show that the diversity of sites visited by individual users is smaller and more broadly distributed than predicted by the PageRank model; that link traffic is more broadly distributed than predicted; and that the time between consecutive visits to the same site by a user is less broadly distributed than predicted. To account for these discrepancies, we introduce a more realistic navigation model in which agents maintain individual lists of bookmarks that are used as teleportation targets. The model can also account for branching, a traffic property caused by browser features such as tabs and the back button. The model reproduces aggregate traffic patterns such as site popularity, while also generating more accurate predictions of diversity, link traffic, and return time distributions. This model for the first time allows us to capture the extreme heterogeneity of aggregate traffic measurements while explaining the more narrowly focused browsing patterns of individual users.

研究の動機と目的

  • Markov的モデル(例:PageRank)が現実のユーザーWebナビゲーション行動を捉えきれていないという限界を解決すること。
  • 実証データで観察される集計的トラフィックパターンと個々のブラウジング行動の乖離を説明すること。
  • ユーザーの記憶、ブックマーク行動、分岐ナビゲーション(例:タブ、戻るボタン)を考慮したモデルの構築。
  • Webトラフィックにおけるサイト多様性、リンクトラフィック分布、リターン時間分布の予測を改善すること。
  • 集計的トラフィックの広範な不均一性と、個々のユーザーの集中的・反復的ブラウジングパターンの両立を説明すること。

提案手法

  • 各ユーザーが訪問頻度に基づいて順位付けされたブックマークリストを保持するエージェントベースモデルBookRankを提案する。
  • エージェントはWebグラフ上でランダムウォークを実行し、訪問頻度に応じた順位に基づいてブックマーク済みページへのトランジット(テレポート)を実施する。
  • 複数タブブラウジングや戻るボタンの使用をシミュレートするための分岐パラメータpbを導入し、セッション中に複数のページに再訪問できるようにする。
  • 訪問回数に重みを付けたブックマークの確率分布を用いて、頻繁に訪問するサイトへのユーザーの好みをモデル化する。
  • ユーザーが確率ptで新しいページにジャンプし、確率1-ptでブックマーク済みページに戻る確率的プロセスを採用する。
  • 分岐はpbによって制御される木構造的な構造を用いてブラウジングセッションをシミュレートし、エントロピー、リターン時間、リンクトラフィック分布を測定する。

実験結果

リサーチクエスチョン

  • RQ1PageRankがランキングアルゴリズムで成功しているにもかかわらず、なぜ現実のWebトラフィックパターンを予測できないのか?
  • RQ2個々のユーザーのブラウジング行動(サイト多様性、リターン時間など)は、Markov的仮定とどの程度乖離しているのか?
  • RQ3ユーザーの記憶とブックマーク行動は、リンクトラフィック分布やサイト人気の広範な分布をどの程度説明できるのか?
  • RQ4タブブラウジングや戻るボタンの使用は、訪問済みサイトの分布とリターン時間にどのように影響を与えるのか?
  • RQ5ブックマークと分岐を組み込んだ非Markov的モデルは、PageRankに比べて個々のユーザーと集計的トラフィックパターンの両方をより正確に再現できるか?

主な発見

  • 実証データから、シャノンエントロピーで測定した個々のユーザーの多様性は、PageRankが予測するよりも顕著に低く、かつ広く分布していることが判明した。
  • リンクトラフィック分布は、実データではPageRankが予測するよりもはるかに広がっており、ユーザーがリンクをどのように通過するかの変動性が大きいことを示している。
  • 以前に訪問したサイトへのリターン時間分布は、PageRankが予測するよりも狭く、より強いユーザーの習慣と繰り返し訪問の兆候を示している。
  • 分岐パラメータpb ≈ 0.19–0.20のBookRankは、特に分岐を強化した場合に、実データとよく一致するエントロピー分布を生成した。
  • BookRankはPageRankに比べて、リターン時間分布のパワー則指数を低減させ、より現実的なリターン時間を得た。
  • 訪問頻度のみでブックマークを順位付けするだけで、ノードおよびリンクトラフィックの実証的分布を再現可能であり、ナビゲーションにおける記憶の重要性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。