[論文レビュー] You, the Web and Your Device: Longitudinal Characterization of Browsing Habits
本論文は、2013年から2016年までの期間にわたり、大規模なISPデータセットにおける受動的HTTPトレースから、ユーザーが開始したウェブページ訪問を機械学習ベースの手法で特定する方法を提示している。これにより、PCおよびスマートフォンにおけるクリックストリーム行動の縦断的特徴化が可能になった。その結果、モバイルブラウジングの急激な増加、検索エンジンによる直接的および間接的ナビゲーションの促進、ソーシャルネットワークによる短時間で自己完結的なブラウジングセッションの促進および高いユーザーリテンションの実現が明らかになった。
Understanding how people interact with the web is key for a variety of applications, e.g., from the design of effective web pages to the definition of successful online marketing campaigns. Browsing behavior has been traditionally represented and studied by means of clickstreams, i.e., graphs whose vertices are web pages, and edges are the paths followed by users. Obtaining large and representative data to extract clickstreams is however challenging. The evolution of the web questions whether browsing behavior is changing and, by consequence, whether properties of clickstreams are changing. This paper presents a longitudinal study of clickstreams in from 2013 to 2016. We evaluate an anonymized dataset of HTTP traces captured in a large ISP, where thousands of households are connected. We first propose a methodology to identify actual URLs requested by users from the massive set of requests automatically fired by browsers when rendering web pages. Then, we characterize web usage patterns and clickstreams, taking into account both the temporal evolution and the impact of the device used to explore the web. Our analyses precisely quantify various aspects of clickstreams and uncover interesting patterns, such as the typical short paths followed by people while navigating the web, the fast increasing trend in browsing from mobile devices and the different roles of search engines and social networks in promoting content. Finally, we contribute a dataset of anonymized clickstreams to the community to foster new studies (anonymized clickstreams are available to the public at http://bigdata.polito.it/clickstream).
研究の動機と目的
- 2013年から2016年にかけてのウェブブラウジング行動の変化を理解すること、特にモバイルデバイスの台頭と主要なオンラインサービスの影響を特に重視すること。
- 受動的ネットワークトレースにおいて、ユーザーが開始したウェブページ訪問と自動化されたブラウザリクエストを区別する課題に取り組むこと。
- PCとスマートフォンの異なるデバイスタイプにおけるクリックストリーム構造を特徴づけ、検索エンジンとソーシャルネットワークのコンテンツ発見における役割の変化を同定すること。
- 今後のウェブ利用、プライバシー、レコメンデーションシステムに関する研究に役立てるため、大規模で匿名化されたクリックストリームグラフデータセットを研究コミュニティに提供すること。
提案手法
- リクエストパターンに基づき、HTTPリクエストをユーザー行動(明示的訪問)と自動的行動(スクリプト、メディアなど)に分類する機械学習アプローチを提案。精度と再現率が90%を超える成果を達成。
- 25,000世帯の3年間分の640億件を超えるHTTPリクエストデータセットにこのモデルを適用。10億件を超えるページ訪問から550万件のクリックストリームグラフを抽出。
- ブラウザごとにリクエストをグループ化することで、デバイス固有のクリックストリームグラフを構築し、デバイスタイプごとのブラウジング行動を分析可能にする。
- 実証的累積分布関数(ECDF)を用いて、検索エンジン(SE)およびオンラインソーシャルネットワーク(OSN)に直接的または間接的に接続されたページの割合を分析。
- PCおよびスマートフォンにおける検索エンジンおよびソーシャルネットワークから直接アクセス可能または到達可能なウェブページの割合の時間的推移を追跡し、ナビゲーションパターンの変化を検出。
- 異なるネットワーク環境およびデバイスタイプにおいても、本手法の頑健性を検証。実世界の受動的測定において、ユーザー行動の信頼性の高い同定を確保。
実験結果
リサーチクエスチョン
- RQ12013年から2016年にかけて、クリックストリームグラフの構造、パス長、コンテンツ発見の観点から、どのように進化したか?
- RQ2PCユーザーとスマートフォンユーザーの間で、ナビゲーションパターンやコンテンツ発見の出どころにおいて、どのような違いが見られるか?
- RQ3検索エンジンとソーシャルネットワークは、コンテンツの促進において果たす役割は何か?また、その役割は時間経過とともにどのように変化したか?
- RQ4HTTPS暗号化接続は、受動的ネットワークトレースからのクリックストリームグラフ再構築をどの程度妨げるか?
主な発見
- クリックストリームグラフにおける中央値パス長は短く、ユーザーは通常、初期のエントリポイントを除いてほとんど探索を行わないことが示された。
- モバイルブラウジングは急速に成長しており、スマートフォンは現在、特にコンテンツ発見の分野で、ウェブトラフィックの大きな割合を占め、その割合は増加傾向にある。
- PCユーザーの場合は、検索エンジンがコンテンツ発見の主な出どころであり、訪問ページの17%が検索エンジンに直接接続されており、42%が検索エンジンから到達可能である。
- スマートフォンユーザーの場合は、ソーシャルネットワークから到達可能なページの割合が、検索エンジンからのものと同等にまで上昇しており、発見行動の変化が顕著に現れている。
- ソーシャルネットワークユーザーは高いリテンションを示しており、ソーシャルネットワークからリンクされたウェブページの61%が、さらに外部リンクを持たない。これは、ユーザーが外部リンクをクリック後も、再びプラットフォームに戻る傾向があることを示唆している。
- スマートフォンでは、コンテンツ発見に検索エンジンが使われる割合が低下しており、一方でソーシャルネットワークがコンテンツナビゲーションの主要なツールとしての役割を果たすようになっている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。