Skip to main content
QUICK REVIEW

[論文レビュー] Explore what-if scenarios with SONG: Social Network Write Generator

Vijay Erramilli, Xiaoyuan Yang|arXiv (Cornell University)|Feb 3, 2011
Complex Network Analysis Techniques参考文献 19被引用数 6
ひとこと要約

この論文では、Twitterのようなオンラインソーシャルネットワークにおけるユーザーの書き込み活動の合成的で現実的なトレースを、日周期的傾向や書き込み間隔の時間的パターンをモデル化することで生成するフレームワーク、SONG(Social Network Write Generator)を紹介する。大規模なTwitterクロールデータを用いてパラメータをキャリブレーションし、実システムメトリクス(CPU、I/O、ネットワーク)と比較して合成トレースを検証した。CassandraベースのTwitterクローンにおけるストレステストにおいて、CPUが高負荷下でのボトルネックであることが明らかになった。

ABSTRACT

Online Social Networks (OSNs) have witnessed a tremendous growth the last few years, becoming a platform for online users to communicate, exchange content and even find employment. The emergence of OSNs has attracted researchers and analysts and much data-driven research has been conducted. However, collecting data-sets is non-trivial and sometimes it is difficult for data-sets to be shared between researchers. The main contribution of this paper is a framework called SONG (Social Network Write Generator) to generate synthetic traces of write activity on OSNs. We build our framework based on a characterization study of a large Twitter data-set and identifying the important factors that need to be accounted for. We show how one can generate traces with SONG and validate it by comparing against real data. We discuss how one can extend and use SONG to explore different `what-if' scenarios. We build a Twitter clone using 16 machines and Cassandra. We then show by example the usefulness of SONG by stress-testing our implementation. We hope that SONG is used by researchers and analysts for their own work that involves write activity.

研究の動機と目的

  • プライバシー、レート制限、法的制限などの理由で実際のOSNデータセットへのアクセスが制限される課題に対処する。
  • 研究者がシステム評価やパフォーマンス分析のため、合成的ではあるが現実的なユーザー書き込み活動トレースを生成できるようにする。
  • 予測、容量計画、さまざまなワークロード下でのベンチマークテストなどの「もしも」シナリオの探求を支援する。
  • 既存のデータセットがなくても動作する柔軟なフレームワークを提供し、実地のモデリングまたは市販のパラメータ推定手法を用いる。
  • 実装済みのTwitterクローンを用いてフレームワークを検証し、システムのストレステストにおける実用的有用性を示す。

提案手法

  • ユーザーの書き込み活動を、長期的(日周期的)および短期的(数秒から数時間)な時間的ダイナミクスを捉える時間的カウント過程としてモデル化する。
  • 大規模なTwitterデータセットの実地分析に基づき、長期的傾向(例:日周期)を扱う1つのコンポーネントと、短期的バーストネスを扱う別のコンポーネントを備えた二重構成モデルを採用する。
  • 統計的フィッティングを用いて実データからモデルパラメータを推定する。データが利用できない場合には、標準的な市販手法を適用する。
  • キャリブレーション済みの長期的および短期的コンポーネントを組み合わせることで、現実的な時間的分布を持つ合成書き込みトレースを生成する。
  • システムレベルのメトリクス(ネットワークI/O、CPU使用率、ネットワークトラフィック)を実データおよび単純な一様ランダムベースラインと比較することで、合成トレースの妥当性を検証する。
  • Cassandraを用いて16台のマシンにわたるTwitterに類似したシステムをデプロイし、SONGが生成したトレースを用いて、書き込み負荷(1秒あたり25〜150件)を段階的に増加させ、パフォーマンス評価を実施する。

実験結果

リサーチクエスチョン

  • RQ1実際のデータセットが入手不能または制限されている状況において、どのようにしてOSNにおけるユーザー行動を現実的にモデル化できる合成的書き込み活動トレースを生成できるか?
  • RQ2TwitterのようなOSNにおける実際のユーザー書き込み行動を最もよく捉える時間的パターン(例:日周期的傾向、書き込み間隔)は何か?
  • RQ3SONGが生成した合成トレースは、実システムメトリクス(CPU、I/O、ネットワーク)と比較して、どの程度の忠実度と現実性を示すか?
  • RQ4SONGを用いた制御されたストレステストによって、実OSNに類似したシステムのボトルネックをどの程度まで特定できるか?
  • RQ5ランダムまたは一様なワークロードモデルと比較して、SONGが生成したトレースはベンチマークテストやパフォーマンス分析の精度を向上させることができるか?

主な発見

  • Twitterデータセットにおけるユーザーの書き込み間隔は、指数分布やパワー法則モデルよりも人間の行動をよりよく反映する対数正規分布に従うことが判明した。
  • 書き込み活動には自己相似性が見られず、ネットワークトラフィックの一部の先行モデルが仮定していたものとは矛盾する。
  • 一様ランダムベースラインと比較して、SONGが生成したトレースはネットワークトラフィックの低減を36%も低減し、実データとわずか6%の差にとどまる。
  • CPU、I/O、ネットワーク活動の観点から、合成トレースは実システムの動作と非常に近い一致を示しており、パフォーマンス評価における現実性が裏付けられた。
  • CassandraベースのTwitterクローンにおけるストレステストにおいて、SONGは1秒あたり100件を超える書き込みレートになるとCPUがシステムのボトルネックになることを明らかにした。
  • 100件/秒までの負荷では応答時間が10秒未満を維持したが、150件/秒に達すると応答時間が100msを超えて急増し、CPUの飽和が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。