[論文レビュー] Twitter Hashtag Recommendation using Matrix Factorization
本稿では、ツイート本文に依存せず、ユーザーの歴史的ハッシュタグ使用履歴に基づいてハッシュタグを推薦する重み付き行列分解(hWMF)を用いたハッシュタグ推薦システムを提案する。ハッシュタグの相関関係をモデル化し、交互最小自乗法を用いて最適化することで、ベースライン手法に比べて優れた性能を発揮し、関連性が高くユーザーの使用傾向に整合するハッシュタグを効果的に推薦できる。
Twitter, one of the biggest and most popular microblogging Websites, has evolved into a powerful communication platform which allows millions of active users to generate huge volume of microposts and queries on a daily basis. To accommodate effective categorization and easy search, users are allowed to make use of hashtags, keywords or phrases prefixed by hash character, to categorize and summarize their posts. However, valid hashtags are not restricted and thus are created in a free and heterogeneous style, increasing difficulty of the task of tweet categorization. In this paper, we propose a low-rank weighted matrix factorization based method to recommend hashtags to the users solely based on their hashtag usage history and independent from their tweets' contents. We confirm using two-sample t-test that users are more likely to adopt new hashtags similar to the ones they have previously adopted. In particular, we formulate the problem of hashtag recommendation into an optimization problem and incorporate hashtag correlation weight matrix into it to account for the similarity between different hashtags. We finally leverage widely used matrix factorization from recommender systems to solve the optimization problem by capturing the latent factors of users and hashtags. Empirical experiments demonstrate that our method is capable to properly recommend hashtags.
研究の動機と目的
- プライバシー上の懸念から公開されないツイート本文の欠如にもかかわらず、Twitterにおける関連性の高いハッシュタグを推薦する課題に対処すること。
- 自然言語処理(NLP)を必要とし、計算コストが高くなる内容ベースの手法の限界を克服すること。
- ユーザーのハッシュタグ使用履歴とハッシュタグの相関関係を組み込んだ最適化問題としてハッシュタグ推薦を定式化すること。
- ユーザー行動パターンとハッシュタグの共起を活用する、軽量でコンテンツに依存しない推薦モデルを開発すること。
- ユーザーが一貫して類似したハッシュタグを採用する傾向があることから、歴史的使用履歴を用いた効果的な推薦が可能であることを実証すること。
提案手法
- ユーザーとハッシュタグの相互作用を、x_ij がユーザー i がハッシュタグ j を使用したかどうかを示す、スパースかつ低ランクな行列 X ∈ ℝ₊^{N×M} としてモデル化する。
- 観測されたと予測されたユーザー-ハッシュタグ相互作用の再構成誤差を最小化する最適化問題としてハッシュタグ推薦を定式化する。
- ハッシュタグの共起頻度に基づき、トレーニングサンプルに高い重みを割り当てる重み付き行列分解(hWMF)を組み込む。
- ハッシュタグ間の類似性を反映するためのハッシュタグ相関重み行列 W を用意し、これをツイート内での同時使用頻度から計算する。
- ユーザーおよびハッシュタグの潜在要因行列を反復的に最適化するため、交互最小自乗法(ALS)を適用する。
- ツイート本文を一切使用せずに、ユーザーおよびハッシュタグの潜在要因を低次元で学習し、潜在的な好みやトピック的関係を捉える。
実験結果
リサーチクエスチョン
- RQ1ユーザーは時間経過とともに類似したハッシュタグを採用する傾向があるか、すなわち使用行動に一貫性があるか?
- RQ2ハッシュタグの共起パターンは、推薦精度の向上に効果的に利用できるか?
- RQ3コンテンツ依存型手法と比較して、コンテンツフリーで履歴に基づく行列分解アプローチは、ハッシュタグ推薦においてどのように性能を発揮するか?
- RQ4ハッシュタグ相関を組み込むことで、推薦性能はどの程度向上するか?
- RQ5NLP やツイート類似度計算に依存せず、ユーザーのハッシュタグ使用履歴のみで学習された低ランク行列分解モデルは、競争力のある結果を達成できるか?
主な発見
- 2標本 t 検定により、ユーザーが類似したハッシュタグを採用する確率が顕著に高いことが確認され、ハッシュタグ使用行動の一貫性が裏付けられた。
- 提案された hWMF モデルは、ベースライン手法を上回る性能を示し、ハッシュタグ相関を組み込むことの有効性が実証された。
- ツイート本文を必要としないため、プライベートまたは非公開のユーザータイムラインに対しても適した、高い性能を発揮する。
- ハッシュタグ共起を重み行列として組み込むことで、モデルの一般化性能と推薦の正確性が向上した。
- 計算効率が高くスケーラブルであり、複雑な NLP パipelines や類似度計算の必要がなかった。
- トレンドハッシュタグを含むキュレートされたツイートデータセットを用いた実証的評価により、モデルがユーザー履歴と整合する関連性の高いハッシュタグを効果的に推薦できることを確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。