Skip to main content
QUICK REVIEW

[論文レビュー] A Hierarchical Location Prediction Neural Network for Twitter User Geolocation

Binxuan Huang, Kathleen M. Carley|arXiv (Cornell University)|Oct 28, 2019
Human Mobility and Location-Based Analysis参考文献 38被引用数 6
ひとこと要約

本稿では、まずユーザーの国を予測し、その結果をもとに都市レベルの位置特定をガイドする階層的場所予測ニューラルネットワーク(HLPNN)を提案する。文字に敏感な単語埋め込み、トランスフォーマー符号化器、およびマルチレベルのアテンションを統合することで、HLPNNはTwitterの場所特定ベンチマークで最先端の性能を達成し、平均誤差距離を短縮するとともに、さまざまな特徴設定において精度を向上させた。

ABSTRACT

Accurate estimation of user location is important for many online services. Previous neural network based methods largely ignore the hierarchical structure among locations. In this paper, we propose a hierarchical location prediction neural network for Twitter user geolocation. Our model first predicts the home country for a user, then uses the country result to guide the city-level prediction. In addition, we employ a character-aware word embedding layer to overcome the noisy information in tweets. With the feature fusion layer, our model can accommodate various feature combinations and achieves state-of-the-art results over three commonly used benchmarks under different feature settings. It not only improves the prediction accuracy but also greatly reduces the mean error distance.

研究の動機と目的

  • 既存のニューラルネットワークモデルが地理的位置の階層的構造(例:国 vs. 都市)を無視するという限界に対処すること。
  • OoV語や非公式な言語に対応できる文字に敏感な単語埋め込みを用いることで、ノイズの多いソーシャルメディアテキストにおける場所特定精度を向上させること。
  • 国レベルの監視信号をガイドとして用いることで、都市レベルの予測における平均誤差距離を低減すること。
  • テキスト、メタデータ、ネットワーク特徴のさまざまな組み合わせをサポートできる柔軟なモデルアーキテクチャを設計すること。

提案手法

  • モデルは2段階の階層的予測を用いる:まずユーザーの本拠国を予測し、その後その予測結果をもとに都市レベルの場所特定をガイドする。
  • 生テキストを処理する文字に敏感なCNN層が、語彙の形態的特徴を捉え、OoV語に対しても頑健な単語表現を生成する。
  • マルチヘッドアテンションを備えたトランスフォーマー符号化器が、テキスト、メタデータ、ネットワーク特徴の間のクロス特徴相関を学習する。
  • 分野レベルおよび単語レベルのアテンション機構が、各入力モodal内での顕著な特徴に焦点を当てる。
  • 国レベルと都市レベルの監視信号をバランスさせるために、学習可能な重みαを用いたマルチタスク損失関数を採用する。
  • 共有および並列なトランスフォーマー符号化器を用いて特徴統合を実現し、2つの予測ヘッドを分離しながらも、特徴間の依存関係を保持する。

実験結果

リサーチクエスチョン

  • RQ1地理的階層構造(国 → 都市)を組み込むことで、Twitterユーザーの場所特定モデルの精度と頑健性が向上するか?
  • RQ2文字に敏感な単語埋め込みは、ソーシャルメディアテキストのノイズや非公式さに対処する場所特定タスクにおいてどの程度効果的か?
  • RQ3国レベルの予測を監視信号として用いることで、都市レベルの予測における平均誤差距離が短縮されるか?
  • RQ4トランスフォーマーに基づくアテンション機構は、多様な入力モダリティ(テキスト、メタデータ、ネットワーク)間で特徴表現学習をどの程度向上させるか?
  • RQ5従来の最先端手法と比較して、本モデルはテキスト、メタデータ、ネットワークのさまざまな組み合わせの入力特徴に対してどの程度の性能を示すか?

主な発見

  • HLPNNは、3つのベンチマークデータセット(WNUT、GeoNames、Twitter-15)において、さまざまな特徴設定で最先端の性能を達成し、テキスト特徴のみを用いた場合でもWNUTで最高37.3%の精度を達成した。
  • WNUTデータセットでは平均誤差距離を1,289.4 kmまで低減し、先行手法を著しく上回った。
  • アブレーションスタディの結果、文字に敏感な単語埋め込みが性能向上に最も寄与しており、それらを含まないモデルと比較して平均誤差距離が140 km以上短縮された。
  • α = 20の国レベルの監視により、相対的国誤り率(誤って別の国に分類された都市)が26.2%から23.1%に低下し、地理的整合性の向上が示された。
  • 分野レベルのアテンションはわずかな向上しかもたらさなかった。これは、トランスフォーマー符号化器がすでに効果的に特徴間依存関係を捉えているためである。
  • テキストのみ、テキスト+メタデータ、テキスト+ネットワーク、およびフル特徴設定のすべての組み合わせにおいて、モデルは強力な性能を維持しており、その柔軟性と頑健性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。