Skip to main content
QUICK REVIEW

[論文レビュー] Inferring the location of authors from words in their texts

Max Berggren, Jussi Karlgren|arXiv (Cornell University)|Dec 20, 2016
Natural Language Processing Techniques参考文献 11被引用数 6
ひとこと要約

本稿では、語の使用様式から著者の地理的出自を推定する分布的意味解析アプローチを提案する。語の多峰性のある場所分布を捉えるためにガウス混合モデルを用い、場所的顕著性を示す語をフィルタリングするための「場所性閾値」を導入する。この手法はベースラインモデルを著しく上回り、重み付き重心または投票戦略によりフィルタリングされた語信号を集約することで、スウェーデン語における地域的言語的変異の検出が可能になる。

ABSTRACT

For the purposes of computational dialectology or other geographically bound text analysis tasks, texts must be annotated with their or their authors' location. Many texts are locatable through explicit labels but most have no explicit annotation of place. This paper describes a series of experiments to determine how positionally annotated microblog posts can be used to learn location-indicating words which then can be used to locate blog texts and their authors. A Gaussian distribution is used to model the locational qualities of words. We introduce the notion of placeness to describe how locational words are. We find that modelling word distributions to account for several locations and thus several Gaussian distributions per word, defining a filter which picks out words with high placeness based on their local distributional context, and aggregating locational information in a centroid for each text gives the most useful results. The results are applied to data in the Swedish language.

研究の動機と目的

  • 明示的な場所メタデータが存在しない状況で、著者の地理的出自を推定する計算的手法を開発すること。
  • 言語の語彙的・分布的特徴のみを用いて、テキストや著者の場所を特定する課題に取り組むこと。
  • 語の多峰性のある地理的分布をモデル化し、高場所性語をフィルタリングすることで、既存の場所特定手法を改善すること。
  • 豊富なテキストアノテーションを用いて、大規模かつ自動的にスウェーデン語の地域的言語的変異を検出可能にする。

提案手法

  • 語の地理的分布を、3つの成分(緯度、経度、場所性)を有するガウス混合モデルでモデル化し、多峰性のある場所信号を表現する。
  • 「場所性」とは、語の分布的文脈から導かれる、特定の地理的場所を強く示唆する度合いを指す。
  • 分布的フィルタリング処理を適用し、地理タグ付きマイクロブログ投稿における共起パターンを分析することで、高場所性語を特定する。
  • テキスト長さと頻度に基づいて決定された閾値を超える場所性スコアを持つ語のみを保持することで、テキストをフィルタリングする。
  • 2つの戦略を用いて場所情報を集約する:重み付き重心(場所性で重み付けされた語の位置の算術平均)と、50×50kmグリッド上の重み付き多数決投票。
  • モデルを地理タグ付きスウェーデン語マイクロブログ投稿(例:Twitter)で学習し、ラベルなしのブログテキストに適用して著者の場所を推定する。

実験結果

リサーチクエスチョン

  • RQ1多峰性のある地理的分布を示す語を、著者の場所推定に有効にモデル化できるか?
  • RQ2分布的文脈に基づく場所性閾値による高場所性語のフィルタリングが、場所特定性能にどのように影響するか?
  • RQ3重み付き重心または多数決投票戦略による場所信号の集約は、直接的な地名帳ベースの割り当てよりも優れた結果をもたらすか?
  • RQ4マイクロブログで学習したモデルが、ジャンルが異なるブログテキストの場所推定にどの程度転用可能か?
  • RQ5この手法は、スウェーデン語の方言間で語彙的使用の地域的変異を検出・定量できるか?

主な発見

  • 場所性に基づいた重み付き平均を用いる「フィルタード・センタロイド」モデルは、フィルタード・ボートモデルおよび地名帳ベースのベースラインよりも、場所特定精度で優れている。
  • 分布的文脈と場所性閾値による語のフィルタリングにより、使用語数が約94%削減され(元のテキストサイズの約6%に)、性能が向上した。
  • モデルは、ラベルなしのブログコーパスの38%を場所タグで豊かにし、地域的言語的変異の検出を改善した。
  • 最適な性能は場所性閾値 log T = 20 で達成され、精度・再現率のトレードオフが適切にサポートされた。
  • 本手法により、例えばスウェーデン語の方言間で「いとこの2番目」を表す語の変異といった、細粒度の語彙的使用分析が可能になった(図5で示唆)。
  • 先行研究と同等の性能を示し、マイクロブログユーザーでは160km以内の正答率が10%、米国の州レベルでは24%の正答率を達成しており、スウェーデン語テキストにおいて優れた性能を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。