Skip to main content
QUICK REVIEW

[論文レビュー] The Computer-Linguistic Analysis of Socio-Demographic Profile of Virtual Community Member

Yuriy Syerov, Соломія Федушко|arXiv (Cornell University)|Jan 21, 2019
Information Systems and Technology Applications参考文献 18被引用数 12
ひとこと要約

本稿は、仮想コミュニティ参加者の言語的パターンを用いて、その社会的・人口統計的属性を推定するためのコンピュータ言語学的フレームワークを提案する。言語的特徴に基づく形式的モデルと構造的フレームワークを構築し、テキストデータから性別、年齢、職業分野の言語的・通信的指標を導出する。トレーニングベースの分類手法を用いた、自動的かつ体系的な社会的・人口統計的属性のプロファイリングのアプローチを示している。

ABSTRACT

This article considers the current problem of investigation and development of computerlinguistic analysis of socio-demographic profile of virtual community member. Webmembers' socio-demographic characteristics' profile validation based on analysis of sociodemographic characteristics. The topicality of the paper is determined by the necessity to identify the web-community member by means of computer-linguistic analysis of their information track. The formal model of basic socio-demographic characteristics of virtual communities' member is formed. The structural model of lingvo-communicative indicators of socio-demographic characteristics of the web-members and common algorithm of the formation of lingvo-communicative indicators based on processing training sample are developed. Types of the computer-linguistic analysis of indicative characteristics are studied and classifications of lingvo-communicative indicators of gender, age and sphere of activities of web-community member is established. Also, the formal model of the basic socio-demographic characteristics of web-communities' member is introduced.

研究の動機と目的

  • 仮想コミュニティ参加者のデジタルコミュニケーションから、社会的・人口統計的特徴を自動的に同定する課題に対処すること。
  • ウェブコミュニティ参加者の基本的社会的・人口統計的特徴の形式的モデルを構築すること。
  • ユーザー生成コンテンツ内の言語的パターンに基づく言語的・通信的指標の構造的モデルを確立すること。
  • トレーニングサンプルを用いて、性別、年齢、職業分野の言語的指標を分類・体系化すること。
  • オンラインコミュニティのテキストデータから言語的・通信的指標を生成する再現可能なアルゴリズムを提供すること。

提案手法

  • ユーザーのテキストから抽出した言語的特徴を用いて、社会的・人口統計的特徴の形式的モデリングを行う。
  • トレーニングサンプルのテキスト処理に基づき、言語的・通信的指標の構造的モデルを開発する。
  • 性別、年齢、職業に関連するパターンを同定するため、コンピュータ言語学的分析手法を適用する。
  • 代表的なトレーニングデータの分析を通じて、言語的指標を構造的なカテゴリーに分類する。
  • 処理済みのテキスト入力から言語的・通信的指標を形成するための共通アルゴリズムを設計する。
  • トレーニングサンプルを用いて、言語的特徴を人口統計的カテゴリーに分類するプロセスをキャリブレーションおよび検証する。

実験結果

リサーチクエスチョン

  • RQ1仮想コミュニティ参加者の言語的行動から、その社会的・人口統計的属性をどのように推定できるか?
  • RQ2性別、年齢、職業分野を同定するのに最も効果的なコンピュータ言語学的分析手法は何か?
  • RQ3社会的・人口統計的プロファイリングのため、言語的・通信的指標を体系的に分類・モデル化する方法は何か?
  • RQ4言語的特徴と社会的・人口統計的属性の関係を表現するための構造的・形式的モデルは何か?
  • RQ5テキストデータのトレーニングベース処理が、どれほど信頼できる人口統計的推論をもたらすか?

主な発見

  • 仮想コミュニティ参加者の基本的社會的・人口統計的特徴の形式的モデルが成功裏に開発された。
  • 言語的・通信的指標の構造的モデルが確立され、言語的手がかりの体系的分類が可能になった。
  • 本研究では、人口統計的推論に適したコンピュータ言語学的分析の種別を同定・分類した。
  • 性別、年齢、職業分野の言語的・通信的指標の分類システムが確立された。
  • 処理済みのトレーニングサンプルを用いた、共通アルゴリズムによる言語的・通信的指標の形成が検証された。
  • 本フレームワークは、オンラインコミュニティのテキストデータを用いた自動的かつ再現可能な社会的・人口統計的プロファイリング手法を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。