Skip to main content
QUICK REVIEW

[論文レビュー] Globally Homogenous Mixture Components and Local Heterogeneity of Rank Data

Vartan Choulakian|arXiv (Cornell University)|Aug 17, 2016
Consumer Market Behavior and Pricing参考文献 2被引用数 4
ひとこと要約

本稿では、負のコーディングを用いたタクシーコーピアス・コレスポンデンス分析(TCA)を用いて、順位データを方向的・論理的に行う方法を提案する。この手法は、グローバルに均質な混合成分と局所的な非均一性を検出することを目的としている。グローバル均質性係数(GHC)を導入し、ブロック内順序の一貫性の程度を定量化する。実世界の2つのデータセットで、それぞれ75.32%および80.36%の均質性を達成しており、従来の距離モデルや潜在クラスモデルに比べ、小さな隠れたグループを検出する能力に優れている。

ABSTRACT

The traditional methods of finding mixture components of rank data are mostly based on distance and latent class models; these models may exhibit the phenomenon of masking of groups of small sizes; probably due to the spherical nature of rank data. Our approach diverges from the traditional methods; it is directional and uses a logical principle, the law of contradiction. We discuss the concept of a mixture for rank data essentially in terms of the notion of global homogeneity of its group components. Local heterogeneities may appear once the group components of the mixture have been discovered. This is done via the exploratory analysis of rank data by taxicab correspondence analysis with the nega coding: If the first factor is an affine function of the Borda count, then we say that the rank data are globally homogenous, and local heterogeneities may appear on the consequent factors; otherwise, the rank data either are globally homogenous with outliers, or a mixture of globally homogenous groups. Also we introduce a new coefficient of global homogeneity, GHC. GHC is based on the first taxicab dispersion measure: it takes values between 0 and 100\%, so it is easily interpretable. GHC measures the extent of crossing of scores of voters between two or three blocks seriation of the items where the Borda count statistic provides consensus ordering of the items on the first axis. Examples are provided. Key words: Preferences; rankings; Borda count; global homogeneity coefficient; nega coding; law of contradiction; mixture; outliers; taxicab correspondence analysis; masking.

研究の動機と目的

  • 従来の混合モデルでは、順位の球面的性質のため、小規模なグループが隠されがちな問題に対処すること。
  • 矛盾の法則に基づく方向的アプローチを用いて、順位データにおけるグローバルに均質な成分を検出すること。
  • 最初の軸分散とブロック間スコアのクロスオーバーに基づき、グローバル均質性を定量化する新規で解釈可能な係数GHCを導入すること。
  • グローバルに均質なグループを同定した後、高次元TCA出力を用いて局所的非均一性を探索的に検出すること。
  • 実データセットにおける小規模で明確な投票者グループを同定する点で、距離モデルや潜在クラスモデルに比べて本手法の優位性を示すこと。

提案手法

  • 各順位を逆Bordaスコアに変換することで方向感度を向上させる負のコーディングを施した順位データにタクシーコーピアス・コレスポンデンス分析(TCA)を適用する。
  • Bordaカウントを用いて最初のTCA軸に沿ったアイテムの共通順序を決定し、これがブロック分割の基準となる。
  • グローバル均質性を、最初のTCA要因がBordaカウントのアフィン関数であるという条件として定義する。これは、ブロック間のスコアクロスオーバーが存在しないことを示す。
  • 負のコーディング済みデータに対する最初のタクシーディスpersión測度を計算し、グローバル均質性係数(GHC)を導出する。GHCは0%から100%の範囲をとる。
  • 矛盾の法則を用いて、外れ値をデータポイントとしてではなく、グローバルに均質なグループの論理的一致性を破る投票者の好みとして特定する。
  • 最初のTCA軸に従ってブロックの順列を整えることで、ブロック間のスコアクロスオーバーの程度を評価し、GHCがこれを定量化する。

実験結果

リサーチクエスチョン

  • RQ1方向的・論理的アプローチは、従来の距離モデルや潜在クラスモデルに比べ、順位データにおけるグローバルに均質な成分をより効果的に検出できるか?
  • RQ2提案されたGHC係数は、特に小さな隠れたグループが存在する状況において、順位データにおけるグローバル均質性をどれほど正確に測定できるか?
  • RQ3グローバルに均質なグループを同定した後、高次元TCA出力においてどのように局所的非均一性が現れるか?
  • RQ4距離ベースやモデルベースの仮定に依存せずに、矛盾の法則を用いて順位データにおける外れ値を同定できるか?
  • RQ5標準的手法に比べ、TCAにおける負のコーディングは、球面的順位データにおける構造的レイヤーの検出をどのように改善するか?

主な発見

  • クローンの政治的目標データセットでは、16名の心理学者からなるグローバルに均質なグループがGHC 75.32%で同定され、Bordaカウントと整合する明確な共通順序が明らかになった。
  • デルベーケの家族構成データでは、68名と14名の2つのグローバルに均質なグループが検出され、それぞれGHCが75.32%および80.36%であった。従来の手法では小さなグループが隠れていたが、本手法はそれを効果的に検出できた。
  • グローバルに均質なグループでは、最初のTCA要因がBordaカウントのアフィン関数であることが確認され、理論的基盤の妥当性が裏付けられた。
  • 局所的非均一性は、高次元TCA要因において観察された。特に14名の少数グループでは、要因スコアに顕著な分散とブロック間クロスオーバーが見られた。
  • 本手法は、家族構成の好みにおいて男子優位のバイアスを効果的に同定した。TCAバイプロットでは、(i,j)が最初の軸上で常に(j,i)の左に位置していた。
  • GHC係数は解釈可能で効果的であることが示された。100%に近い値は、ブロック間のスコアクロスオーバーが少なく、ブロック内の一貫性が強いことを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。