Skip to main content
QUICK REVIEW

[논문 리뷰] Globally Homogenous Mixture Components and Local Heterogeneity of Rank Data

Vartan Choulakian|arXiv (Cornell University)|2016. 08. 17.
Consumer Market Behavior and Pricing참고 문헌 2인용 수 4
한 줄 요약

이 논문은 음성 코드화를 사용한 택시카비 대응분석(TCA)을 활용한 방향성 있고 논리 기반의 방법을 제안하여 순위 데이터를 분석한다. 이 방법은 전역적으로 균일한 혼합 성분과 局소적 이질성을 탐지한다. 전역 균일성 계수(GHC)를 도입하여 블록 내 순서 일관성의 정도를 정량화하며, 두 개의 실세계 데이터셋에서 각각 75.32%와 80.36%의 균일성을 달성하여, 전통적인 거리 모델 및 잠재 클래스 모델보다 작은, 숨겨진 군집을 더 잘 탐지한다.

ABSTRACT

The traditional methods of finding mixture components of rank data are mostly based on distance and latent class models; these models may exhibit the phenomenon of masking of groups of small sizes; probably due to the spherical nature of rank data. Our approach diverges from the traditional methods; it is directional and uses a logical principle, the law of contradiction. We discuss the concept of a mixture for rank data essentially in terms of the notion of global homogeneity of its group components. Local heterogeneities may appear once the group components of the mixture have been discovered. This is done via the exploratory analysis of rank data by taxicab correspondence analysis with the nega coding: If the first factor is an affine function of the Borda count, then we say that the rank data are globally homogenous, and local heterogeneities may appear on the consequent factors; otherwise, the rank data either are globally homogenous with outliers, or a mixture of globally homogenous groups. Also we introduce a new coefficient of global homogeneity, GHC. GHC is based on the first taxicab dispersion measure: it takes values between 0 and 100\%, so it is easily interpretable. GHC measures the extent of crossing of scores of voters between two or three blocks seriation of the items where the Borda count statistic provides consensus ordering of the items on the first axis. Examples are provided. Key words: Preferences; rankings; Borda count; global homogeneity coefficient; nega coding; law of contradiction; mixture; outliers; taxicab correspondence analysis; masking.

연구 동기 및 목표

  • 순위의 구형 성격으로 인해 전통적인 혼합 모델에서 소규모 군집이 가려지는 문제를 해결하기 위해.
  • 모순의 법칙에 기반한 방향성 있는 방법을 개발하여 순위 데이터에서 전역적으로 균일한 성분을 탐지하기 위해.
  • 첫 번째 축 분산과 블록 간 점수 교차 수를 바탕으로 전역 균일성 정도를 정량화하는 새로운 해석 가능한 계수인 GHC를 도입하기 위해.
  • 전역적으로 균일한 군집을 식별한 후 고차원 TCA 출력을 통해 局소적 이질성을 탐색적으로 탐지할 수 있도록 하기 위해.
  • 실세계 데이터셋에서 소규모이고 명확한 유권자 군집을 식별하는 데 있어 거리 모델 및 잠재 클래스 모델보다 본 방법이 뛰어나다는 것을 입증하기 위해.

제안 방법

  • 각 순위를 역 Borda 점수로 변환하여 방향 감도를 향상시키는 음성 코드화된 순위 데이터에 대해 택시카비 대응분석(TCA)을 적용한다.
  • Borda 수를 사용하여 첫 번째 TCA 축을 따라 항목의 공통 순서를 결정하며, 이는 블록 분할의 기준이 된다.
  • 전역 균일성을 첫 번째 TCA 요인이 Borda 수의 애핀 함수가 되는 조건으로 정의하며, 이는 블록 간 점수 교차가 없음을 의미한다.
  • 음성 코드화된 데이터에 대해 첫 번째 택시카비 분산 측도를 계산하여 전역 균일성 계수(GHC)를 유도하며, 이는 0%에서 100% 사이의 범위를 가진다.
  • 모순의 법칙을 적용하여 이상치를 데이터 포인트로 보지 않고, 전역적으로 균일한 군집의 논리적 일관성을 위반하는 투표자의 선호를 식별한다.
  • 첫 번째 TCA 축을 기반으로 블록 순서를 정렬하여 블록 간 점수 교차의 정도를 평가하며, GHC는 이를 정량화한다.

실험 결과

연구 질문

  • RQ1기존의 거리 모델 또는 잠재 클래스 모델에 비해, 방향성 있고 논리 기반의 방법이 순위 데이터에서 전역적으로 균일한 성분을 더 효과적으로 탐지할 수 있는가?
  • RQ2소규모이고 가려진 군집이 존재하는 상황에서 제안된 GHC 계수는 전역 균일성 정도를 얼마나 정확하게 측정하는가?
  • RQ3전역적으로 균일한 군집을 식별한 후 고차원 TCA 출력에서 局소적 이질성은 어떻게 나타나는가?
  • RQ4거리 기반 또는 모델 기반 가정에 의존하지 않고도 모순의 법칙을 활용해 순위 데이터에서 이상치를 식별할 수 있는가?
  • RQ5표준 방법에 비해 TCA에서 음성 코드화가 구형 순위 데이터의 구조적 층을 어떻게 더 잘 탐지하는가?

주요 결과

  • Croon의 정치적 목표 데이터셋에서, 본 방법은 16명의 심리학자로 구성된 전역적으로 균일한 군집을 식별하였으며 GHC가 75.32%로, Borda 수와 일치하는 명확한 공통 순서를 드러냈다.
  • Delbeke의 가족 구성 데이터에서, 본 방법은 68명과 14명의 학생으로 구성된 두 개의 전역적으로 균일한 군집을 탐지하였으며, 각각 GHC 값이 75.32%와 80.36%였다. 이는 기존의 방법이 작은 군집을 가려내는 데 실패한 것과 대비된다.
  • 전역적으로 균일한 군집에서 첫 번째 TCA 요인이 Borda 수의 애핀 함수임이 확인되어, 본 방법의 이론적 기반을 뒷받침한다.
  • 고차원 TCA 요소에서 局소적 이질성이 관찰되었으며, 특히 14명의 소수 군집에서 요인 점수가 크게 산산이 흩어지고 블록 간 교차가 뚜렷하게 나타났다.
  • 본 방법은 가족 구성 선호에서 남성에 대한 편향을 성공적으로 식별하였으며, TCA 이중도에서 (i,j)가 첫 번째 축에서 항상 (j,i)의 왼쪽에 위치함으로써 이를 확인할 수 있었다.
  • GHC 계수는 이해하기 쉽고 효과적이며, 100%에 가까운 값은 블록 간 점수 교차가 최소화되고 블록 내 일관성이 강함을 나타낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.