Skip to main content
QUICK REVIEW

[논문 리뷰] Scaling Text with the Class Affinity Model

Patrick O. Perry, Kenneth Benoit|arXiv (Cornell University)|2017. 10. 24.
Authorship Attribution and Profiling인용 수 5
한 줄 요약

이 논문은 '정부'와 '반대' 사이의 스펙트럼에서 잠재적 이념적 위치를 분류하는 것이 아니라, '정부'와 '반대' 사이의 연속적 잠재적 위치를 추정하는 확률적 텍스트 스케일링 프레임워크인 클래스 애니티 모델을 제안한다. 단어 수준에서 극단적 대비에 대한 친화도를 모델링하고 문장 수준의 블록 부트스트랩을 사용하여 불확실성의 정도를 측정함으로써, 투표나 정당 소속으로는 드러나지 않는 아일랜드 다일의 의원들 사이의 미묘한 이념적 차이를 드러낸다 — 특히 후방의원들과 정당 지도자들 사이에서 특히 두드러진다.

ABSTRACT

Probabilistic methods for classifying text form a rich tradition in machine learning and natural language processing. For many important problems, however, class prediction is uninteresting because the class is known, and instead the focus shifts to estimating latent quantities related to the text, such as affect or ideology. We focus on one such problem of interest, estimating the ideological positions of 55 Irish legislators in the 1991 Dáil confidence vote. To solve the Dáil scaling problem and others like it, we develop a text modeling framework that allows actors to take latent positions on a "gray" spectrum between "black" and "white" polar opposites. We are able to validate results from this model by measuring the influences exhibited by individual words, and we are able to quantify the uncertainty in the scaling estimates by using a sentence-level block bootstrap. Applying our method to the Dáil debate, we are able to scale the legislators between extreme pro-government and pro-opposition in a way that reveals nuances in their speeches not captured by their votes or party affiliations.

연구 동기 및 목표

  • 전통적인 텍스트 분류의 한계를 해결하기 위해, 정당이나 투표와 같은 클래스 레이블이 알려져 있더라도 이를 정보가 없는 것으로 간주하고, 연설 텍스트에서 잠재적 이념적 위치를 추정하는 데 초점을 맞춘다.
  • 이념적 위치를 '정부'와 '반대' 사이의 연속적 잠재적 특성으로 모델링하고, 이는 이산적 클래스 소속보다 더 나은 방식이다.
  • 높은 정당 규율에도 불구하고, 주로 지도자 연설과 같은 앵커 텍스트를 활용한 지도 학습을 통해 의원들의 연설을 의미 있는 방식으로 스케일링할 수 있는 방법을 개발한다.
  • 문장 수준의 블록 부트스트랩을 사용하여 스케일링 추정치의 불확실성을 측정함으로써 모델의 강건성과 해석 가능성 향상.
  • 1991년 아일랜드 다일 회의 논의에 대한 전문가 정치 지식과의 일치를 통해 모델 결과를 검증한다.

제안 방법

  • 모델는 나이브 베이즈에 영감을 받은 확률적 프레임워크를 사용하여, 기준 연설에서의 공시도 패atters를 기반으로 각 단어가 '정부' 또는 '반대'에 대해 잠재적 친화도 점수를 가진다.
  • 각 연설자의 이념적 위치는 그들의 연설에서 단어의 빈도와 분포를 기반으로 유도된 가중치를 사용해 단어 친화도의 가중 평균으로 추정된다.
  • 모델는 문장 수준의 블록 부트스트랩을 통해 문장을 재표본화하고, 추정된 스케일링 위치의 불확실성을 측정한다.
  • 단어의 영향력은 각 단어가 연설자의 추정된 위치를 얼마나 변화시키는지 평가하여 측정되며, 이는 모델 적합도의 검증에 기여한다.
  • 이 방법은 지도자 연설을 앵커로 사용하여 후방의원들의 스케일링을 校정하는 방식으로 1991년 아일랜드 다일 회의 연설에 적용된다.
  • 모델의 단순성 덕분에 분석적 유연성과 기존의 사전 기반 스케일링 및 워드스코어와 같은 방법과의 연결이 가능하다.

실험 결과

연구 질문

  • RQ1의원들의 투표 행동이 정당 소속으로 완전히 예측 가능한 상황에서, 그들의 투표 행동이 아니라 연설 텍스트만으로도 잠재적 이념적 위치를 어떻게 추정할 수 있는가?
  • RQ2텍스트만으로도 정당 레이블이나 투표로는 포착되지 않는 의회 의원들 사이의 미묘한 이념적 차이를 얼마나 드러낼 수 있는가?
  • RQ3재표본화 기법을 사용하여 개별 의원의 추정된 이념적 스케일링의 불확실성을 어떻게 측정할 수 있는가?
  • RQ4어느 단어가 의원의 추정된 이념적 위치에 가장 크게 영향을 미치는가? 이러한 단어들은 전문가 정치 지식과 일치하는가?
  • RQ5정치적 극성에 대한 사전 사전이 없는 맥락에서, 클래스 애니티 모델이 기존의 사전 기반 스케일링보다 뛰어난 성능을 보일 수 있는가?

주요 결과

  • 클래스 애니티 모델은 아일랜드 다일 55명의 의원들에 대해 연속적인 이념적 위치를 성공적으로 추정하였으며, 같은 정당 내에서도 정부 및 반대 친화도에 상당한 변동이 있음을 드러냈다.
  • 파이아나 파일 후방의원들은 당 지도자들보다 정부 친화도가 낮았으며, 이는 그들의 연설에서 더 비판적 또는 중도적 입장을 반영하고 있었다.
  • 파이아나 파일 후방의원 중 노런, 캐울리모어, 코완은 극단적인 정부 친화도 점수를 보였으며, 코완은 이후 수상이 되어 정당 지도부와의 일치를 보였다.
  • 반대편에서는 파인 걸의 가렛 히츠제럴드와 피터 버리가 정부에 대한 강력한 경제적 비판을 제기하여, 도덕적 비난이 아닌 정책 기반의 반대를 반영하고 있었다.
  • 노동당의 티디 파트 래비트는 가장 높은 반대 친화도를 보였으며, 수상에 대한 개인적 공격이 담긴 연설을 통해 전문가 정치 분석과 일치했다.
  • 모델의 단어 영향력 분석은 부패, 성과, 인격과 관련된 어휘가 이념적 스케일링의 주요 동력임을 확인하였으며, 이는 모델의 해석 가능성에 대한 검증을 제공했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.