[논문 리뷰] How Predictable is Your State? Leveraging Lexical and Contextual Information for Predicting Legislative Floor Action at the State Level
이 논문은 미국 50개 주와 워싱턴 D.C. 전역의 주입법에 대한 본회의 처리 여부를 예측하기 위해 다중모달 기계학습 접근법을 제안한다. 법안 텍스트(어휘적 및 맥락적 특징)와 입법자 및 입법 기구의 맥락 데이터를 결합한다. 모델은 텍스트와 맥락의 보완적 신호를 활용하여 상태별 기준선 대비 평균 18% 향상된 86%의 정확도를 기록하며 본회의 처리 여부를 예측한다.
Modeling U.S. Congressional legislation and roll-call votes has received significant attention in previous literature. However, while legislators across 50 state governments and D.C. propose over 100,000 bills each year, and on average enact over 30% of them, state level analysis has received relatively less attention due in part to the difficulty in obtaining the necessary data. Since each state legislature is guided by their own procedures, politics and issues, however, it is difficult to qualitatively asses the factors that affect the likelihood of a legislative initiative succeeding. Herein, we present several methods for modeling the likelihood of a bill receiving floor action across all 50 states and D.C. We utilize the lexical content of over 1 million bills, along with contextual legislature and legislator derived features to build our predictive models, allowing a comparison of the factors that are important to the lawmaking process. Furthermore, we show that these signals hold complementary predictive power, together achieving an average improvement in accuracy of 18% over state specific baselines.
연구 동기 및 목표
- 모든 50개 주와 워싱턴 D.C.의 주입법이 본회의에서 다뤄질 가능성을 모델링하는 것. 이는 데이터 부족과 절차적 다양성으로 인해 연구가 부족한 과제이다.
- 법안의 어휘적 내용과 맥락적 특징(예: 제안자 특성, 입법 기구의 구조 등)이 본회의 처리 결과에 어떻게 함께 영향을 미치는지 조사하는 것.
- 다양한 주입법 체계에서 텍스트 기반 특징과 맥락적 특징, 그리고 그 조합의 예측 능력을 비교하는 것.
- 실증적으로 주 수준에서 성공적인 입법 진전과 관련된 언어적 패턴과 맥락적 패턴을 식별하는 것.
제안 방법
- 저자들은 50개 주와 워싱턴 D.C.의 100만 건 이상의 주입법을 수집하고 처리하여 법안 텍스트와 입법 메타데이터에서 어휘적 및 맥락적 특징을 추출한다.
- 텍스트 특징은 TF-IDF 표현과 맥락 임베딩(예: BERT 기반)을 포함하여 의미적 의미와 정책 내용을 포착한다.
- 맥락적 특징은 제안자 소속 정당, 직업, 이념성향, 위원회 배정, 그리고 주 수준의 입법 기구 구조(예: 이원의회제, 정당 지배)를 포함한다.
- 텍스트 및 맥락적 특징을 조합하여 본회의 처리 가능성 예측을 위한 기울기 부스팅 트리 모델(예: XGBoost)을 훈련한다.
- 정확도, AUC, F1 점수로 측정된 성능을 바탕으로 교차주 및 교차상원 검증을 통해 모델을 평가한다.
- 텍스트 전용, 맥락 전용, 조합된 특징의 기여도를 분리하기 위해 추론 분석을 수행한다.
실험 결과
연구 질문
- RQ1다양한 주입법 체계에서 어휘적 특징과 맥락적 특징이 어떻게 함께 본회의 처리 가능성 예측에 기여하는가?
- RQ2법안 텍스트 내용(예: 정책 분야, 이념적 어조)이 제안자 특성과 같은 맥락적 특징에 비해 본회의 처리 예측에 얼마나 기여하는가?
- RQ3법안 절차와 정치 환경이 다른 주들에서 텍스트와 맥락의 상대적 기여도는 어떻게 다를까?
- RQ4법안 텍스트에서 본회의 처리를 가장 잘 예측하는 언어적 패턴은 무엇이며, 이는 각 주에서 어떻게 다를까?
- RQ5모든 주에 걸쳐 훈련된 통합 모델이 본회의 처리 예측에서 상태별 기준선을 초월할 수 있는가?
주요 결과
- 텍스트와 맥락적 특징을 조합한 모델은 본회의 처리 예측에서 86%의 정확도를 기록하며, 상태별 기준선을 크게 앞서간다.
- 어휘적 신호와 맥락적 신호의 통합은 상태별 기준선 대비 평균 18% 향상된 정확도를 제공하여 상호보완적인 예측 능력을 입증한다.
- 텍스트 전용 특징(just_txt)은 맥락 전용 모델(no_txt_spon)보다 성능이 뛰어나지만, 조합된 특징이 가장 우수한 성능을 보였다.
- 상위 예측 문구는 절차적 및 재정적 언어(예: '지출', '재정 연도')를 포함하며, 저예측 문구는 일반적으로 교육 또는 세액 공제와 같은 특정 정책 주제를 다룬다.
- 모델는 뉴욕의 건강 및 교육 재정에 대한 집중, 펜실베이니아의 세제 및 공공안전 언어에 대한 강조 등 주별로 특화된 언어 패턴을 식별하여 각 주의 입법 역학적 특성을 반영한다.
- 절차적 및 정치적 다양성에도 불구하고 통합 모델링 접근법이 높은 정확도로 다양한 주들에 일반화될 수 있음을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.