[論文レビュー] How Predictable is Your State? Leveraging Lexical and Contextual Information for Predicting Legislative Floor Action at the State Level
本稿では、米国50州およびDCの全州にわたり、法案本文(語彙的および文脈的特徴)と議員・立法府の文脈的情報を組み合わせることで、州立法における本会議での採決の有無を予測するマルチモーダル機械学習手法を提案する。本モデルは、本文と文脈からの補完的信号を活用することで、州別ベースライン比で平均18%の精度向上を達成し、86%の精度を実現した。
Modeling U.S. Congressional legislation and roll-call votes has received significant attention in previous literature. However, while legislators across 50 state governments and D.C. propose over 100,000 bills each year, and on average enact over 30% of them, state level analysis has received relatively less attention due in part to the difficulty in obtaining the necessary data. Since each state legislature is guided by their own procedures, politics and issues, however, it is difficult to qualitatively asses the factors that affect the likelihood of a legislative initiative succeeding. Herein, we present several methods for modeling the likelihood of a bill receiving floor action across all 50 states and D.C. We utilize the lexical content of over 1 million bills, along with contextual legislature and legislator derived features to build our predictive models, allowing a comparison of the factors that are important to the lawmaking process. Furthermore, we show that these signals hold complementary predictive power, together achieving an average improvement in accuracy of 18% over state specific baselines.
研究の動機と目的
- データ不足と手続きの多様性のため、これまであまり検討されていなかった、全米50州およびDCにおける州法案が本会議で採決を経る可能性をモデル化すること。
- 法案の語彙的内容と文脈的特徴(例:発起者の属性、立法府の構造)が、本会議での採決結果にどのように統合的に影響を与えるかを調査すること。
- 多様な州立法制度において、テキスト特徴と文脈特徴、およびその組み合わせの予測性能を比較すること。
- 州レベルでの立法的進展に相関する言語的パターンと文脈的パターンを実証的に同定すること。
提案手法
- 著者らは、50州およびDCの100万件を超える州法案を収集・処理し、法案本文および立法関連メタデータから語彙的および文脈的特徴を抽出した。
- テキスト特徴には、意味的意味や政策的内容を捉えるためにTF-IDF表現および文脈的埋め込み(例:BERTベース)を含めた。
- 文脈特徴には、発起者の所属政党、職業、思想的立場、委員会所属、および州レベルの立法府構造(例:二院制、与党支配)を含めた。
- テキスト特徴と文脈特徴を統合して使用する勾配ブースティング木モデル(例:XGBoost)を訓練し、本会議での採決の可能性を予測した。
- クロスステートおよびクロスチャンバーの検証を用いてモデルを評価し、精度、AUC、F1スコアを指標にした。
- 特徴の寄与度を隔離するためにアブレーション解析を実施した。
実験結果
リサーチクエスチョン
- RQ1多様な州立法制度において、語彙的特徴と文脈的特徴がどのように統合的に本会議での採決の可能性を予測するか?
- RQ2法案本文の内容(例:政策分野、思想的トーン)が、発起者の属性などの文脈的特徴と比較して、本会議での採決予測にどの程度寄与するか?
- RQ3手続き的・政治的環境が異なる州において、テキストと文脈の相対的寄与度はどのように変化するか?
- RQ4法案本文に見られるどの言語的パターンが本会議での採決に最も予測的か、またそれらは州ごとにどのように異なるか?
- RQ5全州にわたって訓練された統一モデルは、州別ベースラインを上回る性能を示すか?
主な発見
- テキスト特徴と文脈特徴を統合したモデルは、本会議での採決予測において86%の精度を達成し、州別ベースラインを顕著に上回った。
- 語彙的および文脈的信号の統合により、州別ベースライン比で平均18%の精度向上が達成され、相補的な予測力が示された。
- テキスト特徴のみ(just_txt)が文脈特徴のみ(no_txt_spon)を上回るが、両者の組み合わせが最も優れた性能を示した。
- 予測力の高いフレーズには、手続き的・財政的用語(例:'appropriation'、'fiscal year')が多く含まれる一方、予測力が低いフレーズは教育や税額控除といった特定の政策分野に多く見られた。
- モデルは州固有の言語的パターンを同定した——例として、ニューヨーク州では医療・教育財政に注目する傾向、ペンシルベニア州では税制・公共安全関連言語が顕著で、それぞれ異なる立法的ダイナミクスを示した。
- 手続き的・政治的多様性が存在するにもかかわらず、統一されたモデリングアプローチが、高い予測的正確性を維持して全州に一般化可能であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。