[論文レビュー] Multiclass Classification of Policy Documents with Large Language Models
本稿は、米国議会の法案および公聴会を21の比較的意図プロジェクト政策トピックに多クラス分類するGPT-3.5およびGPT-4の性能を評価している。人間の介入の程度を変える3つのシナリオを用いて分析した結果、正解率は58%から83%の範囲にあり、特に65%のデータでモデルが一致した場合に最高の正解率83%を達成した。これにより、スケーラブルで高精度な政策文書分析のための効率的でハイブリッドな人間とAIの共同作業が可能となる。
Classifying policy documents into policy issue topics has been a long-time effort in political science and communication disciplines. Efforts to automate text classification processes for social science research purposes have so far achieved remarkable results, but there is still a large room for progress. In this work, we test the prediction performance of an alternative strategy, which requires human involvement much less than full manual coding. We use the GPT 3.5 and GPT 4 models of the OpenAI, which are pre-trained instruction-tuned Large Language Models (LLM), to classify congressional bills and congressional hearings into Comparative Agendas Project's 21 major policy issue topics. We propose three use-case scenarios and estimate overall accuracies ranging from %58-83 depending on scenario and GPT model employed. The three scenarios aims at minimal, moderate, and major human interference, respectively. Overall, our results point towards the insufficiency of complete reliance on GPT with minimal human intervention, an increasing accuracy along with the human effort exerted, and a surprisingly high accuracy achieved in the most humanly demanding use-case. However, the superior use-case achieved the %83 accuracy on the %65 of the data in which the two models agreed, suggesting that a similar approach to ours can be relatively easily implemented and allow for mostly automated coding of a majority of a given dataset. This could free up resources allowing manual human coding of the remaining %35 of the data to achieve an overall higher level of accuracy while reducing costs significantly.
研究の動機と目的
- 指示微調整済みの大規模言語モデル(LLM)であるGPT-3.5やGPT-4を用いて、事前に定義された政策トピックに政策文書を分類する可能性と正確性を評価すること。
- 従来のコンピュータ支援テキスト分析が直面する高い導入障壁とデータ要件を克服するため、ゼロショットで利用可能でAPI経由でアクセス可能なLLMをテストすること。
- 人間の関与が最小、中程度、最大の3つのユースケースシナリオを比較し、最適な人間-AI連携戦略を特定すること。
- LLMの予測結果が人間のコード作成と組み合わせて信頼性を持って使用可能かどうか、政治学研究におけるスケーラビリティと正確性の向上を目的として評価すること。
- ゴールスタンダードの人間によるコード作成と比較し、再現性と分類の一貫性に注目して、LLMの性能に関する実証的証拠を提供すること。
提案手法
- 3つの明確に区別されたユースケースシナリオを設計した:(1) 最小限の人間入力—完全にLLMによる推論;(2) 中程度の入力—LLMの予測に人間によるレビューを追加;(3) 最大限の入力—LLMの予測に反復的な人間による修正と検証を組み込む。
- GPT-3.5 TurboおよびGPT-4は、比較的意図プロジェクトの21の政策問題トピックを、構造的で指示ベースのプロンプトを用いて分類するように指示された。
- 分類性能は標準的な自然言語処理(NLP)指標、すなわち正解率、適合率、再現率、F1スコアを用いて評価され、マクロ平均および重み付き平均が報告された。
- モデル間の合意度を分析し、両モデルが合意したデータサブセットを特定。残りの35%のデータについては、的確な人間による検証を集中して実施。
- ゴールスタンダードの人間によるコード作成と比較し、各政策トピックおよび全体の結果を報告した。
- クラス固有の性能とモデル間合意度の統計的分析を実施し、トピックごとの信頼性と一貫性を評価した。
実験結果
リサーチクエスチョン
- RQ1指示微調整済みLLM(GPT-3.5やGPT-4など)は、ファインチューニングなしで多クラス政策文書分類において十分な正確性を達成できるか?
- RQ2分類パイプラインにおける人間の関与度が、全体の正確性とコスト効率にどのように影響するか?
- RQ3LLMの個々の政策トピックにおける性能はどのようであり、どのトピックが最も・最も信頼性が低いとされるか?
- RQ4GPT-3.5とGPT-4は分類でどの程度合意しているか?また、モデル間合意度は人間の作業負荷を削減するために活用可能か?
- RQ5LLMによる初期分類と、不確実なケースに限って人間がコード作成を行うハイブリッド手法は、高い正確性を維持しながら、人的コード作業の負担を著しく削減できるか?
主な発見
- GPT-4は、最も人間が関与するシナリオ(シナリオ3)で全体の正解率が83%に達し、他の低関与シナリオを顕著に上回った。
- 最高の人間関与シナリオにおいて、モデル同士が65%のデータで合意しており、そのサブセットでは正解率が83%に達した。これは、高信頼度の予測に対して極めて高い信頼性があることを示している。
- GPT-4は、すべてのシナリオにおいてGPT-3.5を上回り、ほとんどの政策トピックでF1スコアが高く、再現率も優れていた。
- 『健康』『移民』『エネルギー』および『その他(私的法案)』といったトピックでは、F1スコアが0.85以上という最も高い正確性が達成された。
- 一方で『文化』『国際関係』『防衛』といったトピックでは、F1スコアが0.00または0.20未満にとどまり、モデルが継続的に困難を抱えていることが示された。
- 本研究は、65%のデータを高合意度のLLM予測で自動化し、残りの35%のみを人的にコード作成することで、高い正確性を維持しながら人的労働を著しく削減できるハイブリッド手法の有効性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。