Skip to main content
QUICK REVIEW

[論文レビュー] Leveraging Large Language Models for Topic Classification in the Domain of Public Affairs

Alejandro Peña, Aythami Morales|arXiv (Cornell University)|Jun 5, 2023
Computational and Text Analysis Methods参考文献 19被引用数 4
ひとこと要約

本稿では、ファインチューニングされた大規模言語モデル(LLM)とハイブリッド分類器を用いて、スペイン語の公共政策文書のマルチラベルトピック分類システムを提案する。RoBERTaベースのLLMとSVM分類器を組み合わせることで、特に低データ環境下でも優れた性能を示しており、ニューラルネットワークやランダムフォレストを上回り、クラスの不均衡があるにもかかわらず、大多数のトピックでF1スコアが80%を超える。

ABSTRACT

The analysis of public affairs documents is crucial for citizens as it promotes transparency, accountability, and informed decision-making. It allows citizens to understand government policies, participate in public discourse, and hold representatives accountable. This is crucial, and sometimes a matter of life or death, for companies whose operation depend on certain regulations. Large Language Models (LLMs) have the potential to greatly enhance the analysis of public affairs documents by effectively processing and understanding the complex language used in such documents. In this work, we analyze the performance of LLMs in classifying public affairs documents. As a natural multi-label task, the classification of these documents presents important challenges. In this work, we use a regex-powered tool to collect a database of public affairs documents with more than 33K samples and 22.5M tokens. Our experiments assess the performance of 4 different Spanish LLMs to classify up to 30 different topics in the data in different configurations. The results shows that LLMs can be of great use to process domain-specific documents, such as those in the domain of public affairs.

研究の動機と目的

  • 規制変更の影響を受ける市民や企業のための、公共政策文書の自動分析を改善すること。
  • 限られたラベル付きデータを伴うスペイン語立法テキストにおけるマルチラベルトピック分類の課題に対処すること。
  • 最近のスペイン語LLMおよびハイブリッドモデル(LLM + 分類器)が、公共政策文書の分類にどの程度効果的であるかを評価すること。
  • NLPとドキュメントレイアウト分析を活用した、規制変更の監視にスケーラブルなパイプラインを開発すること。
  • 公共行政分野におけるドメイン特化型トピック分類に最適なLLMと分類器の組み合わせを同定すること。

提案手法

  • 正規表現駆動のアノテーションツールを用いて、2年間にわたりスペイン議会の政策提言から33,000件を超えるマルチラベル付きスペイン語の公共政策文書コーパスを収集した。
  • データセットの前処理とキュレートを行い、分野の専門家がアノテートした全385件のトピックから、頻度が上位30件のトピックを選定した。
  • テキスト理解と埋め込み生成のため、3つのRoBERTaベースのエンコーダーモデルと1つの生成的LLMをファインチューニングした。
  • LLMの埋め込みと、ニューラルネットワーク、ランダムフォレスト、SVMの3つの分類器を組み合わせ、マルチラベルトピック分類を実施した。
  • LLM処理の前段階として、ランダムフォレストを用いたドキュメントレイアウト分析(DLA)を実施し、意味的なテキストブロックを抽出した。
  • 3モジュール構成のシステムを採用:ウェブハーヴェスタ、ブロック分類用のDLAモジュール、およびトピック推論用のLLMベースのテキスト処理モジュール。

実験結果

リサーチクエスチョン

  • RQ1限られた学習データを伴う公共政策文書におけるスペイン語LLMのマルチラベルトピック分類の有効性はいかほどか?
  • RQ2この分野におけるトピック分類のパフォーマンスを最も高めるLLMと下流分類器の組み合わせは何か?
  • RQ3クラスの不均衡と低サンプルサイズが、さまざまなLLMベースの分類設定のパフォーマンスに与える影響は?
  • RQ4ニューラルネットワークやランダムフォレストと比較して、SVMは低リソーストピック分類においてネガティブクラスへのバイアスを軽減できるか?
  • RQ5ゼロショットまたはフェイシングトピック分類タスクにおいて、RoBERTaベースのモデルは生成的LLMをどの程度上回るか?

主な発見

  • SVM分類器とRoBERTa-base埋め込みを組み合わせたモデルは、全トピックで最高のTPR(真正陽性率)を達成し、特に2,000件未満のサンプルでさえも、平均TPRが大多数のトピックで80%を超えた。
  • ランダムフォレスト分類器は、特にリソースが限られたトピックで低性能を示し、クラスの不均衡と埋め込み空間における一般化能力の低さにより、しばしばネガティブクラスのみを予測した。
  • ニューラルネットワーク分類器は、リソースが豊富なトピックではSVMと同等の性能を示したが、低データ環境では高い分散と低い耐性を示した。
  • SVM-RoBERTaの組み合わせは、2,000件未満のサンプルのトピックにおいて、ランダムフォレストやニューラルネットワークと比較して、ネガティブクラスへのバイアスを低減した。
  • トピック15では、SVMモデルが70%のTPRを達成したのに対し、RoBERTa-NNモデルは61%のTPRにとどまり、不均衡データの処理能力に優れていることが示された。
  • 結果から、公共政策分野における低リソース、マルチラベル分類タスクにおいて、SVMはニューラルネットワークやランダムフォレストよりもLLM埋め込みのファインチューニングに有効であると示唆される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。