[论文解读] Leveraging Large Language Models for Topic Classification in the Domain of Public Affairs
本文提出了一种基于微调大型语言模型(LLMs)和混合分类器的西班牙语公共事务文档多标签主题分类系统。结果表明,基于RoBERTa的LLMs结合SVM分类器在低数据环境下表现尤为出色,优于神经网络和随机森林模型,在大多数主题上的F1分数超过80%,即使存在类别不平衡问题。
The analysis of public affairs documents is crucial for citizens as it promotes transparency, accountability, and informed decision-making. It allows citizens to understand government policies, participate in public discourse, and hold representatives accountable. This is crucial, and sometimes a matter of life or death, for companies whose operation depend on certain regulations. Large Language Models (LLMs) have the potential to greatly enhance the analysis of public affairs documents by effectively processing and understanding the complex language used in such documents. In this work, we analyze the performance of LLMs in classifying public affairs documents. As a natural multi-label task, the classification of these documents presents important challenges. In this work, we use a regex-powered tool to collect a database of public affairs documents with more than 33K samples and 22.5M tokens. Our experiments assess the performance of 4 different Spanish LLMs to classify up to 30 different topics in the data in different configurations. The results shows that LLMs can be of great use to process domain-specific documents, such as those in the domain of public affairs.
研究动机与目标
- 提升公民和受监管变化影响的企业对公共事务文档的自动分析能力。
- 解决在标注数据有限的情况下,对西班牙语立法文本进行多标签主题分类的挑战。
- 评估近期西班牙语LLMs以及混合模型(LLM + 分类器)在公共事务文档分类中的有效性。
- 开发一种可扩展的流水线,利用自然语言处理和文档版面分析来监测监管变化。
- 识别在公共管理领域特定主题分类任务中,最优的LLM与分类器组合。
提出的方法
- 使用基于正则表达式的标注工具,从两年内西班牙议会提案中收集了超过33,000份多标签公共事务文档的西班牙语语料库。
- 对数据集进行预处理和筛选,从领域专家标注的385个主题中选取了30个最常见主题。
- 对三种基于RoBERTa的编码器模型和一种生成式LLM进行微调,以实现文本理解与嵌入生成。
- 将LLM嵌入与三种分类器(神经网络、随机森林、SVM)结合,用于多标签主题分类。
- 使用随机森林进行文档版面分析(DLA),在LLM处理前提取语义文本块。
- 采用三模块系统:网络爬虫模块、用于块分类的DLA模块,以及基于LLM的文本处理模块以实现主题推理。
实验结果
研究问题
- RQ1在训练数据有限的情况下,西班牙语LLMs在公共事务文档多标签主题分类中的有效性如何?
- RQ2在该领域中,哪种LLM与下游分类器的组合能实现最佳性能?
- RQ3类别不平衡和样本量少如何影响不同基于LLM的分类设置的性能?
- RQ4与神经网络和随机森林相比,SVM能否在低资源主题分类中减轻对负类的偏见?
- RQ5在零样本或少样本主题分类任务中,基于RoBERTa的模型在多大程度上优于生成式LLMs?
主要发现
- SVM分类器与RoBERTa-base嵌入结合,在所有主题中均实现了最高的真正例率(TPR),多数主题的平均TPR超过80%,即使样本数少于2,000份。
- 随机森林分类器表现较差,尤其在低资源主题上,常因类别不平衡和在嵌入空间中泛化能力差而仅预测负类。
- 神经网络分类器在高资源主题上与SVM表现相当,但在低数据环境下表现出更高的方差和更低的鲁棒性。
- 与随机森林和神经网络相比,SVM-RoBERTa组合在样本数少于2,000份的主题中,对负类的偏见更小。
- 对于主题15,SVM模型实现了70%的TPR,显著优于RoBERTa-NN模型的61% TPR,表明其在处理不平衡数据方面更具优势。
- 结果表明,SVM在公共事务领域低资源、多标签分类任务中,对LLM嵌入进行微调时,比神经网络和随机森林更为有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。