[论文解读] Using Large Language Models to Support Thematic Analysis in Empirical Legal Studies
本文提出了一种由大型语言模型(LLM)驱动的新框架,通过自动化初始编码、主题发现以及对盗窃罪刑事法院判例的零样本分类,支持法律专家进行主题分析。在785个事实描述上使用GPT-4,模型生成了高质量的初始编码,并经专家反馈进一步优化,实现了强大的零样本性能(R@1: 0.66,总体表现),在预测专家识别的主题方面表现优异,展示了在实证法律研究中加速归纳编码的巨大潜力。
Thematic analysis and other variants of inductive coding are widely used qualitative analytic methods within empirical legal studies (ELS). We propose a novel framework facilitating effective collaboration of a legal expert with a large language model (LLM) for generating initial codes (phase 2 of thematic analysis), searching for themes (phase 3), and classifying the data in terms of the themes (to kick-start phase 4). We employed the framework for an analysis of a dataset (n=785) of facts descriptions from criminal court opinions regarding thefts. The goal of the analysis was to discover classes of typical thefts. Our results show that the LLM, namely OpenAI's GPT-4, generated reasonable initial codes, and it was capable of improving the quality of the codes based on expert feedback. They also suggest that the model performed well in zero-shot classification of facts descriptions in terms of the themes. Finally, the themes autonomously discovered by the LLM appear to map fairly well to the themes arrived at by legal experts. These findings can be leveraged by legal researchers to guide their decisions in integrating LLMs into their thematic analyses, as well as other inductive coding projects.
研究动机与目标
- 通过将大型语言模型(LLMs)整合到主题分析工作流程中,解决实证法律研究中归纳编码耗时过长的问题。
- 评估LLM是否能够从盗窃案件的原始事实描述中生成高质量的初始编码。
- 评估专家反馈在优化LLM生成的编码和主题方面的有效性。
- 探究LLM在无先验标注的零样本设置下,自主发现并分类主题的能力。
- 在真实的刑事法律背景下,验证LLM发现的主题与法律专家识别的主题之间的一致性。
提出的方法
- 该框架将GPT-4整合到主题分析的第2和第3阶段:初始编码与主题发现。
- 通过提示工程生成初始编码,并随后使用法律专家提供的自然语言反馈进行优化。
- 通过迭代式LLM提示,利用对生成编码的聚类式推理来发现主题。
- 使用R@1和R@3(召回率在1和3)评估事实向专家定义主题的零样本分类性能。
- 通过将LLM自主发现的主题与法律专家手动识别的主题进行比较,评估LLM的端到端性能。
- 在关键阶段应用专家监督,以提升主题的一致性与研究目标的契合度。

实验结果
研究问题
- RQ1RQ1:LLM在多大程度上能够成功完成数据的初始编码?
- RQ2RQ2:法律领域专家通过自然语言反馈,能在多大程度上提升初始编码的质量?
- RQ3RQ3:LLM在多大程度上能够成功预测分析数据点的主题?
- RQ4RQ4:LLM在多大程度上能够自主发现主题,并将其与分析数据相关联?
主要发现
- LLM为785个盗窃案件的事实描述生成了合理的初始编码,且在专家反馈后质量显著提升。
- 事实向专家定义主题的零样本分类整体达到R@1为0.66,R@3为0.82,表明在大多数类别中表现优异。
- 性能因主题而异:GPT-4在'能源盗窃'主题上实现了完美的零样本召回(R@1 = 1.0),在'商店盗窃'主题上也表现出色(R@1 = 0.95)。
- LLM自主发现了8个主题,与法律专家识别的14个主题有较合理的对应关系,其中部分LLM主题涵盖了多个专家主题(例如,'商业场所盗窃'涵盖了'工作场所盗窃'和'破坏他人物品盗窃')。
- LLM识别出了一些专家遗漏的行为,如'从健身房盗窃',表明其有潜力发现新颖的模式。
- 尽管表现优异,但部分主题(如'地下室抢劫'和'从开放获取场所盗窃')的召回率较低,表明其在捕捉细微或不常见的盗窃类型方面仍存在局限。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。