[논문 리뷰] Using Large Language Models to Support Thematic Analysis in Empirical Legal Studies
이 논문은 도둑질 사건의 법원 판결문에 대한 주제 분석을 지원하기 위해 LLM 기반의 새로운 프레임워크를 제안한다. 이 프레임워크는 초기 코드 작성, 주제 탐색, 그리고 사전 레이블링 없이도 주제 분류를 수행하는 제로샷 분류를 자동화한다. GPT-4를 785건의 사실적 서술에 적용하여 고품질의 초보 코드를 생성하였으며, 전문가 피드백을 통해 향상된 결과를 도출하였다. 주제 예측에 있어서 제로샷 성능이 뛰어나 전체적으로 R@1: 0.66의 성과를 기록하였고, 이는 경험적 법학 연구에서 인덕티브 코드 작성의 속도를 높일 잠재력을 보여준다.
Thematic analysis and other variants of inductive coding are widely used qualitative analytic methods within empirical legal studies (ELS). We propose a novel framework facilitating effective collaboration of a legal expert with a large language model (LLM) for generating initial codes (phase 2 of thematic analysis), searching for themes (phase 3), and classifying the data in terms of the themes (to kick-start phase 4). We employed the framework for an analysis of a dataset (n=785) of facts descriptions from criminal court opinions regarding thefts. The goal of the analysis was to discover classes of typical thefts. Our results show that the LLM, namely OpenAI's GPT-4, generated reasonable initial codes, and it was capable of improving the quality of the codes based on expert feedback. They also suggest that the model performed well in zero-shot classification of facts descriptions in terms of the themes. Finally, the themes autonomously discovered by the LLM appear to map fairly well to the themes arrived at by legal experts. These findings can be leveraged by legal researchers to guide their decisions in integrating LLMs into their thematic analyses, as well as other inductive coding projects.
연구 동기 및 목표
- 경험적 법학 연구에서 인덕티브 코드 작성의 시간 소모 문제를 해결하기 위해 대규모 언어 모델(Large Language Models, LLMs)을 주제 분석 워크플로우에 통합한다.
- LLM이 도난 사건의 원시적 사실 서술에서 고품질의 초보 코드를 생성할 수 있는지 평가한다.
- 전문가 피드백이 LLM이 생성한 코드와 주제를 개선하는 데 얼마나 효과적인지 평가한다.
- LLM이 사전 레이블링 없이 제로샷 설정에서 주제를 자율적으로 탐색하고 분류할 수 있는지 조사한다.
- 실제 범죄법 맥락에서 LLM이 탐색한 주제와 법학 전문가가 식별한 주제 간의 일치성을 검증한다.
제안 방법
- 프레임워크는 주제 분석의 2단계와 3단계인 초보 코드 작성 및 주제 탐색 단계에 GPT-4를 통합한다.
- 초보 코드는 프롬프트 엔지니어링을 통해 생성되었으며, 이후 법학 전문가의 자연어 피드백을 통해 개선되었다.
- 주제 탐색은 생성된 코드에 대한 클러스터링 유사한 추론을 사용한 반복적인 LLM 프롬프팅을 통해 이루어졌다.
- 전문가가 정의한 주제에 대해 사실들을 제로샷 분류하여 R@1 및 R@3(재현율)을 평가하였다.
- LLM의 종단 간 성능은 LLM이 자율적으로 탐색한 주제를 법학 전문가가 수작업으로 식별한 주제와 비교하여 평가되었다.
- 주요 단계에서 전문가 감독을 적용하여 주제의 일관성과 연구 목표와의 일치도를 향상시켰다.

실험 결과
연구 질문
- RQ1RQ1: LLM은 데이터의 초보 코드 작성에 얼마나 성공적으로 수행할 수 있는가?
- RQ2RQ2: 전문가가 자연어 피드백을 통해 초보 코드의 품질을 얼마나 향상시킬 수 있는가?
- RQ3RQ3: LLM은 분석된 데이터 포인트에 대해 주제를 얼마나 성공적으로 예측할 수 있는가?
- RQ4RQ4: LLM은 자율적으로 주제를 탐색하고 분석된 데이터에 연결할 수 있는가?
주요 결과
- LLM은 도난 사건의 785건의 사실적 서술에 대해 합리적인 초보 코드를 생성하였으며, 전문가 피드백을 통해 품질이 크게 향상되었다.
- 전문가가 정의한 주제에 대해 사실을 제로샷 분류한 결과, 전체적으로 R@1은 0.66, R@3는 0.82를 기록하여 대부분의 카테고리에서 강력한 성능을 보였다.
- 주제별 성능은 다소 차이가 있었으며, GPT-4는 '에너지 도난' 주제에 대해 완벽한 제로샷 재현율(R@1 = 1.0)을 달성했고, '상점 내 도난' 주제에 대해서도 높은 성능(R@1 = 0.95)을 보였다.
- LLM은 자율적으로 8개의 주제를 탐색하였으며, 법학 전문가가 식별한 14개의 주제와 비교해 합리적인 일치도를 보였다. 일부 LLM 주제는 여러 전문가 주제를 포함하고 있었는데, 예를 들어 '상업적 환경에서의 도난' 주제가 '직장 내 도난'과 '기타 물체 파손 후 도난'을 모두 포함하고 있었다.
- 전문가가 놓친 행동 유형, 예를 들어 '체육관에서의 도난'을 LLM이 식별하여 새로운 패턴을 발견할 잠재력이 있음을 시사했다.
- 강력한 성능에도 불구하고, 일부 주제(예: '지하차도 강도' 및 '개방형 접근 장소에서의 도난')는 재현율이 낮아 미세하거나 드문 도난 유형을 포착하는 데 한계가 있음을 보여주었다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.