[논문 리뷰] LLM vs. Lawyers: Identifying a Subset of Summary Judgments in a Large UK Case Law Dataset
이 논문은 영국 대법원 판례 코퍼스에서 요약 판결을 식별하기 위한 关건어 기반 및 대규모 언어 모델(LLM) 기반 방법의 비교 평가를 제안한다. 356,011宗의 케임브리지 법학 코퍼스를 사용하여, LLM(Claude 2)이 가중 F1 스코어 0.94를 기록하며 관건어 방법(F1: 0.78)을 뛰어넘는 것으로 입증되었으며, 시간적 및 관할권 분석을 위한 3,102건의 요약 판결 사례를 추출하였다.
To undertake computational research of the law, efficiently identifying datasets of court decisions that relate to a specific legal issue is a crucial yet challenging endeavour. This study addresses the gap in the literature working with large legal corpora about how to isolate cases, in our case summary judgments, from a large corpus of UK court decisions. We introduce a comparative analysis of two computational methods: (1) a traditional natural language processing-based approach leveraging expert-generated keywords and logical operators and (2) an innovative application of the Claude 2 large language model to classify cases based on content-specific prompts. We use the Cambridge Law Corpus of 356,011 UK court decisions and determine that the large language model achieves a weighted F1 score of 0.94 versus 0.78 for keywords. Despite iterative refinement, the search logic based on keywords fails to capture nuances in legal language. We identify and extract 3,102 summary judgment cases, enabling us to map their distribution across various UK courts over a temporal span. The paper marks a pioneering step in employing advanced natural language processing to tackle core legal research tasks, demonstrating how these technologies can bridge systemic gaps and enhance the accessibility of legal information. We share the extracted dataset metrics to support further research on summary judgments.
연구 동기 및 목표
- 대규모 영국 법원 판례 코퍼스 내에서 요약 판결 사례를 효율적으로 식별하는 데 도전하는 것.
- 기존의 관건어 기반 검색과 새로운 LLM 기반 분류 접근법의 효과성을 비교하는 것.
- 영국 법원과 시간에 걸쳐 분석 가능한 3,102건의 요약 판결 사례 데이터셋을 추출하고 분석하는 것.
- 고급 NLP 기법이 법적 정보 접근성을 향상시키고 계산 기반 법학 연구를 지원하는 데 어떻게 기여할 수 있는지 보여주는 것.
제안 방법
- 연구는 356,011건의 영국 법원 판결로 구성된 케임브리지 법학 코퍼스를 사용한다.
- 전문가가 생성한 용어와 논리 연산자를 사용하여 요약 판결을 식별하는 관건어 기반 방법을 개발한다.
- 콘텐츠 기반 프롬프트를 사용하여 Claude 2 모델을 활용한 LLM 기반 방법을 적용하여 사례를 요약 판결로 분류한다.
- LLM는 사례의 내용이 요약 판결의 특성(예: 절차적 최종성, 심리 없음 등)을 갖추고 있는지 평가하도록 프롬프트된다.
- 성능 평가는 보류된 테스트 세트를 사용하여 가중 F1 스코어로 평가된다.
- 최종적으로 3,102건의 사례로 구성된 데이터셋은 영국 법원 간 분포 및 시간 경과에 따른 분석을 위해 분석된다.
실험 결과
연구 질문
- RQ1LLM 기반 접근법이 영국 법원 판례 내 요약 판결 식별에서 기존의 관건어 기반 검색을 능가할 수 있는가?
- RQ2관건어 기반 및 LLM 기반 분류 간의 성능 차이는 미묘한 법적 언어 표현을 포괄하는 데 얼마나 다른가?
- RQ3다양한 영국 법원과 시간 경과에 따라 요약 판결의 분포는 어떻게 변화하는가?
- RQ4LLM는 법적 정보 검색에서 반복적 개선이 필요한 정도를 어느 정도 감소시킬 수 있는가?
주요 결과
- LLM 기반 방법은 가중 F1 스코어 0.94를 기록하여 관건어 기반 방법의 F1 스코어 0.78를 뚜렷이 뛰어넘었다.
- 관건어 기반 방법은 반복적인 개선을 거친 후에도 법적 언어의 미묘한 언어적 뉘앙스를 포착하지 못했다.
- LLM는 356,011건의 사례 코퍼스에서 3,102건의 요약 판결 사례를 성공적으로 식별했다.
- 추출된 데이터셋은 영국 법원 간 및 시간 경과에 따른 요약 판결의 분석을 가능하게 한다.
- 본 연구는 LLM가 법적 정보 검색의 격차를 효과적으로 메우고 접근성을 향상시킬 수 있음을 입증한다.
- 저자들은 향후 요약 판결 연구를 지원하기 위해 데이터셋과 메트릭스를 공개한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.