[논문 리뷰] Legal Summarisation through LLMs: The PRODIGIT Project
이 논문은 대규모 언어 모델, 특히 GPT-4를 활용하여 이탈리아 재정법원 판결에 대한 고급 문제 기반 요약을 생성하는 PRODIGIT 프로젝트를 제시한다. 전문가 평가에서 전통적인 NLP 도구보다 우수한 성능을 보였으며, 미세조정 없이 프롬프트 엔지니어링을 통해 법적 문제, 판결 기준 및 키워드를 효과적으로 추출할 수 있음을 입증하여, 공개 접근이 가능하고 검색 가능한 판례 데이터베이스의 길을 열어 놓았다.
We present some initial results of a large-scale Italian project called PRODIGIT which aims to support tax judges and lawyers through digital technology, focusing on AI. We have focused on generation of summaries of judicial decisions and on the extraction of related information, such as the identification of legal issues and decision-making criteria, and the specification of keywords. To this end, we have deployed and evaluated different tools and approaches to extractive and abstractive summarisation. We have applied LLMs, and particularly on GPT4, which has enabled us to obtain results that proved satisfactory, according to an evaluation by expert tax judges and lawyers. On this basis, a prototype application is being built which will be made publicly available.
연구 동기 및 목표
- 법률 전문가들이 활용할 수 있도록 이탈리아 재정법원 판결을 자동으로 요약하는 시스템을 개발하기 위해.
- GPT-4와 같은 대규모 언어 모델(LLM)이 전통적인 NLP 방법과 비교하여 법적 요약에서 얼마나 효과적인지 평가하기 위해.
- 법적 문제, 판결 기준 및 키워드와 같은 법적으로 의미 있는 정보를 사법 판결문에서 추출하기 위해.
- 전문가 검토 및 일반 대중이 접근할 수 있는 AI 기반 요약을 포함한 세금법 사건에 대한 프로토타입 애플리케이션을 구축하기 위해.
- 문제 기반 요약이 판례 데이터베이스 색인 및 검색에 어떻게 기여할 수 있는지 타당성을 평가하기 위해.
제안 방법
- 기존 통계적 NLP 도구와 최신 LLM을 모두 활용한 추출적 요약 및 개괄적 요약 기법을 융합한 하이브리드 접근법을 채택하였다.
- GPT-4를 사용하여 문제 기반 요약을 생성하기 위해 맞춤형 프롬프트를 설계하였으며, 법적 문제와 해당 판결 기준에 중점을 두었다.
- 법적 관련성과 정밀도를 확보하기 위해 프롬프트 엔지니어링을 활용해 키워드 및 텍스트 조각을 추출하였다.
- 공식 평가에 앞서 전문 재정법률사들의 피드백을 통해 프롬프트를 반복적으로 개선하였다.
- 추출된 법적 문제와 키워드를 바탕으로 개념적 그래프를 구축하여 판례 데이터베이스의 의미적 색인화를 가능하게 하였다.
- 두 단계 평가 절차를 통해 출력 결과를 평가하였다: 전문가 법적 검토 및 윤리위원회 심의를 거친 설문지를 통한 언어적 품질, 완전성 및 정확성 평가.

실험 결과
연구 질문
- RQ1GPT-4와 같은 대규모 언어 모델이 미세조정 없이도 이탈리아 재정법원 판결에 대해 법적으로 의미 있는 고급 요약을 생성할 수 있는가?
- RQ2법률 전문가의 관점에서 볼 때, LLM 기반의 개괄적 요약은 기존 NLP 도구에 비해 정확성과 사용성 측면에서 어떻게 비교되는가?
- RQ3문제 기반 요약은 의미적 색인화를 통해 판례 데이터베이스의 검색 가능성과 접근성을 얼마나 향상시킬 수 있는가?
- RQ4LLM을 활용한 신뢰성 있고 일관된 법적 요약을 달성하기 위해 프롬프트 엔지니어링이 수행하는 역할은 무엇인가?
- RQ5전문가의 인간 감시는 AI 기반 법적 요약의 신뢰성과 정교함을 어떻게 향상시킬 수 있는가?
주요 결과
- 전문 재정법원 판사 및 변호사들의 평가에서 GPT-4가 생성한 문제 기반 요약은 언어적 품질, 완전성 및 정확성 측면에서 뛰어난 것으로 평가되었다.
- 가장 효과적인 요약 방식은 명시적으로 법적 문제와 해당 판결 기준을 제시하는 문제 기반 요약이었다.
- 모델 미세조정 없이도 프롬프트 엔지니어링만으로도 전문가 기준을 충족하는 결과를 도출하였으며, 이는 법적 요약 분야에서 LLM의 강력한 제로샷 성능을 시사한다.
- 전문가 평가 결과, LLM 기반 요약은 관련성 및 통일성 포함 모든 평가 차원에서 기존 NLP 도구를 뛰어넘는 성능을 보였다.
- 본 프로젝트는 LLM이 의미 있는 법적 문제와 키워드를 효과적으로 추출할 수 있음을 입증하였으며, 이는 판례 색인화를 위한 개념적 그래프 구축에 기여하였다.
- 전문가가 AI 기반 요약을 검토하고 보완할 수 있도록 하는 프로토타입 애플리케이션을 개발 중이며, 이는 공개 배포 이전에 품질과 신뢰성을 확보하기 위한 조치이다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.