Skip to main content
QUICK REVIEW

[논문 리뷰] A Multi-Task Benchmark for Korean Legal Language Understanding and Judgement Prediction

Wonseok Hwang, Dongjun Lee|arXiv (Cornell University)|2022. 06. 10.
Artificial Intelligence in Law인용 수 14
한 줄 요약

이 논문은 147만 건의 법적 선례, 6개의 다양한 자연어 처리 작업(분류, 판결 예측, 요약) 및 LCube 언어 모델을 포함하는, 한국어 법적 언어 이해 및 판결 예측을 위한 최초의 대규모 다중 작업 벤치마크인 LBox Open을 소개한다. 이는 한국어 법적 AI 분야에서 최신 기술 수준의 성능을 가능하게 하며, LCube가 더 작은 크기임에도 불구하고 분류 작업에서 뛰어난 성능을 보여주어 비영어 법적 체계에서의 다국어 법적 AI 연구를 위한 기반을 마련한다.

ABSTRACT

The recent advances of deep learning have dramatically changed how machine learning, especially in the domain of natural language processing, can be applied to legal domain. However, this shift to the data-driven approaches calls for larger and more diverse datasets, which are nevertheless still small in number, especially in non-English languages. Here we present the first large-scale benchmark of Korean legal AI datasets, LBOX OPEN, that consists of one legal corpus, two classification tasks, two legal judgement prediction (LJP) tasks, and one summarization task. The legal corpus consists of 147k Korean precedents (259M tokens), of which 63k are sentenced in last 4 years and 96k are from the first and the second level courts in which factual issues are reviewed. The two classification tasks are case names (11.3k) and statutes (2.8k) prediction from the factual description of individual cases. The LJP tasks consist of (1) 10.5k criminal examples where the model is asked to predict fine amount, imprisonment with labor, and imprisonment without labor ranges for the given facts, and (2) 4.7k civil examples where the inputs are facts and claim for relief and outputs are the degrees of claim acceptance. The summarization task consists of the Supreme Court precedents and the corresponding summaries (20k). We also release realistic variants of the datasets by extending the domain (1) to infrequent case categories in case name (31k examples) and statute (17.7k) classification tasks, and (2) to long input sequences in the summarization task (51k). Finally, we release LCUBE, the first Korean legal language model trained on the legal corpus from this study. Given the uniqueness of the Law of South Korea and the diversity of the legal tasks covered in this work, we believe that LBOX OPEN contributes to the multilinguality of global legal research. LBOX OPEN and LCUBE will be publicly available.

연구 동기 및 목표

  • 비영어 법적 체계, 특히 한국어에서 대규모, 다양한, 다국어 법적 AI 데이터셋의 부족을 해결하기 위해.
  • 다양한 법적 NLP 작업을 포함하는 종합적인 벤치마크를 제공하여 데이터 기반 법적 AI 모델 개발을 지원하기 위해.
  • 정련된 법적 코퍼스를 기반으로 도메인 특화 사전 훈련을 통해 고성능 법적 언어 모델링을 가능하게 하기 위해.
  • 한국 고유의 법적 구조와 작업 다양성을 반영한 벤치마크를 구축하여 다국어 법적 AI 연구를 촉진하기 위해.
  • 공개 접근 가능한 데이터셋과 명확한 라이선싱 및 유지 관리 프로토콜을 제공함으로써 학술 연구를 지원하기 위해.

제안 방법

  • 저자들은 147,000건의 한국어 사건(259M 토큰)으로 구성된 법적 선례 코퍼스를 구축하였으며, 제1심 및 제2심 법원의 판결 및 최신 판결을 포함한다.
  • 다섯 가지 핵심 NLP 작업을 설계하였으며, 사례명 및 법률 조항 분류, 형사 및 민사 법적 판결 예측, 대법원 선례 요약이다.
  • 희귀 사례 카테고리와 장문의 입력 시퀀스를 포함하도록 분류 및 요약 작업의 확장된 버전을 제작하여, 정확도와 커버리지 향상에 기여하였다.
  • LBox Open 법적 코퍼스를 기반으로 사전 훈련한 124M 및 345M 파라미터의 디코더 전용 언어 모델인 LCube를 미세조정 및 공개하였다.
  • 표준화된 평가 프로토콜을 통해 다양한 법적 NLP 작업 간의 다중 작업 학습 및 평가를 지원하는 벤치마크이다.
  • 모든 데이터셋과 모델은 GitHub를 통한 버전 관리 및 기여 메커니즘과 함께 HuggingFace를 통해 Attribution-NonCommercial-NoDerivatives 4.0 라이선스 하에 공개되었다.

실험 결과

연구 질문

  • RQ1대규모 다중 작업 벤치마크는 한국어 법적 NLP 작업에서 법적 언어 모델의 성능 향상과 일반화 능력을 향상시킬 수 있는가?
  • RQ2LCube와 같은 도메인 특화 언어 모델은 일반 목적 모델에 비해 한국어 법적 텍스트 분류 및 판결 예측 작업에서 어떻게 비교되는가?
  • RQ3희귀 카테고리와 장문의 시퀀스를 포함하는 확장된 데이터셋은 법적 AI에서 모델의 강건성과 공정성 향상에 얼마나 기여하는가?
  • RQ4더 작은 디코더 전용 모델(LCube)은 더 큰 인코더-디코더 모델(mT5 등)과 비교해 법적 분류 작업에서 유사한 성능을 달성할 수 있는가?
  • RQ5실제 법적 선례에서 유출된 개인 정보가 포함된 데이터 기반 법적 AI 모델을 사용할 경우의 한계와 위험 요소는 무엇인가?

주요 결과

  • 124M 파라미터의 디코더 전용 모델인 LCube는 사례명 및 법률 조항 분류 작업에서 더 큰 mT5 모델과 유사한 성능을 보이며, 도메인 특화 사전 훈련의 효과성을 입증한다.
  • LBox Open 벤치마크는 147,000건의 법적 선례(259M 토큰)를 포함하며, 형사 및 민사 판결 예측, 분류, 요약 등 다양한 법적 작업을 커버한다.
  • 확장된 데이터셋(Case name+, Statute+, Summarization+)은 각각 31,000건과 17,700건의 예시를 포함하여 희귀 법적 카테고리의 커버리지가 향상되었다.
  • 요약 작업은 20,000건의 대법원 선례와 요약을 포함하며, 확장된 버전(Summarization+)은 51,000건의 장문 시퀀스 예시를 포함한다.
  • LCube는 분류 작업에 대해 뛰어난 성능를 보였지만 요약 작업에선 제한된 이점이 있었으며, 이는 작업에 특화된 모델의 효과성을 시사한다.
  • 데이터셋과 모델는 HuggingFace를 통해 비영업 목적 라이선스 하에 공개되었으며, GitHub를 통한 버전 관리 및 기여 메커니즘이 제공된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.