[논문 리뷰] LAiW: A Chinese Legal Large Language Models Benchmark
이 논문은 기본적인 법적 NLP, 기본적인 법적 적용, 복잡한 법적 적용의 세 단계로 구성된 법적 역량을 기반으로 한 중국어 법적 대규모 언어 모델(Large Language Models, LLMs)을 평가하기 위한 최초의 종합적 벤치마크인 LAiW를 소개한다. 이 벤치마크는 법적 전용 및 일반 LLM을 포함한 8개의 모델을 평가하여, 일부 법적 LLM이 백본 모델을 능가하는 것으로 나타났지만, 작업 전반에서 최신 기술 수준 성능을 달성한 것은 오로지 ChatGPT 뿐이며, 현재 법적 LLM의 추론 능력과 정확도 향상 여전히 부족한 점을 드러낸다.
General and legal domain LLMs have demonstrated strong performance in various tasks of LegalAI. However, the current evaluations of these LLMs in LegalAI are defined by the experts of computer science, lacking consistency with the logic of legal practice, making it difficult to judge their practical capabilities. To address this challenge, we are the first to build the Chinese legal LLMs benchmark LAiW, based on the logic of legal practice. To align with the thinking process of legal experts and legal practice (syllogism), we divide the legal capabilities of LLMs from easy to difficult into three levels: basic information retrieval, legal foundation inference, and complex legal application. Each level contains multiple tasks to ensure a comprehensive evaluation. Through automated evaluation of current general and legal domain LLMs on our benchmark, we indicate that these LLMs may not align with the logic of legal practice. LLMs seem to be able to directly acquire complex legal application capabilities but perform poorly in some basic tasks, which may pose obstacles to their practical application and acceptance by legal experts. To further confirm the complex legal application capabilities of current LLMs in legal application scenarios, we also incorporate human evaluation with legal experts. The results indicate that while LLMs may demonstrate strong performance, they still require reinforcement of legal logic.
연구 동기 및 목표
- 중국어 법적 LLM에 대한 표준화되고 종합적인 평가 프레임워크의 부재를 해결하기 위해.
- 법적 역량을 세 단계로 진화시켜 기본적인 법적 NLP, 기본적인 법적 적용, 복잡한 법적 적용의 세 가지 수준으로 정의하고 체계화하기 위해.
- 벤치마크의 첫 번째 단계에서 기본적인 법적 NLP 작업에 초점을 맞춰 기존의 중국어 법적 및 일반 LLM을 평가하기 위해.
- 향후 모델 개발 및 피팅을 위해 오픈소스 평가 데이터와 지시 훈련 데이터셋을 제공하기 위해.
- 민감한 데이터를 마스킹하고 법적 전문가들이 데이터 컬렉션에 참여하여 윤리적 신뢰성을 확보하기 위해.
제안 방법
- 벤치마크는 법적 역량의 세 단계로 구성된다: 기본적인 법적 NLP(예: 텍스트 분류, 엔터티 인식), 기본적인 법적 적용(예: 법적 조항 추천), 복잡한 법적 적용(예: 사법 요약, 사건 추론).
- 법적 전문가와 AI 전문가가 협력하여 기존의 LegalAI 작업을 각 역량 수준 내에서 특정하고 평가 가능한 작업으로 재구성하고 분류했다.
- 평가의 첫 번째 단계는 기본적인 법적 NLP에 집중하며, 법적 조항 추천, 요소 인식, 사법 요약, 사건 인식 등의 작업을 포함한다.
- 평가 지표로는 정확도, F1 점수, 매튜스 상관계수(MCC), 요약 작업에 대한 ROUGE 점수를 사용한다.
- 윤리적 보호 조치를 위해 데이터셋을 구성할 때 개인 이름, 위치, 식별자 등을 마스킹하였으며, 법적 전문가들이 데이터의 적합성 여부를 검토했다.
- 향후 LLM의 법적 작업에 대한 피팅을 지원하기 위해 지시 훈련 데이터셋을 확보하였다.
실험 결과
연구 질문
- RQ1중국어 법적 LLM은 기본적인 법적 NLP 작업에서 일반 LLM 백본에 비해 어떻게 비교되는가?
- RQ2법적 조항 추천 및 사건 인식과 같은 법적 특화된 역량에서 법적 LLM은 일반 LLM보다 얼마나 향상되었는가?
- RQ3일반 목적의 LLM인 ChatGPT는 법적 데이터에 대해 피팅되지 않았음에도 불구하고, 법적 전용 LLM을 초월할 수 있는가?
- RQ4구조화된 법적 역량 평가에서 현재 법적 LLM의 주요 성능 격차는 무엇인가?
- RQ5지시 훈련과 검색 기반 증강 생성(Retrieval-Augmented Generation)은 법적 추론과 정확도 향상에 얼마나 효과적인가?
주요 결과
- ChatGPT는 모든 기본적인 법적 NLP 작업에서 최고 성능을 기록했으며, 법적 조항 추천에서 정확도 0.988, 사건 인식에서 정확도 0.989를 기록했다.
- Baichuan2와 Ziya-LLaMA는 사건 인식에서 각각 정확도 0.970과 0.947을 기록하여 여러 법적 LLM을 앞섰다.
- HanFei는 법적 데이터로 사전 훈련되었음에도 불구하고 법적 조항 추천에서 정확도가 0.169에 불과하여 도메인 사전 훈련만으로는 부족함을 시사했다.
- LawGPT는 법적 조항 추천에서 백본인 Chinese-LLaMA보다 성능이 열 劣하다(정확도 0.059 대 0.379)는 점에서 피팅 과정에서 과적합이 발생했을 가능성을 보여주었다.
- Baichuan2와 LLaMA2와 같은 일반 LLM은 요소 인식 및 사법 요약 작업에서 일부 법적 LLM보다 유사하거나 더 좋은 성능을 기록하여, 법적 특화 모델이 항상 일반 모델을 능가한다는 가정이 틀릴 수 있음을 입증했다.
- 벤치마크는 법적 LLM 중 일부만이 일반 LLM 백본을 향상시키며, ChatGPT와 같은 최신 기술 수준의 모델에 비해 여전히 뚜렷한 성능 격차가 존재한다는 점을 드러냈다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.