[논문 리뷰] Lawyer LLaMA Technical Report
Lawyer LLaMA는 중국 법률 도메인에 LLaMA를 적용하기 위해 법률 데이터에 대한 지속적 사전 학습, 전문가 주도형 감독 미세조정, 그리고 관련 법률 기사를 검색하는 회수 모듈을 통해 환각을 줄이고 도메인 추론을 향상시킨다.
Large Language Models (LLMs), like LLaMA, have exhibited remarkable performance across various tasks. Nevertheless, when deployed to specific domains such as law or medicine, the models still confront the challenge of a deficiency in domain-specific knowledge and an inadequate capability to leverage that knowledge to resolve domain-related problems. In this paper, we propose a new framework to adapt LLMs to specific domains and build Lawyer LLaMA, a legal domain LLM, based on this framework. Specifically, we inject domain knowledge during the continual training stage and teach the model to learn professional skills using properly designed supervised fine-tuning tasks. Moreover, to alleviate the hallucination problem during the model's generation, we add a retrieval module and extract relevant legal articles before the model answers any queries. When learning domain-specific skills, we find that experts' experience is much more useful than experiences distilled from ChatGPT, where hundreds of expert-written data outperform tens of thousands of ChatGPT-generated ones. We will release our model and data.
연구 동기 및 목표
- 도메인별 지식의 도입이 일반적 학습 한계를 넘어서는 법학과 같은 도메인 특화 지식 적응의 필요성을 보여주기.
- 도메인 지식을 주입하고 전문가 지원 지도 학습으로 전문 도메인 기술을 학습시키며 검색 모듈로 근거를 보강하는 3단계 프레임워크를 제안하기.
- 전문가가 제작한 데이터가 도메인별 기술 학습에서 ChatGPT 생성 데이터보다 더 나은 성능을 보일 수 있음을 입증하기.
- 검색 기반 근거가 법률 환각을 줄이고 응답의 신뢰성을 향상시킨다는 점을 보여주기.
제안 방법
- 중국 법률 코퍼스와 일반 도메인 텍스트를 지속적으로 사전 학습시켜 지식을 주입하고 망각을 방지하기.
- 전문가가 작성한 사법시험 데이터 및 법적으로 기반이 되는 과제에 대해 지도 학습 미세조정을 통해 전문 법률 기술 학습하기.
- 일반적인 능력을 향상시키기 위한 지시 학습 데이터를 사용한 트레이닝 후, 법률 도메인 과제(Judicial Examination 변형, 법률 상담 등)로 미세조정하기.
- 최대 세 개의 관련 법률 조항을 검색하고 이를 바탕으로 불필요한 정보를 걸러내도록 모델을 훈련시키는 회수 모듈로 응답을 보강하기.
- 훈련 중에 무관한 기사에 노출시켜 유용한 입력과 소음 입력을 구분하는 능력을 가르치기.
- 법률 도메인 과제(Charge Prediction, JE-M) 및 일반 도메인 벤치마크(C3, CMNLI, SciQ, PIQA)에 대한 자동 지표로 평가하기.
- 법률 기사와 관련된 환각 유형을 평가하고 회수가 이러한 환각을 줄이는지의 영향을 측정하기.
실험 결과
연구 질문
- RQ1도메인 특화 사전 학습과 전문가가 작성한 SFT가 중국어 LLM의 법률 작업 성능을 향상시킬 수 있는가?
- RQ2검색 기반 접근 방식이 법률 응답의 환각을 줄이고 신뢰성을 향상시키는가?
- RQ3도메인 특화 지식과 추론을 가장 잘 가르치는 SFT 데이터의 유형과 규모(전문가 글쓰기 vs. ChatGPT 생성)는 무엇인가?
- RQ4도메인 지식을 주입하는 것이 법률 영역 외의 일반 NLP 작업에 영향을 미치는가?
주요 결과
- 중국 법률 코퍼스에 대한 지속적 사전 학습은 법률 과제(CP 및 JE-M)에서 큰 이점을 제공하며, s1이 s0보다 가장 큰 개선을 보인다.
- 전문가가 작성한 사법시험 데이터(JE-Expert)가 ChatGPT 생성 데이터보다 전문 법률 기술 학습에 더 효과적이며, ChatGPT로 증류된 데이터셋이 더 큰 경우에도 마찬가지이다.
- 회수 보강 입력은 비회수 기법에 비해 법률 조항에 대한 환각을 크게 줄이지만, 회수는 완벽하지 않으며 소음을 도입할 수 있다.
- 훈련 중에 무관한 기사를 추가하면 유용한 검색 결과를 선별하는 능력이 향상되어 중복 및 주제 벗어난 응답을 줄일 수 있다.
- 법률 지식 주입이 일반 도메인 작업 성능을 해치지 않으며, 표적 미세조정과 결합하면 CMNLI와 같은 추론 관련 NLP 작업도 향상될 수 있다.
- 모델 변종은 도메인 지식 및 SFT 데이터로 학습될 때 도메인 특화(CP, JE-M)와 여러 일반 벤치마크에서 상당한 개선을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.