[논문 리뷰] Legal Prompting: Teaching a Language Model to Think Like a Lawyer
본 논문은 COLIEE 과제에서 GPT-3을 사용한 법적 추론에 대해 zero-shot, few-shot, 그리고 fine-tuning 프롬프트를 평가하고, 법적 추론 프롬프트(예: IRAC 기반)가 최상의 결과를 내며 이전 COLIEE 수상자에 비해 상당한 향상을 보인다.
Large language models that are capable of zero or few-shot prompting approaches have given rise to the new research area of prompt engineering. Recent advances showed that for example Chain-of-Thought (CoT) prompts can improve arithmetic or common sense tasks significantly. We explore how such approaches fare with legal reasoning tasks and take the COLIEE entailment task based on the Japanese Bar exam for testing zero-shot/few-shot and fine-tuning approaches. Our findings show that while CoT prompting and fine-tuning with explanations approaches show improvements, the best results are produced by prompts that are derived from specific legal reasoning techniques such as IRAC (Issue, Rule, Application, Conclusion). Based on our experiments we improve the 2021 best result from 0.7037 accuracy to 0.8148 accuracy and beat the 2022 best system of 0.6789 accuracy with an accuracy of 0.7431.
연구 동기 및 목표
- 대형 언어 모델에서 프롬프트 기법이 법적 추론 작업에 미치는 영향을 조사한다.
- COLIEE 2021 및 2022 데이터를 사용하여 zero-shot, few-shot 및 fine-tuning 접근법을 평가한다.
- 표준 법적 추론(예: IRAC)을 가장 잘 포착하는 프롬프트 설계가 정확도를 향상시키는지 확인한다.
- 프롬프트 기반 방법과 COLIEE 최첨단 결과를 비교하고 연도 간 일관성을 분석한다.
제안 방법
- GPT-3 (text-davinci-002) 를 사용하여 2021 및 2022 테스트세트의 COLIEE Task 4 (entailment)을 수행한다.
- 도메인 특정 법적 추론 프롬트를 포함하거나 포함하지 않은 zero-shot 프롬프트를 평가한다.
- 변호사 시험 블로그 데이터셋에서 1, 3, 8 개의 데모를 사용하는 few-shot 프례트를 평가한다.
- binary 라벨과 설명 포함/비포함으로 GPT-3를 미세조정한다.
- ZS-CoT 프롬프트를 사용한 zero-shot을 테스트하고 두 단계 추론 프롬프트를 평가한다.
- IRAC 스타일 스키마(TRRAC, IRREAC, IRRAC 등)에서 영감을 받은 법적 추론 프롬프트를 ZS 설정에 적용한다.
- 설명 없이 지도된 프롬프트와 GPT-3 생성 설명을 사용하는 미세조정을 설명 포함 프롬프트와 비교한다.
실험 결과
연구 질문
- RQ1zero-shot, few-shot, 및 fine-tuning 프롬프트가 COLIEE 데이터에서 GPT-3가 법적 함의(entailment)를 수행하도록 하는 데 어떤 차이가 있는가?
- RQ2COLIEE 2021 및 2022에서 어떤 법적 추론 프롬프트 구조(IRAC 변형 등)가 정확도를 최대화하는가?
- RQ3미세조정 중 설명이나 합리화가 연도별로 일관되게 성능을 향상시키는가?
- RQ4프롬프트 기반 방법의 연도별 상대적 강건성은 어떠한가?
주요 결과
- Zero-shot 법적 추론 프롬프트(예: TRRAC)는 2021 COLIEE에서 0.8148 정확도처럼 상당한 향상을 달성하여 2021 수상자를 0.815 포인트 차로 능가한다.
- IRREAC 및 IRRAC 접근법은 2022 COLIEE에서 0.7156 정확도에 도달하여 2022 수상자를 0.041 포인트 차로 이긴다.
- 여덟 샷(few-shot) 프롬 prompting은 2022 데이터에서 최상의 전반적 성능인 0.7431 정확도를 달성하여 2022 수상자(0.6789)보다 0.0642 포인트 우위이다.
- 설명 있는 프롬프트를 사용한 미세조정이 다른 미세조정 구성보다 최대 약 24% 수준의 상대적 이득을 2021 테스트 세트에서 제공한다.
- GPT-3는 프롬프팅 모드 전반에서 설명을 생성할 수 있지만, 외부 설명 없이 지도 프롬프트로 미세조정하는 것이 종종 최선의 성과를 보인다.
- few-shot 접근은 zero-shot 프롬프트에 비해 연도 간에 더 일관된 이득을 제공하며, 연도별로 특정 우위가 나타나는 zero-shot 프롬프트보다 더 일반화된 성능을 보인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.