Skip to main content
QUICK REVIEW

[논문 리뷰] Caseformer: Pre-training for Legal Case Retrieval Based on Inter-Case Distinctions

Weihang Su, Qingyao Ai|arXiv (Cornell University)|2023. 11. 01.
Artificial Intelligence in Law인용 수 4
한 줄 요약

이 논문은 인간이 레이블링한 데이터가 필요 없이 세 가지 비지도 학습 작업—사실-문서 매칭, 법적 판결 예측, 케이스 간 대비 학습—을 통해 법적 지식과 관련성 매칭 패턴을 학습하는 새로운 사전 훈련 프레임워크인 Caseformer를 제안한다. 이는 인간이 레이블링한 데이터 없이도 중국어 및 영어 법적 데이터셋에서 제로샷 및 피니튜닝 설정 모두에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Legal case retrieval aims to help legal workers find relevant cases related to their cases at hand, which is important for the guarantee of fairness and justice in legal judgments. While recent advances in neural retrieval methods have significantly improved the performance of open-domain retrieval tasks (e.g., Web search), their advantages have not been observed in legal case retrieval due to their thirst for annotated data. As annotating large-scale training data in legal domains is prohibitive due to the need for domain expertise, traditional search techniques based on lexical matching such as TF-IDF, BM25, and Query Likelihood are still prevalent in legal case retrieval systems. While previous studies have designed several pre-training methods for IR models in open-domain tasks, these methods are usually suboptimal in legal case retrieval because they cannot understand and capture the key knowledge and data structures in the legal corpus. To this end, we propose a novel pre-training framework named Caseformer that enables the pre-trained models to learn legal knowledge and domain-specific relevance information in legal case retrieval without any human-labeled data. Through three unsupervised learning tasks, Caseformer is able to capture the special language, document structure, and relevance patterns of legal case documents, making it a strong backbone for downstream legal case retrieval tasks. Experimental results show that our model has achieved state-of-the-art performance in both zero-shot and full-data fine-tuning settings. Also, experiments on both Chinese and English legal datasets demonstrate that the effectiveness of Caseformer is language-independent in legal case retrieval.

연구 동기 및 목표

  • 신경 검색 모델의 효과성을 제한하는 법적 케이스 검색 분야에서의 대규모 레이블링된 학습 데이터 부족 문제를 해결한다.
  • BERT나 RoBERTa와 같은 일반 목적 사전 훈련 모델이 법적 문서 구조와 법적 관련성 이해에 한계를 가진다는 점을 극복한다.
  • 인간이 레이블링한 지도 신호 없이도 도메인 특화 지식, 언어 패턴, 법적 문서 간 상호 관계를 포착하는 사전 훈련 프레임워크를 개발한다.
  • 특히 중국어 및 영어 법적 문헌 코퍼스에서 다국어 환경에서도 제로샷 및 피니튜닝 시나리오 모두에서 뛰어난 성능을 달성하도록 한다.

제안 방법

  • 사실-문서 매칭(Fact-Document Matching, FDM), 법적 판결 예측(Legal Judgment Prediction, LJP), 케이스 간 대비 학습(Inter-Case Contrastive Learning, ICCL)의 세 가지 작업으로 구성된 비지도 사전 훈련 프레임워크를 제안한다.
  • FDM을 통해 사실 기술서가 해당 케이스 문서와 일치하는지 예측함으로써 법적 사실과 케이스 문서 간의 정렬을 도모한다.
  • LJP를 통해 케이스 텍스트에서 법적 판결(예: 기소 또는 형량)을 예측함으로써 모델이 법적 추론과 유사성을 학습하도록 한다.
  • ICCL을 통해 법적 유사성 기반으로 케이스 쌍을 대조함으로써 모델이 케이스 간 미세한 차이를 학습하도록 유도한다.
  • 밀도 기반 검색 및 신경 재랭킹 모델 모두를 지원하도록 프레임워크를 설계하여 최종 검색 성능 향상에 기여한다.
  • 인간이 레이블링한 쿼리-문서 쌍이 없는 대규모 법적 코퍼스에서 훈련을 수행하며, 내재된 문서 구조와 법적 의미를 활용한다.

실험 결과

연구 질문

  • RQ1인간이 레이블링한 데이터 없이도 사전 훈련 프레임워크가 법적 케이스 검색에서 법적 지식과 관련성 매칭 패턴을 학습할 수 있는가?
  • RQ2각각의 사전 훈련 작업(FDM, LJP, ICCL)이 모델이 법적 케이스를 구분하는 데 기여하는 방식은 무엇인가?
  • RQ3제안된 프레임워크는 중국어 및 영어 법적 데이터셋에서의 성능을 통해 다국어로의 일반화 능력을 확보하는가?
  • RQ4피니튜닝 없이도 제로샷 검색에서 최신 기술 수준 성능을 달성할 수 있는가?
  • RQ5BERT-XS, text-embedding-ada-002, Lawformer와 같은 기존 모델과 비교해 모델이 법적 유사성을 얼마나 잘 포착하는가?

주요 결과

  • Caseformer는 중국어 및 영어 데이터셋을 포함한 여러 법적 검색 벤치마크에서 제로샷 및 피니튜닝 설정 모두에서 최신 기술 수준 성능을 달성한다.
  • 제거 실험 결과, 법적 판결 예측(LJP) 작업을 제거할 경우 성능 저하가 가장 심각하게 발생함을 확인하여, LJP가 법적 유사성 학습에 핵심적인 역할을 한다는 것을 입증한다.
  • 케이스 간 대비 학습(ICCL) 작업은 유사한 범죄 유형이지만 다른 법적 조항을 가진 케이스를 구분하는 데에 크게 기여한다.
  • t-SNE 시각화 결과, Caseformer는 특정 범죄 유형 기반으로 케이스를 군집화하는 반면, BERT-XS나 text-embedding-ada-002와 같은 기준 모델은 단지 범죄 유형 기준으로만 군집화됨을 확인하여 더 미세한 법적 이해 능력을 보임을 입증한다.
  • Caseformer는 Lawformer 및 text-embedding-ada-002와 같은 기존 모델보다 제로샷 검색에서 뛰어난 성능을 보이며, 뛰어난 일반화 능력과 법적 추론 능력을 입증한다.
  • 모델의 성능은 언어에 독립적이며, 중국어 및 영어 법적 데이터셋 모두에서 뛰어난 성능을 달성함으로써 광범위한 적용 가능성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.