Skip to main content
QUICK REVIEW

[논문 리뷰] Lawformer: A Pre-trained Language Model for Chinese Legal Long Documents

Chaojun Xiao, Xueyu Hu|arXiv (Cornell University)|2021. 05. 09.
Artificial Intelligence in Law참고 문헌 33인용 수 15
한 줄 요약

Lawformer는 장문의 중국어 법적 문서를 처리하기 위해 설계된 Longformer 기반 사전 미세조정 언어 모델로, 국소 슬라이딩 윈도우 어텐션과 전역 작업 특화 어텐션을 활용하여 수천 개의 토큰을 처리한다. 이 모델은 판단 예측, 케이스 검색, 독해 이해 등 법적 작업에서 최신 기술 성능을 달성하며, 장문 입력에서도 뛰어난 성능을 유지하면서도 짧은 입력에서도 강력한 성능을 발휘한다.

ABSTRACT

Legal artificial intelligence (LegalAI) aims to benefit legal systems with the technology of artificial intelligence, especially natural language processing (NLP). Recently, inspired by the success of pre-trained language models (PLMs) in the generic domain, many LegalAI researchers devote their effort to apply PLMs to legal tasks. However, utilizing PLMs to address legal tasks is still challenging, as the legal documents usually consist of thousands of tokens, which is far longer than the length that mainstream PLMs can process. In this paper, we release the Longformer-based pre-trained language model, named as Lawformer, for Chinese legal long documents understanding. We evaluate Lawformer on a variety of LegalAI tasks, including judgment prediction, similar case retrieval, legal reading comprehension, and legal question answering. The experimental results demonstrate that our model can achieve promising improvement on tasks with long documents as inputs.

연구 동기 및 목표

  • 표준 사전 미세조정 언어 모델이 잘 처리하지 못하는 512 토큰을 초과하는 장문의 중국어 법적 문서를 처리하는 데 도전하는 것.
  • 형사 및 민사 사건 모두에서 법적 텍스트 이해를 위해 특화된 도메인 전용 사전 미세조정 언어 모델을 개발하는 것.
  • 판결 예측, 케이스 검색, 독해 이해, 질문 응답 등 다양한 LegalAI 작업에서 모델을 평가하는 것.
  • 형사 및 민사 사건을 균형 있게 포함한 새로운 대규모 데이터셋을 구축하여 실제 세계의 데이터 분포 커버리지 개선.
  • 장문 법적 문서의 깊은 이해가 필요한 작업에서 장문 처리 능력이 성능 향상에 크게 기여함을 입증하는 것.

제안 방법

  • 장문 처리를 효율적으로 하기 위해 국소 슬라이딩 윈도우 자기어텐션과 선택적 전역 어텐션을 결합한 Longformer 아키텍처를 채택.
  • 수천만 개의 중국어 형사 및 민사 사건 문서로 구성된 대규모 코퍼스에서 Lawformer를 사전 미세조정.
  • 질문 응답 작업에서 질문과 같은 핵심 토큰에만 전역 어텐션을 적용하여 전체 자기어텐션 비용을 감당하면서도 장거리 의존성을 유지.
  • 표준 분류 및 시퀀스 레이블링 헤드를 사용하여 다운스트림 LegalAI 작업에서 Lawformer를 미세조정.
  • 형사 및 민사 사건을 균형 있게 포함한 새로운 데이터셋을 구축하여 데이터 분포의 현실성 향상.
  • 유사한 케이스 검색, 법적 독해 이해, 법적 질문 응답과 같은 기존 벤치마크에서 전이 학습을 적용.

실험 결과

연구 질문

  • RQ1표준 사전 미세조정 언어 모델의 시퀀스 길이 제한을 극복하고, 수천 토큰에 이르는 중국어 법적 문서를 효과적으로 처리할 수 있는 사전 미세조정 언어 모델이 가능한가?
  • RQ2장문 입력 시퀀스를 처리하는 법적 작업에서 Lawformer의 성능은 RoBERTa 및 BERT 기반 모델과 비교해 어떻게 되는가?
  • RQ3법적 문서에 특화된 도메인 내 사전 미세조정이 법적 판결 예측 및 기타 법적 NLP 작업 성능 향상에 얼마나 기여하는가?
  • RQ4핵심 입력 세그먼트(예: 질문)에 전역 어텐션을 통합하면 법적 질문 응답 및 독해 이해에서 추론 능력이 향상되는가?
  • RQ5Lawformer는 장문 입력과 짧은 입력 모두에 걸쳐 다양한 법적 작업에서 일관된 성능 향상을 보일 수 있는가?

주요 결과

  • 법적 독해 이해 작업에서 Lawformer는 55.02% EM과 69.98% F1을 기록하여 RoBERTa(53.81% EM, 68.86% F1)와 L-RoBERTa(54.12% EM, 69.76% F1)를 앞서며 뛰어난 장문 이해 능력을 입증한다.
  • 법적 질문 응답 작업에서 Lawformer는 단일 답변 질문에서 45.81%의 정확도, 전반적인 질문에서 27.43%의 정확도를 기록하여 L-RoBERTa를 약간 앞서며 복잡한 작업에서도 뛰어난 성능을 보였다.
  • 특히 외부 도메인 코퍼스에서 사전 미세조정된 모델들과 비교해 장문 문서를 포함한 판결 예측 작업에서 성능 향상이 뚜렷하게 향상되었다.
  • 짧은 입력에서도 경쟁력 있는 성능을 유지하여, 짧은 시퀀스 작업에서 RoBERTa와 유사한 결과를 기록함으로써 다양한 입력 길이에 대한 강건성을 입증했다.
  • 형사 및 민사 사건을 모두 포함하는 새로운 법적 판결 예측 데이터셋은 기존 데이터셋보다 더 현실적인 평가와 더 나은 일반화 능력을 가능하게 했다.
  • 광범위한 아블레이션 실험을 통해 핵심 토큰(예: 질문)에 전역 어텐션을 적용하는 것이 장문 이해 추론 작업에서 성능 유지에 필수적임을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.