Skip to main content
QUICK REVIEW

[논문 리뷰] LegalRelectra: Mixed-domain Language Modeling for Long-range Legal Text Comprehension

Wenyue Hua, Yuchen Zhang|arXiv (Cornell University)|2022. 12. 16.
Artificial Intelligence in Law인용 수 5
한 줄 요약

LegalRelectra는 개인 상해 사건에서 장거리 텍스트 이해를 가능하게 하기 위해 Reformer 기반 Electra 프레임워크를 사용하여 법적 및 의료 코퍼스에서 미리 훈련된 혼합 도메인 언어 모델이다. 특히 8,092 토큰에 이르는 장문의 문장에서 법적 및 의료 용어의 명명된 실체 인식(NER)에서 일반 모델 및 단일 도메인 모델을 능가하며, 개선된 아키텍처와 도메인 특화 토크나이저 덕분이다.

ABSTRACT

The application of Natural Language Processing (NLP) to specialized domains, such as the law, has recently received a surge of interest. As many legal services rely on processing and analyzing large collections of documents, automating such tasks with NLP tools emerges as a key challenge. Many popular language models, such as BERT or RoBERTa, are general-purpose models, which have limitations on processing specialized legal terminology and syntax. In addition, legal documents may contain specialized vocabulary from other domains, such as medical terminology in personal injury text. Here, we propose LegalRelectra, a legal-domain language model that is trained on mixed-domain legal and medical corpora. We show that our model improves over general-domain and single-domain medical and legal language models when processing mixed-domain (personal injury) text. Our training architecture implements the Electra framework, but utilizes Reformer instead of BERT for its generator and discriminator. We show that this improves the model's performance on processing long passages and results in better long-range text comprehension.

연구 동기 및 목표

  • 표준 BERT 기반 모델의 512 토큰 제한을 초월하는 법적 텍스트의 장거리 이해 도전 과제를 해결하기 위해.
  • 법적 및 임상 용어를 포함한 개인 상해 사건과 같은 혼합 도메인 법적 및 의료 텍스트 처리를 향상시키기 위해.
  • 더 긴 컨텍스트 처리를 위해 Electra 프레임워크 내의 BERT 구성 요소를 Reformer 기반 생성기 및 판별기로 대체하여 모델 성능을 향상시키기 위해.
  • 법적 및 의료 NER에서 도메인 특화 토크나이저와 표준 BERT 토크나이저의 성능 영향을 평가하기 위해.
  • 장문의 법적 문서에서 원고, 피소자, 의료 상태 및 사건 유형과 같은 후행 명명된 실체 인식 작업에서 뛰어난 성능을 입증하기 위해.

제안 방법

  • BERT 생성기 및 판별기를 Reformer 기반 구성 요소로 대체하여 최대 8,092 토큰까지의 장기 컨텍스트 처리를 가능하게 한 Electra 프레임워크를 채택하였다.
  • 법적, 의료적, 개인 상해 텍스트를 포함한 혼합 코퍼스에서 LegalRelectra를 미리 훈련시켜 두 도메인의 전문 용어를 포괄하였다.
  • 법적 및 의료 용어를 위한 맞춤형 도메인 특화 토크나이저를 훈련시켜 표준 BERT 토크나이저보다 복잡한 용어 인식을 향상시켰다.
  • Electra 설정의 판별기를 활용하여 토큰을 마스킹하고 재구성함으로써 예측을 정교화하고 표현 학습을 향상시켰다.
  • 법적 및 의료 실체를 위한 부분 자동 애너테이션 파이프라인을 사용하여 명명된 실체 인식(NER) 후행 작업에 모델을 피지컬 훈련시켰다.
  • 법적 및 의료 실체 인식에 대해 일반 및 전문 모델(BERT, Clinical-Bert, Legal-Bert 등)과의 F1 스코어 비교를 통해 성능을 평가하였다.

실험 결과

연구 질문

  • RQ1Reformer 기반 Electra 아키텍처는 BERT의 512 토큰 제한을 초월하여 법적 문서의 장거리 텍스트 이해를 뚜렷이 향상시킬 수 있는가?
  • RQ2혼합 법적 및 의료 코퍼스에서의 미리 훈련은 단일 도메인 모델 대비 법적 및 의료 명명된 실체 인식 성능을 향상시키는가?
  • RQ3법적 및 의료 용어 인식 정확도 측면에서 도메인 특화 토크나이저는 표준 BERT 토크나이저보다 어떻게 비교되는가?
  • RQ4표준 피지컬 훈련 방법에 비해 Electra 훈련 프레임워크는 장문의 법적 텍스트에서 성능을 얼마나 향상시키는가?
  • RQ5한 개의 모델이 법적 및 의료 도메인을 모두 포함하는 개인 상해 사건의 문법적 및 어휘적 복잡성을 효과적으로 처리할 수 있는가?

주요 결과

  • LegalRelectra는 원고 및 피소자와 같은 법적 실체에 대해 BERT 및 Legal-Bert를 능가하는 명명된 실체 인식 성능을 보였으며, 특히 맥락이 중요한 장문의 문서에서 두드러졌다.
  • 모든 기준 모델 대비 법적 실체 인식에서 뛰어난 F1 스코어를 기록하여 Reformer 기반 아키텍처 덕분에 향상된 장거리 이해 능력을 입증하였다.
  • Medical terminology recognition에서 Clinical-Bert에 이어 뛰어난 성능을 보였으며, 혼합 도메인 미리 훈련으로 인해 효과적인 학습이 이루어졌음을 시사한다.
  • 도메인 특화 토크나이저의 사용은 복잡한 의료 용어에 대해 표준 BERT 토크나이저보다 의료 실체 인식 성능을 향상시켰다.
  • Reformer 기반 훈련은 정밀도보다 재현율을 더 높게 만들었지만, 전체 F1 스코어는 기준 모델보다 높아 Electra 프레임워크의 이곳에서의 효과성을 확인하였다.
  • 장문의 문서에서 조사 시작 부분에 위치한 사례 유형 및 부상 정보와 같은 핵심 법적 정보를 효과적으로 추출하는 데 뛰어난 강건성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.