Skip to main content
QUICK REVIEW

[논문 리뷰] Exploring the Use of Text Classification in the Legal Domain

Octavia-Maria Şulea, Marcos Zampieri|arXiv (Cornell University)|2017. 10. 25.
Artificial Intelligence in Law참고 문헌 14인용 수 105
한 줄 요약

논문은 masked case descriptions를 이용한 프랑스 대법원 판결에 텍스트 분류를 적용하는 것을 연구하며, SVM 앙상블로 법 영역, 판결 유형, 판결 날짜를 예측하고, 이전 연구에 비해 강력한 성능 향상을 보인다.

ABSTRACT

In this paper, we investigate the application of text classification methods to support law professionals. We present several experiments applying machine learning techniques to predict with high accuracy the ruling of the French Supreme Court and the law area to which a case belongs to. We also investigate the influence of the time period in which a ruling was made on the form of the case description and the extent to which we need to mask information in a full case ruling to automatically obtain training and test data that resembles case descriptions. We developed a mean probability ensemble system combining the output of multiple SVM classifiers. We report results of 98% average F1 score in predicting a case ruling, 96% F1 score for predicting the law area of a case, and 87.07% F1 score on estimating the date of a ruling.

연구 동기 및 목표

  • 법률 연구 및 사례 준비와 같은 업무를 지원하기 위한 자동화 동기를 부여한다.
  • 사례 설명으로부터 법 영역, 판결 및 판결 날짜를 예측할 수 있는지 조사한다.
  • 학습 데이터의 현실성 및 모델 성능에 대한 masking의 영향을 평가한다.
  • 앙상블 결과를 이전 기준선과 비교하고 데이터의 어떤 측면이 예측에 영향을 미치는지 분석한다.

제안 방법

  • 단어 일-그램 및 이-그램을 특징으로 사용하는 SVM 분류기의 평균 확률 앙상회를 사용한다.
  • 클래스 불균형을 다루기 위해 층화된 10-폴드 교차 검증으로 학습 및 평가한다.
  • 법률가가 사용할 수 있는 현실적인 초안을 시뮬레이션하기 위해 학습/검증 데이터에서 대상 레이블을 마스킹한다.
  • 일부 작업에서는 텍스트에서 단서가 되는 단어나 레이블을 제거하는 등 데이터를 전처리한다.
  • bag-of-words 특징에 LIBLINEAR SVM을 사용한 Şulea et al. (2017) 기반선과의 비교를 수행한다.

실험 결과

연구 질문

  • RQ1마스킹된 목표를 가진 경우 설명에서 사례의 법 영역을 텍스트 분류로 예측할 수 있는가?
  • RQ2현실적인 마스킹 하에서 SVM 분류기의 앙상블이 사례 설명으로부터 법원의 판결을 정확히 예측할 수 있는가?
  • RQ3설명을 통해 판결의 10년대 또는 시간 범위를 추정할 수 있는가?
  • RQ4마스킹이 이전 접근법과 비교하여 모델 성능에 어떤 영향을 미치는가?

주요 결과

  • 앙상블은 법 영역 예측(8개 클래스)에 대해 평균 정밀도/재현율 96.8%, 정확도 96.8%를 달성한다.
  • 앙상블은 6-클래스 판결 예측에서 F1/정밀도 98.6%, 정확도 98.6%를 달성하며, 8-클래스 판결 예측의 경우 F1 95.8%, 정확도 96.2%이다.
  • 시간적 예측(7클래스)에서 F1 87.0%, 정확도 87.0%를 달성한다.
  • 작업 전반에서 평균 확률 앙상점은 같은 데이터세트에서 Şulea et al. (2017) 기본선을 능가한다.
  • 오류 분석에서 non-lieu 및 annulation이 예가 더 적은 사례로 인해 판결 클래스로서 가장 도전적인 경우들 중 하나임을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.