[논문 리뷰] Methods for Computing Legal Document Similarity: A Comparative Study
이 논문은 법적 문서 유사도 측정 방법에 대한 체계적 비교를 수행하며, 법적 전문가들이 47개의 인도 대법원 사건 쌍에 대해 주석을 달은 공통 데이터셋을 사용한다. 두 가지 새로운 접근법—Node2Vec 기반 인용 네트워크 임베딩 및 주제적 세그먼트 유사도—를 제안하며, 텍스트 기반 및 인용 기반 유사도 측정 방법을 조합할 경우 전문가 평가와의 상관관계가 크게 향상됨을 보여주며, 최고 성능은 피어슨 상관계수 0.626에 도달한다.
Computing similarity between two legal documents is an important and challenging task in the domain of Legal Information Retrieval. Finding similar legal documents has many applications in downstream tasks, including prior-case retrieval, recommendation of legal articles, and so on. Prior works have proposed two broad ways of measuring similarity between legal documents - analyzing the precedent citation network, and measuring similarity based on textual content similarity measures. But there has not been a comprehensive comparison of these existing methods on a common platform. In this paper, we perform the first systematic analysis of the existing methods. In addition, we explore two promising new similarity computation methods - one text-based and the other based on network embeddings, which have not been considered till now.
연구 동기 및 목표
- 공통된 데이터셋을 기반으로 기존 법적 문서 유사도 측정 방법에 대한 공정하고 체계적인 비교를 수행하기 위해.
- 선례 인용 유사도 및 텍스트 유사도 측정 방법의 효과성을 평가하여 전문가가 주석을 달은 유사도 점수를 예측하는 데에 얼마나 유용한지 확인하기 위해.
- 두 가지 새로운 방법—Node2Vec 기반 인용 네트워크 임베딩 및 주제적 세그먼트 기반 텍스트 유사도—를 제안하고 평가하기 위해.
- 다양한 유사도 유형(텍스트 기반 및 인용 기반)을 조합할 경우 전체 성능에 미치는 영향을 조사하기 위해.
- 최고의 성능을 내기 위한 조합 전략(최대값 및 평균 집계 함수)을 규명하기 위해.
제안 방법
- 연구는 0에서 10까지의 전문가 주석 기반 유사도 점수를 가진 47개의 인도 대법원 사건 쌍으로 구성된 데이터셋을 사용한다.
- 기존의 5가지 선례 인용 유사도 측정 방법—문헌 기반 결합, 공인용, 산산각, 그리고 인용 기반 유사도의 두 가지 변형—을 재현하고 비교한다.
- 선례 인용 네트워크에 대해 Node2Vec이라는 새로운 그래프 임베딩 방법을 적용하여 선례 인용 유사도를 계산한다.
- 텍스트 유사도는 전체 텍스트 임베딩(Doc2Vec)과 문서를 주제적 구성요소(사실, 주장, 판결 근거, 판결)로 분할하여 대응하는 세그먼트 간의 유사도를 계산하는 방식으로 계산한다.
- 텍스트 기반 및 인용 기반 유사도를 최대값 및 평균 집계 전략을 사용하여 조합하여 하이브리드 접근법의 성능을 평가한다.
- 성능 평가는 예측된 유사도 점수와 전문가 주석 기반 점수 간의 피어슨 상관계수를 사용하여 평가한다.
실험 결과
연구 질문
- RQ1공통된 전문가 주석 기반 데이터셋에서 기존의 법적 문서 유사도 측정 방법 중에서 가장 우수한 성능을 보이는 방법은 무엇인가?
- RQ2Node2Vec 기반 인용 네트워크 임베딩 및 주제적 세그먼트 유사도와 같은 신규 접근법은 기존 방법과 비교해 어떻게 성능을 내는가?
- RQ3텍스트 기반 및 선례 인용 유사도를 조합할 경우 개별 방법을 사용할 때보다 성능 향상이 이루어지는가?
- RQ4최대값 또는 평균 집계 전략 중 어느 것이 전문가 유사도 평가와 더 높은 상관관계를 보이는가?
- RQ5다양한 문서 요소(예: 사실, 판결 근거, 선례)가 전체 유사도 인식에 기여하는 비율은 어떻게 되는가?
주요 결과
- 문헌 기반 결합(선례 인용 유사도)과 Doc2Vec를 사용한 전체 텍스트 유사도의 조합이 전문가 점수와 가장 높은 피어슨 상관계수 0.626을 기록하였다.
- 주제 기반 유사도, 특히 문헌 기반 결합과 조합했을 경우 0.604의 상관계수를 기록하여 특정 법적 구성요소 간의 유사도가 전체 유사도에 의미 있는 기여를 한다는 것을 시사한다.
- Node2Vec 기반 인용 유사도와 주제 기반 유사도의 평균 집계가 하이브리드 방법 중에서 가장 높은 성능을 보였으며, 상관계수는 0.615였다.
- 텍스트 기반 및 인용 기반 방법을 조합할 경우 개별 방법보다 일관되게 높은 성능을 기록하여, 다양한 유사도 측면이 상호 보완적임을 입증하였다.
- 연구 결과, 문서의 '판결 근거'(Ratio)와 '선례'(Precedent) 섹션 간의 유사도가 가장 높았으며, 각각 상관계수 0.45와 0.42를 기록하여 이 구성요소들이 전문가의 유사도 평가에 핵심적인 역할을 한다는 것을 시사한다.
- Doc2Vec의 성능은 훈련 데이터에 민감하여, 모델 훈련 방식의 차이로 이전 연구와 상관계수 값이 다름을 발견하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.