[논문 리뷰] THUIR@COLIEE 2023: Incorporating Structural Knowledge into Pre-trained Language Models for Legal Case Retrieval
이 논문은 법적 사건 검색 성능을 향상시키기 위해 사건 내에서의 사실-이유-결정 구조를 명시적으로 모델링하는 구조 인지 사전 fine-tuning 언어 모델인 SAILER을 제안한다. 사전 훈련 중 구조 지식을 통합하고, 학습 기반 순위 매기기 융합을 통한 히우리스틱 전/후 처리를 적용함으로써, COLIEE 2023 법적 사건 검색 경연에서 테스트 세트에서 F1 스코어 0.3001로 최고 성능을 기록하며 최첨단 성능을 달성하였다.
Legal case retrieval techniques play an essential role in modern intelligent legal systems. As an annually well-known international competition, COLIEE is aiming to achieve the state-of-the-art retrieval model for legal texts. This paper summarizes the approach of the championship team THUIR in COLIEE 2023. To be specific, we design structure-aware pre-trained language models to enhance the understanding of legal cases. Furthermore, we propose heuristic pre-processing and post-processing approaches to reduce the influence of irrelevant messages. In the end, learning-to-rank methods are employed to merge features with different dimensions. Experimental results demonstrate the superiority of our proposal. Official results show that our run has the best performance among all submissions. The implementation of our method can be found at https://github.com/CSHaitao/THUIR-COLIEE2023.
연구 동기 및 목표
- 법적 사건 검색에서 레이블이 부족한 데이터와 법적 사건 구조에 대한 이해 부족 문제를 해결하기 위해.
- 법적 사건 내의 사실-이유-결정 구조를 명시적으로 모델링하여 검색 성능을 향상시키기 위해.
- 히우리스틱 전처리 및 후처리 기법을 통해 불필요한 콘텐츠에서 노이즈를 감소시키기 위해.
- 다양한 차원의 특징을 학습 기반 순위 매기기 융합을 통해 일반화 능력과 순위 매기기 정확도를 향상시키기 위해.
- COLIEE 2023 법적 사건 검색 경연에서 최첨단 성능을 달성하기 위해.
제안 방법
- 법적 사건 구성 요소(사실, 이유, 결정) 간의 관계를 포착하도록 설계된 이중 인코더-디코더 사전 훈련 언어 모델인 SAILER를 제안한다.
- 법적 사건의 내재된 구조를 활용하여 표현 학습을 향상시키는 구조 인지 사전 훈련 목표를 적용한다.
- 입력 전에 사례 번호 및 절차적 세부 정보와 같은 불필요한 콘텐츠를 필터링하기 위해 히우리스틱 전처리를 적용한다.
- 심사 일자 기반 필터링 및 동적 커프오프 전략을 포함한 후처리 전략을 사용하여 후보 목록을 정밀하게 조정한다.
- 다양한 모델과 특징의 점수를 융합하기 위해 Lambdarank 목표를 사용한 학습 기반 순위 매기기 기법을 적용하여 최종 순위 성능을 향상시킨다.
- AdamW 옵timizer와 선형 웜업 스케줄을 사용하여 1:15의 양성 대 음성 샘플 비율로 모델을 미세 조정한다.
실험 결과
연구 질문
- RQ1사전 훈련된 언어 모델에 명시적인 구조 지식을 통합하면 법적 사건 검색 성능이 향상되는가?
- RQ2히우리스틱 전처리 및 후처리 기법은 법적 사건 텍스트에서 노이즈를 얼마나 효과적으로 감소시키는가?
- RQ3다양한 특징의 학습 기반 순위 매기기 융합은 검색 성능 향상에 어느 정도 기여하는가?
- RQ4입력 길이 제약 조건 하에서 밀도 기반 검색 모델의 성능은 떨어지는가? 장문의 컨텍스트를 처리하는 모델은 이를 완화할 수 있는가?
- RQ5구조 인지 사전 훈련 접근 방식은 표준 법적 BERT 모델과 어휘 매칭 기반 기준 모델보다 우수한 성능을 낼 수 있는가?
주요 결과
- SAILER는 512토큰 컨텍스트 길이로 검증 세트에서 F1 스코어 0.1385를 기록하여 RoBERTa(0.1046)와 BERT(0.0809)를 크게 앞서며 성능을 뛰어넘었다.
- 입력 길이가 제한되지 않은 경우, BM25와 QLD가 다른 모든 모델보다 뛰어나 성능을 보였으며, 이는 표준 모델이 장문의 컨텍스트 이해에 여전히 도전 과제를 안고 있음을 시사한다.
- 동적 커프오프와 심사 일자 필터링을 적용한 최종 앙상블은 F1 스코어 0.2276를 기록하였고, 최고 성능을 낸 런(thuirun2)은 테스트 세트에서 F1 스코어 0.3001을 달성하였다.
- 심사 일자 기반 필터링이 가장 효과적인 후처리 전략이었으며, 기준 앙상블 대비 F1 스코어를 20% 이상 향상시켰다.
- SAILER는 LEGAL-BERT(0.0888)와 BERT(0.0809) 대비 성능 향상을 보이며, 법적 검색에서 구조 인지 사전 훈련의 가치를 입증하였다.
- 이 방법은 COLIEE 2023 경연에서 모든 참가자 중 최고 성능을 기록하며 첫 번째로 우수한 성과를 달성하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.