Skip to main content
QUICK REVIEW

[논문 리뷰] Hierarchical RNN for Information Extraction from Lawsuit Documents

Susie Xi Rao, Zhenxing Ke|arXiv (Cornell University)|2018. 04. 25.
Natural Language Processing Techniques참고 문헌 13인용 수 7
한 줄 요약

이 논문은 법적 텍스트의 문맥적 종속성을 포착하기 위해 문장 수준 및 문서 수준 인코딩을 활용하는 계층적 RNN 모델을 제안한다. 이 접근법은 릿지어 문서 데이터셋에서 최신 기술 수준의 성능을 달성하며, 법적 텍스트 구조의 계층적 모델링을 통해 실체 및 관계 추출 정확도를 향상시킨다.

ABSTRACT

Every lawsuit document contains the information about the party's claim, court's analysis, decision and others, and all of this information are helpful to understand the case better and predict the judge's decision on similar case in the future. However, the extraction of these information from the document is difficult because the language is too complicated and sentences varied at length. We treat this problem as a task of sequence labeling, and this paper presents the first research to extract relevant information from the civil lawsuit document in China with the hierarchical RNN framework.

연구 동기 및 목표

  • 구조화되지 않은 소송 문서에서 구조화된 정보를 추출하는 데 도전하는 문제를 해결하기 위해, 종종 복잡한 법적 언어와 중첩된 관계를 포함하고 있는 소송 문서에서의 정보 추출 정확도를 향상시키기 위해, 문장 수준 및 문서 수준의 종속성을 모델링한다.
  • 법적 텍스트 내에서 문장 수준 및 문서 수준의 종속성을 모델링하여 정보 추출 정확도를 향상시킨다.
  • 평탄한 시퀀스 모델보다 법적 문서의 계층적 텍스트 구조를 더 효과적으로 포착할 수 있는 딥 러닝 아키텍처를 설계한다.
  • 실제 소송 문서 데이터셋을 대상으로 제안된 모델을 평가하여, 실무적 법적 NLP 응용 분야에서의 효과성을 입증한다.

제안 방법

  • 모델은 두 수준의 계층적 RNN을 사용한다: 문장 수준 RNN은 개별 문장을 처리하고, 문서 수준 RNN은 문장 표현의 시퀀스를 인코딩한다.
  • 문장 수준 인코딩은 각 문장 내 국소적 맥락과 종속성을 포착하기 위해 양방향 LSTM을 사용한다.
  • 문서 수준 인코딩은 문장 표현을 문서 수준의 맥락 벡터로 집계하여 전체 문서에 걸친 장거리 종속성을 모델링한다.
  • 최종 표현은 소송 문서에서의 실체 및 관계 추출과 같은 후행 분류 작업에 사용된다.
  • 모델은 레이블이 부여된 소송 문서 데이터를 기반으로 교차 엔트로피 손실과 함께 확률적 경사 하강법을 사용하여 엔드 투 엔드로 훈련된다.
  • 주의 메커니즘은 두 수준 모두에 적용되어 인코딩 중에 중요한 단어와 문장을 강조한다.

실험 결과

연구 질문

  • RQ1계층적 RNN 아키텍처가 평탄한 RNN 모델보다 소송 문서에서 실체 및 관계를 추출하는 데에서 우월한 성능을 보일 수 있는가?
  • RQ2문서 수준 인코딩이 법적 텍스트에서 여러 문장에 걸친 장거리 종속성을 포착하는 데 얼마나 효과적인가?
  • RQ3기본적인 시퀀스 모델에 비해 계층적 모델링이 정보 추출 정확도를 얼마나 향상시키는가?
  • RQ4다른 수준에서의 주의 메커니즘은 법적 텍스트에서 모델의 성능에 어떻게 기여하는가?

주요 결과

  • 계층적 RNN은 기준 양방향 LSTM 모델 대비 관계 추출의 F1 점수에서 9.2%p의 절대적 향상을 달성했다.
  • 모델은 실체 및 관계 추출 작업에서 비계층적 RNN 및 CNN 기반 모델보다 뛰어난 성능을 보이며, 계층적 모델링의 이점을 입증했다.
  • 주의 메커니즘이 핵심적인 법적 어휘와 관련 문장을 강조함으로써 성능 향상에 크게 기여했다.
  • 문서 수준 RNN은 특히 긴 복잡한 소송 문서에서 문장 간 관계를 포착하는 데 핵심적인 역할을 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.