Skip to main content
QUICK REVIEW

[논문 리뷰] Plain English Summarization of Contracts

Laura Manor, Junyi Jessy Li|arXiv (Cornell University)|2019. 06. 02.
Natural Language Processing Techniques참고 문헌 36인용 수 5
한 줄 요약

이 논문은 이용 약관과 같은 법적 계약의 평이한 영문 요약을 통해 일반 대중의 이해도를 향상시키기 위해 평이한 영문 요약이라는 새로운 작업을 제안한다. 저자들은 인간이 작성한 평이한 영문 요약과 함께 446개의 법적 텍스트 섹션을 포함하는 데이터셋을 구축하였으며, 이는 높은 개재성, 단순화 및 독해 용이성 향상을 보여준다. 初기 실험 결과 표준 비지도 추출 요약 방법이 빈약하게 작동함을 확인하여, 법적 텍스트에 특화된 비지도 단순화 및 스타일 전이 기법의 필요성을 강조한다.

ABSTRACT

Unilateral contracts, such as terms of service, play a substantial role in modern digital life. However, few users read these documents before accepting the terms within, as they are too long and the language too complicated. We propose the task of summarizing such legal documents in plain English, which would enable users to have a better understanding of the terms they are accepting. We propose an initial dataset of legal text snippets paired with summaries written in plain English. We verify the quality of these summaries manually and show that they involve heavy abstraction, compression, and simplification. Initial experiments show that unsupervised extractive summarization methods do not perform well on this task due to the level of abstraction and style differences. We conclude with a call for resource and technique development for simplification and style transfer for legal language.

연구 동기 및 목표

  • 법적 계약(이용 약관 등)의 길이와 복잡성으로 인해 일반적으로 이해가 어려운 문제를 해결하기 위해.
  • 비전문가 사용자를 위한 법적 문서를 평이한 영문으로 자동 요약하는 새로운 작업을 제안하기 위해.
  • 446개의 법적 텍스트 섹션과 해당 평이한 영문 요약이 포함된 고품질 데이터셋을 구축하고 검증하기 위해.
  • 기존 추출 기반 요약 방법이 높은 개재성과 스타일 차이로 인해 이 작업에 부적합함을 입증하기 위해.
  • 법적 언어에 특화된 비지도 단순화 및 스타일 전이 기법의 개발을 촉구하기 위해.

제안 방법

  • 데이터셋은 법적 문서의 평이한 영문 설명에 특화된 두 개의 공공 웹사이트(TLDRLegal 및 TOS;DR)에서 수집되었다.
  • 각 데이터셋 항목은 법적 계약 섹션과 전문가가 수작업으로 품질을 검증한 인간이 작성한 평이한 영문 요약으로 구성되어 있으며, 이 전문가는 3년간 계약 초안 작성 경험이 있다.
  • 독해 용이성 지표를 사용해 데이터셋을 평가하였으며, 원본 텍스트 대비 요약의 평균 독해 수준이 6년 낮아졌음을 확인하였다.
  • 개재성은 요약에 포함된 신조어 수로 측정되었으며, DUC 2002와 같은 표준 뉴스 요약 벤치마크보다 유의미하게 높았다.
  • 성능 평가를 위해 기본 모델들(TextRank, Greedy KL, Lead 모델)을 데이터셋에 적용하였다.
  • 기존 단순화 및 요약 방법의 핵심 과제로 도메인 간 격리와 정렬된 병렬 코퍼스 부족을 규명하였다.

실험 결과

연구 질문

  • RQ1비지도 추출 요약 모델은 법적 계약을 평이한 영문으로 효과적으로 요약할 수 있는가?
  • RQ2표준 요약 작업과 비교해 법적 계약의 평이한 영문 요약은 어느 정도의 개재성, 압축 및 단순화를 포함하는가?
  • RQ3독해 수준 측면에서 평이한 영문 요약은 원본 법적 텍스트보다 어떻게 다를까?
  • RQ4왜 표준 추출 기반 요약 모델은 이 법적 요약 작업에서 성능이 열등한가?
  • RQ5이 도메인에 가장 효과적일 수 있는 비지도 기법(예: 단순화 또는 스타일 전이)은 무엇인가?

주요 결과

  • 제안된 데이터셋은 법적 계약 섹션과 평이한 영문 요약의 446개 병렬 쌍을 포함하며, 요약은 높은 수준의 개재성과 단순화를 보여준다.
  • 요약의 평균 독해 수준은 원본 법적 텍스트보다 6년 낮아, 상당한 단순화가 이루어졌음을 시사한다.
  • 요약에 포함된 신조어 수는 DUC 2002 뉴스 요약과 비교해 유의미하게 높아 강한 개재적 특성을 확인한다.
  • TextRank 및 Greedy KL과 같은 비지도 추출 모델은 DUC 2002에서의 성능과는 달리 이 데이터셋에 대해 빈약하게 작동함을 확인하여 도메인 격리가 존재함을 입증한다.
  • 문장 수준의 정렬된 병렬 코퍼스가 법적-평이한 영문 쌍에 부족하기 때문에 기존의 지도 기반 단순화 및 스타일 전이 방법은 직접 적용될 수 없다.
  • 연구는 비지도 단순화 및 스타일 전이 기법의 필요성을 결론 내리지만, 현재 이 도메인의 자원과 데이터셋은 여전히 부족하다고 판단한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.