Skip to main content
QUICK REVIEW

[논문 리뷰] CUAD: An Expert-Annotated NLP Dataset for Legal Contract Review

Dan Hendrycks, Collin Burns|arXiv (Cornell University)|2021. 03. 10.
Artificial Intelligence in Law참고 문헌 23인용 수 97
한 줄 요약

CUAD는 41개 라벨에 걸친 13,101개의 주석이 포함된 크고 전문가가 주석한 계약 검토 데이터셋을 도입하고 트랜스포머 모델을 평가하며 데이터 규모와 모델 설계가 전문 법률 NLP의 성능에 미치는 영향을 보여준다.

ABSTRACT

Many specialized domains remain untouched by deep learning, as large labeled datasets require expensive expert annotators. We address this bottleneck within the legal domain by introducing the Contract Understanding Atticus Dataset (CUAD), a new dataset for legal contract review. CUAD was created with dozens of legal experts from The Atticus Project and consists of over 13,000 annotations. The task is to highlight salient portions of a contract that are important for a human to review. We find that Transformer models have nascent performance, but that this performance is strongly influenced by model design and training dataset size. Despite these promising results, there is still substantial room for improvement. As one of the only large, specialized NLP benchmarks annotated by experts, CUAD can serve as a challenging research benchmark for the broader NLP community.

연구 동기 및 목표

  • 매우 특수한 도메인에서 NLP를 연구하기 위한 계약 검토용 크고 전문적으로 주석된 데이터셋을 제공한다.
  • 41개 라벨 범주에 걸쳐 추출적 조항 하이라이팅에서 트랜스포머 모델의 성능을 정량화한다.
  • 계약 검토 성능에 대한 학습 데이터 규모와 모델 설계의 영향을 평가한다.
  • 법 분야에서 NLP를 개선하기 위한 도메인 특화 주석 데이터의 가치를 보여준다.

제안 방법

  • 태스크를 41개 라벨 범주 각각과 관련된 계약 텍스트의 시작/종료 범위를 예측하는 것으로 형식화하되, 추출형 QA와 아웃풋이 없을 수도 있는 케이스를 고려한다.
  • 긴 계약서를 다루기 위해 슬라이딩 윈도를 사용하고 CUAD에서 HuggingFace Transformers로 다수의 사전학습 언어 모델을 미세조정한다.
  • AUPR 및 Precision at 80%/90% recall을 사용해 모델을 평가하고, 시작/종료 범위 매치를 위해 자카드 유사도(Jaccard similarity)를 적용한다.
  • 극단적 계층 불균형을 해결하기 위해 학습 중 비관련(음성) 특징의 가중치를 낮춘다.
  • 도메인 사전학습의 이점을 테스트하기 위해 ~8 GB의 비라벨 EDGAR 계약으로 계약-도메인 RoBERTa-base를 사전학습한다.

실험 결과

연구 질문

  • RQ1대규모 도메인 특화 주석 데이터가 NLP 모델이 주목할 만한 계약 조항을 효과적으로 식별하는 데 도움이 될 수 있는가?
  • RQ2모델 설계와 학습 데이터 규모가 계약 검토 작업의 성능에 어떤 영향을 미치는가?
  • RQ3계약 분석에 있어 도메인 특화 사전학습의 상대적 이점은 무엇인가?

주요 결과

  • DeBERTa-xlarge가 전반적인 AUPR에서 최고를 달성(47.8%), Precision@80% Recall은 44.0%, Precision@90% Recall에서 17.8%.
  • 큰 모델 사이즈조차도 이익이 가변적이며, DeBERTa가 BERT를 실질적으로 능가하는 반면 일부 사이즈 증가가 미미한 개선을 보인다.
  • 도메인 특화 사전학습은 계약에 대해 비사전학습 기본값에 비해 소폭의 AUPR 증가(약 3개 포인트)를 제공합니다.
  • 라벨 카테고리에 따라 성능이 크게 달라지며, 일부 카테고리는 천장에 가까운 반면 다른 카테고리는 약 20–30% AUPR입니다.
  • 학습 데이터 규모가 성능에 강하게 영향을 미치며, 데이터를 한 차례 증가시키면 상당한 이득이 발생합니다(예: RoBERTa-base의 27.6%에서 42.6% AUPR로 증가).
  • CUAD는 법률 검토 맥락에서 높은 재현율이 필요한 NAS(NAS와 같은) 방식의 도전적인 벤치마크입니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.