Skip to main content
QUICK REVIEW

[논문 리뷰] Knowledge Graph Anchored Information-Extraction for Domain-Specific Insights

Vivek Khetan, K. M. Annervaz|arXiv (Cornell University)|2021. 04. 18.
Topic Modeling참고 문헌 6인용 수 4
한 줄 요약

이 논문은 비구조화된 금융 문서에서 작업별 규제 변경 사항을 자동으로 추출하기 위해 최신 NLP 모델들을 활용하는 지식 그래프 기반 정보 추출 파이프라인을 제안한다. 엔티티 추출에는 bi-LSTM-CRF, 의미 역할 부여(SRL)에는 주의 기반 모델, 관계 추출에는 동사 기반 방법을 사용한다. 추출된 데이터를 도메인 특화 지식 그래프에 통합함으로써 실시간 인사이트를 제공하여 규제 업데이트 모니터링에 필요한 인간의 노고를 크게 줄이고 요약 효율성도 높였다.

ABSTRACT

The growing quantity and complexity of data pose challenges for humans to consume information and respond in a timely manner. For businesses in domains with rapidly changing rules and regulations, failure to identify changes can be costly. In contrast to expert analysis or the development of domain-specific ontology and taxonomies, we use a task-based approach for fulfilling specific information needs within a new domain. Specifically, we propose to extract task-based information from incoming instance data. A pipeline constructed of state of the art NLP technologies, including a bi-LSTM-CRF model for entity extraction, attention-based deep Semantic Role Labeling, and an automated verb-based relationship extractor, is used to automatically extract an instance level semantic structure. Each instance is then combined with a larger, domain-specific knowledge graph to produce new and timely insights. Preliminary results, validated manually, show the methodology to be effective for extracting specific information to complete end use-cases.

연구 동기 및 목표

  • 금융과 같이 빠르게 변화하는 도메인에서 규제 변경 사항을 적시에 탐지하는 데 도전하는 것.
  • 대규모 비구조화된 규제 텍스트에서 작업에 관련된 정보만 추출함으로써 인간의 인지 부담을 줄이는 것.
  • 추출된 정보를 도메인 특화 지식 그래프에 통합하여 지속적인 인사이트 생성이 가능한 확장성 있는 반자동 시스템을 구축하는 것.
  • 사용자 정의 기준과 의미적 유사성에 기반한 가용 알림 및 동적 업데이트를 가능하게 하는 것.
  • 금융 외에도 규제 및 준수 분야에 적용 가능한 재사용 가능한 프레임워크를 개발하는 것.

제안 방법

  • 엔티티 추출 성능 향상을 위해 자체 레이블링된 규제 기사 데이터와 CoNLL 2017 데이터를 결합한 데이터셋을 기반으로 bi-LSTM-CRF 모델을 훈련한다.
  • 주장 기반 딥 SRL 모델이 문장 내 토큰들에 대해 술어와 의미 역할(예: 주체, 목적어)을 식별한다.
  • 동사에서 유도된 문법적 및 의미적 신호를 활용해 엔티티 쌍 간의 다중 관계를 식별하는 동사 기반 관계 추출 방법을 사용한다.
  • SRL과 자체 엔티티 추출기 모두에서 감지된 엔티티만 유지함으로써 정밀도를 향상시키는 필터링 단계를 통과시킨다.
  • OpenIE와 ClauseIE의 히우리스틱을 활용해 추출된 삼항관계를 확장함으로써 데이터 모델의 범위를 초월해 지식 그래프를 풍부하게 한다.
  • 최종 지식 그래프는 NIC 데이터베이스에서 유래한 도메인 특화 데이터(기관, 자산, 규제 관계 등)를 통합하며, 새로운 기사 스트림을 지속적으로 수신하여 업데이트된다.

실험 결과

연구 질문

  • RQ1하이브리드 NLP 파이프라인은 비구조화된 법률 및 규제 텍스트에서 특히 임계치 변경과 같은 작업별 규제 이벤트를 효과적으로 추출할 수 있는가?
  • RQ2추출된 의미 삼항관계에 기반한 지식 그래프가 도메인 특화 인사이트의 적시성과 관련성에 얼마나 기여하는가?
  • RQ3엔티티, SRL, 관계 추출 등의 다수 NLP 모델을 통합함으로써 규제 모니터링에 필요한 인간의 노력은 얼마나 감소하는가?
  • RQ4의미적 유사성과 규칙 기반 시스템이 전체 도메인 온톨로지 설계 없이도 정확하고 개인화된 알림을 생성할 수 있는가?
  • RQ5실제 규제 활용 사례에서 원본 문서 크기 대비 추출된 정보의 요약 비율은 어떻게 되는가?

주요 결과

  • 시스템은 131개의 규제 기사에 포함된 약 4,500개 문장에서 7종류의 엔티티를 성공적으로 추출하였으며, 엔티티 인스턴스 수는 'regulated_activity_threshold'의 561건에서 'regulatory_authority'의 6,752건까지 다양했다.
  • 고정밀도를 유지하면서도 높은 재현율을 달성하여 사용자가 불필요한 결과를 쉽게 걸러내는 데 유리하여 인간의 노고 감소 목표를 지원했다.
  • 요약 비율(입력 문서 크기 ÷ 출력 추출 구조 크기)은 유망한 결과를 보였지만, 정확한 수치는 아직 평가 중이다.
  • 히우리스틱 기반 OpenIE 및 ClauseIE 삼항관계 통합으로 인해 초기 데이터 모델을 초월해 지식 그래프의 노드 및 관계 커버리지가 크게 향상되었다.
  • 사용자 정의 구독 규칙과 WordNet 기반 의미적 유사성에 기반해 알림이 성공적으로 생성되어 역할 기반 경고 기능이 가능했다.
  • 시간이 지남에 따라 변화하는 지식 그래프를 통해 지속적인 데이터 수신 및 쿼리 처리를 통해 도메인 수준의 인사이트가 생성되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.