Skip to main content
QUICK REVIEW

[논문 리뷰] Docs2KG: Unified Knowledge Graph Construction from Heterogeneous Documents Assisted by Large Language Models

Qiang Sun, Yuanyi Luo|UWA Profiles and Research Repository (University of Western Australia)|2024. 06. 05.
Topic Modeling인용 수 4
한 줄 요약

Docs2KG는 다중 모달 데이터(텍스트, 표, 그림, 이미지)를 동적 스키마 생성을 통해 통합함으로써, PDF, 이메일, 웹 페이지, 엑셀 파일 등 이질적인 비정형 문서에서 지식 그래프를 구축하기 위한 통합적이고 LLM 보강형 프레임워크를 제안한다. 이를 통해 구조적이고 의미적인 관계를 융합함으로써 효율적인 의미 기반 쿼리 및 검색 보강 생성(RAG)을 가능하게 하여 LLM의 인사이트 탐색 능력을 크게 향상시키고 환각 현상을 감소시킨다.

ABSTRACT

Even for a conservative estimate, 80% of enterprise data reside in unstructured files, stored in data lakes that accommodate heterogeneous formats. Classical search engines can no longer meet information seeking needs, especially when the task is to browse and explore for insight formulation. In other words, there are no obvious search keywords to use. Knowledge graphs, due to their natural visual appeals that reduce the human cognitive load, become the winning candidate for heterogeneous data integration and knowledge representation. In this paper, we introduce Docs2KG, a novel framework designed to extract multimodal information from diverse and heterogeneous unstructured documents, including emails, web pages, PDF files, and Excel files. Dynamically generates a unified knowledge graph that represents the extracted key information, Docs2KG enables efficient querying and exploration of document data lakes. Unlike existing approaches that focus on domain-specific data sources or pre-designed schemas, Docs2KG offers a flexible and extensible solution that can adapt to various document structures and content types. The proposed framework unifies data processing supporting a multitude of downstream tasks with improved domain interpretability. Docs2KG is publicly accessible at https://docs2kg.ai4wa.com, and a demonstration video is available at https://docs2kg.ai4wa.com/Video.

연구 동기 및 목표

  • 기업 데이터 레이크에서 80%가 비정형 형식을 차지하는 다중 모달, 이질적인 비정형 데이터를 추출하고 통합하는 데 도전하는 것.
  • 기존 지식 그래프 프레임워크의 한계를 극복하기 위한 것으로, 사전 설계된 스키마에 의존하거나 특정 문서 유형이나 모달리티에만 국한되는 것.
  • 원천 참조를 유지하고 구조적 및 의미적 쿼리를 모두 지원하는 동적이고 인간이 참여하는 지식 그래프 구축을 가능하게 하는 것.
  • 원천 기반의 다중 모달 지식 그래프에 기반한 검색 보강 생성(RAG)을 통해 LLM의 환각 현상을 줄이는 것.
  • 의료 및 연구 분야 등 다양한 분야에서 실질적인 구현이 가능한 유연하고 확장 가능하며 공개된 프레임워크를 제공하는 것.

제안 방법

  • Docs2KG는 다양한 문서 유형에 대한 커버리지 극대화를 위해 딥러닝 기반 문서 레이아웃 분석과 마크다운 기반 구조적 파싱을 융합한 이중 경로 아키텍처를 활용한다.
  • 텍스트, 표, 그림, 이미지에서 엔티티와 관계를 추출한 후, 내모달 관계(예: 'has-child', 'before/after') 및 간모달 관계(예: 'explain', 'same-time')를 포함한 통합 지식 그래프를 구성한다.
  • LLM을 활용해 다양한 모달 간 의미적 관계를 생성하며, 예를 들어 'same-time' 또는 'explain' 관계를 통해 표의 캡션과 해당 표를 연결한다.
  • 모든 노드에 그래프 임베딩 모델을 적용하여 의미적 유사도 검색을 가능하게 하며, RAG를 위한 상위-k 관련 노드 검색 및 다단계 쿼리 확장을 지원한다.
  • Cypher 기반 쿼리를 통해 특정 사건이나 시기(예: '2011년과 2021년의 사건')와 관련된 문서 구성 요소를 검색할 수 있도록 지원한다.
  • 시스템은 동적으로 업데이트되고 확장 가능하도록 설계되어 인간의 참여를 통한 정교화 및 원천 추적 기능을 제공한다.

실험 결과

연구 질문

  • RQ1PDF, 이메일, 웹 페이지, 엑셀 파일 등 다양한 형식의 이질적인 비정형 문서에서 통합 지식 그래프를 어떻게 구성할 수 있는가?
  • RQ2텍스트, 표, 그림, 이미지 등 다중 모달 정보를 어떻게 하나의 의미적으로 일관된 지식 그래프에 효과적으로 통합할 수 있는가?
  • RQ3동적이고 LLM 보강형 의미 관계가 지식 그래프의 해석 가능성과 쿼리 표현력 향상에 어떤 역할을 하는가?
  • RQ4구축된 지식 그래프가 원천 기반의 다중 모달 지식 그래프에 기반한 검색 보강 생성(RAG)을 통해 환각 현상을 줄이고 프롬프트의 기반을 강화하는 데 얼마나 기여하는가?
  • RQ5구조적 관계와 의미적 관계를 동시에 통합함으로써, 복잡한 다중 소스 문서 컬렉션에서 인사이트 탐색 능력은 어떻게 향상되는가?

주요 결과

  • Docs2KG는 홍콩의 인구 데이터(2011–2021)를 담은 PDF와 2021–2023년 데이터를 포함한 엑셀 파일에서 데이터를 성공적으로 통합하여, 문서 간 인사이트 추출이 가능한 통합 지식 그래프를 생성하였다.
  • Cypher 쿼리를 사용해 2011년과 2021년의 사건과 관련된 구성 요소를 효과적으로 검색하였으며, 결과는 각각의 원천(엑셀: 초록, PDF: 빨강)에서 유래한 별도의 노드로 시각화되었다.
  • 노드 임베딩을 활용한 의미적 유사도 검색은 '2011년에서 2021년까지의 인구 정보'라는 쿼리에 대해 관련 표와 텍스트 청크를 검색하였으며, 관련 노드의 다단계 확장도 가능했다.
  • 구조적 및 의미적으로 유사한 노드를 검색함으로써 RAG 성능을 향상시켰으며, 이는 LLM의 응답이 원천 기반 지식에 기반하도록 하는 데 기여했다.
  • 시스템은 인간이 참여하는 동적이고 확장 가능한 지식 그래프 구축을 지원하며, 반복적인 정교화 및 원천 문서로의 추적 기능을 제공한다.
  • https://docs2kg.ai4wa.com 에 공개된 Docs2KG는 재현성과 실생활 분야(의료 및 연구 등)의 구현 가능성을 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.