Skip to main content
QUICK REVIEW

[논문 리뷰] Empowering Investigative Journalism with Graph-based Heterogeneous Data Management

Angelos‐Christos G. Anadiotis, Oana Balalau|arXiv (Cornell University)|2021. 02. 08.
Web Data Mining and Analysis참고 문헌 28인용 수 9
한 줄 요약

이 논문은 정보 추출을 통해 이질적이고 스키마가 없는 데이터(예: PDF, XML, 관계형 데이터베이스)를 통합하여 유일한 지식 그래프를 만드는 그래프 기반 시스템인 ConnectionLens을 제안한다. 또한 P-GAM이라는 병렬 메모리 기반 키워드 검색 엔진을 도입하여 기존 시스템 대비 수개의 순서의 성능 향상을 달성함으로써, 기록 추적 기능과 낮은 사용자 노력으로 생물의학 분야의 이해관계 충돌 네트워크를 상호작용적으로 탐색할 수 있도록 한다.

ABSTRACT

Investigative Journalism (IJ, in short) is staple of modern, democratic societies. IJ often necessitates working with large, dynamic sets of heterogeneous, schema-less data sources, which can be structured, semi-structured, or textual, limiting the applicability of classical data integration approaches. In prior work, we have developed ConnectionLens, a system capable of integrating such sources into a single heterogeneous graph, leveraging Information Extraction (IE) techniques; users can then query the graph by means of keywords, and explore query results and their neighborhood using an interactive GUI. Our keyword search problem is complicated by the graph heterogeneity, and by the lack of a result score function that would allow to prune some of the search space. In this work, we describe an actual IJ application studying conflicts of interest in the biomedical domain, and we show how ConnectionLens supports it. Then, we present novel techniques addressing the scalability challenges raised by this application: one allows to reduce the significant IE costs while building the graph, while the other is a novel, parallel, in-memory keyword search engine, which achieves orders of magnitude speed-up over our previous engine. Our experimental study on the real-world IJ application data confirms the benefits of our contributions.

연구 동기 및 목표

  • 조사를 보도하는 데 있어 대규모이고 동적인, 이질적인 데이터 소스—정형화된, 반구조화된, 비구조화된—는 기존의 데이터 통합 기법이 효과적이지 않다.
  • 저널리스트는 스키마 부족, 낮은 사용자 전문성, 기록 추적의 필요성으로 인해 이러한 데이터를 정제하고 질의하는 데 어려움을 겪는다.
  • 기존 시스템은 저명도가 낮은 실체와 복잡한 다중 소스 연결을 포함한 실제 환경 조건에서 효율적으로 확장되지 못한다.
  • 목표는 생물의학 분야의 조사 보도에 특화된 확장성 있고 상호작용적이며 기록 추적 기능을 갖춘 데이터 관리 파이프라인을 구축하는 것이다.
  • 구체적으로, 이 논문은 병렬 메모리 처리를 활용하여 정보 추출 비용을 줄이고 이질적 그래프에서 키워드 검색을 가속화함으로써 목표를 달성하고자 한다.

제안 방법

  • 시스템은 자동 정보 추출 기법을 사용하여 다양한 소스(예: PDF, XML, 관계형 데이터베이스, 스프레드시트)의 데이터를 하나의 이질적 그래프로 통합한다.
  • 추출 정책을 적용하여 데이터 소스를 선택적으로 처리함으로써 정보 추출 오버헤드를 줄이고 중요한 연결 관계 및 기록 추적 기능을 유지한다.
  • 중앙집중식 그래프-중재자(GAM) 알고리즘을 통해 통합된 그래프에서 키워드 검색을 수행하며, 이중 방향 엣지 탐색과 융통성 있는 스코어링을 지원한다.
  • P-GAM은 GAM의 병렬화된 버전으로, 공유 메모리 병렬 처리를 활용하여 다수의 CPU 코어를 통해 검색을 가속화함으로써 일반 목적 하드웨어에서 성능을 향상시킨다.
  • 시스템은 GUI를 통해 질의 결과 및 그 이웃 영역을 상호작용적으로 탐색할 수 있도록 하여 저널리스트가 다양한 데이터셋 간에 숨겨진 연결 관계를 발견할 수 있도록 한다.
  • 기록 추적 기능은 전 과정에서 유지되며, 저널리스트가 각 실체나 관계를 원천 소스로 거슬러 올라갈 수 있도록 한다.

실험 결과

연구 질문

  • RQ1다양한 소스에서 온 이질적이고 스키마가 없는 데이터를 조사 보도를 위해 효율적으로 통합된 그래프로 통합할 수 있는가?
  • RQ2그래프 구축 과정에서 정보 추출의 계산 비용을 줄일 수 있는 기법은 무엇인가? 이때 중요한 연결 관계는 손상되지 않도록 해야 한다.
  • RQ3이질적이고 동적인 그래프에서 키워드 검색을 어떻게 가속화할 수 있을까? 실세계의 조사 보도 애플리케이션에서 상호작용 가능한 응답 시간을 확보하기 위해선 어떻게 해야 할까?
  • RQ4병렬 메모리 기반 검색 엔진은 다양한 그래프 크기와 데이터 모델에서 얼마나 잘 확장될 수 있을까? 이때 질의 정확도와 기록 추적 능력은 유지되어야 한다.
  • RQ5시스템은 저명도가 낮은 실체를 탐지하여 데이터셋 간의 핵심 이해관계 충돌 관계를 드러내는 데 기여할 수 있는가?

주요 결과

  • P-GAM은 이전의 단일 스레드 기반 GAM 엔진 대비 수개의 순서의 성능 향상을 달성하여 실제 생물의학 분야의 이해관계 충돌 데이터에서 상호작용 가능한 질의 응답 시간을 제공한다.
  • 추출 정책의 사용으로 실제 데이터셋에서 정보 추출 비용이 최대 60% 감소했으며, 핵심 이해관계 충돌 관계 탐지 능력은 손상되지 않았다.
  • 시스템은 6개 이상의 다른 데이터 소스를 아우르는 질의 결과를 성공적으로 검색하여 이질적 환경에서의 다중 데이터셋 키워드 검색의 효과성을 입증했다.
  • 키워드 복잡도가 증가함에 따라 시스템은 목표로 하는 상호작용 응답 시간 범위 내에서 유연하게 반응을 유지하여 확장성을 확인했다.
  • 모든 결과에 대해 완전한 기록 추적 기능을 유지하여 저널리스트가 소스를 검증하고 인용할 수 있도록 했으며, 이는 저널리즘의 신뢰성에 매우 중요하다.
  • 이질적 데이터 소스를 하나의 그래프로 통합함으로써 이전에 드러나지 않았던 연결 관계를 발견할 수 있었으며, 예를 들어 생물의학 전문가를 후원한 잘 알려지지 않은 무역 협회를 발견할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.