Skip to main content
QUICK REVIEW

[논문 리뷰] CAVA: A Visual Analytics System for Exploratory Columnar Data Augmentation Using Knowledge Graphs

Dylan Cashman, Shenyu Xu|arXiv (Cornell University)|2020. 09. 07.
Data Visualization and Analytics참고 문헌 62인용 수 6
한 줄 요약

CAVA는 사용자가 분석 중에 지식 그래프에서 외부 속성을 타블라 데이터셋에 보완할 수 있도록 해주는 시각적 분석 시스템입니다. 상호작용적인 시각적 쿼리와 미리보기 기능을 통해 복잡한 조인과 데이터 탐색을 단순화합니다. 데이터 보완을 시각적 분석 워크플로우에 통합함으로써 분석 결과를 향상시키며, 사용자 연구를 통해 한 시간 이내에 프로그래밍 없이도 효과적인 데이터 보완이 가능함을 입증했습니다.

ABSTRACT

Most visual analytics systems assume that all foraging for data happens before the analytics process; once analysis begins, the set of data attributes considered is fixed. Such separation of data construction from analysis precludes iteration that can enable foraging informed by the needs that arise in-situ during the analysis. The separation of the foraging loop from the data analysis tasks can limit the pace and scope of analysis. In this paper, we present CAVA, a system that integrates data curation and data augmentation with the traditional data exploration and analysis tasks, enabling information foraging in-situ during analysis. Identifying attributes to add to the dataset is difficult because it requires human knowledge to determine which available attributes will be helpful for the ensuing analytical tasks. CAVA crawls knowledge graphs to provide users with a a broad set of attributes drawn from external data to choose from. Users can then specify complex operations on knowledge graphs to construct additional attributes. CAVA shows how visual analytics can help users forage for attributes by letting users visually explore the set of available data, and by serving as an interface for query construction. It also provides visualizations of the knowledge graph itself to help users understand complex joins such as multi-hop aggregations. We assess the ability of our system to enable users to perform complex data combinations without programming in a user study over two datasets. We then demonstrate the generalizability of CAVA through two additional usage scenarios. The results of the evaluation confirm that CAVA is effective in helping the user perform data foraging that leads to improved analysis outcomes, and offer evidence in support of integrating data augmentation as a part of the visual analytics pipeline.

연구 동기 및 목표

  • 데이터 쿠리에이션과 분석을 분리하는 전통적인 시각적 분석 시스템의 한계를 해결하여 반복적 탐색을 제한하지 않기 위해.
  • 실시간 통찰 정보에 기반해 분석 과정 중에 관련 외부 속성을 지식 그래프에서 탐색하고 통합할 수 있도록 하기 위해.
  • 데이터베이스 수준의 작업을 시각적 인터페이스로 추상화함으로써 복잡한 데이터 보완의 장벽을 낮추기 위해.
  • 기술 전문 지식이 없어도 다중 힙 지식 그래프 쿼리의 구성과 이해를 지원하기 위해.
  • 데이터 보완을 시각적 분석 워크플로우의 핵심 구성 요소로 통합하여 분석 결과와 사용자 주도적 데이터 쿠리에이션을 향상시키기 위해.

제안 방법

  • 엔티티 해석 히우리스틱을 사용해 타블라 데이터셋의 각 행을 지식 그래프(예: 위키데이터)의 엔티티에 매핑하기.
  • 각 속성에 대한 데이터 분포와 예시 그래프 경로를 포함한 잠재적 속성 조인의 시각적 미리보기 제공하기.
  • 관련성과 커버리지 기반으로 필터링 및 순위 정렬이 가능한 지식 그래프 관계에서 유도된 후보 속성 목록 탐색 가능하게 하기.
  • 지식 그래프 서구조를 대상으로 다중 힙 집계 및 필터링을 허용하는 시각적 쿼리 빌더를 통한 복잡한 쿼리 구축 지원하기.
  • 사용자가 보완된 속성들의 기원과 논리를 이해하는 데 도움이 되도록 지식 그래프 구조와 조인 경로를 시각화하기.
  • 증강된 속성을 데이터셋에 새로운 컬럼으로 직접 통합하여 데이터 라인제이트와 맥락을 유지하기.

실험 결과

연구 질문

  • RQ1사용자가 사전 프로그래밍 없이 활성 데이터 분석 중에 지식 그래프에서 관련 외부 속성을 효과적으로 탐색하고 통합할 수 있는가?
  • RQ2시각적 분석 워크플로우에 데이터 보완을 통합함으로써 분석 통찰의 질과 깊이에 어떤 영향을 미치는가?
  • RQ3시각적 인터페이스가 복잡한 지식 그래프 쿼리의 구성에 따른 인지적 및 기술적 부담을 어느 정도 감소시킬 수 있는가?
  • RQ4속성 탐색 과정에서 지식 그래프 데이터의 희소성과 모호성을 다루는 데 CAVA는 사용자에게 어떻게 지원하는가?
  • RQ5CAVA의 접근 방식은 예측 모델링과 탐색적 분석을 포함한 다양한 데이터셋과 분석 과제에 일반화될 수 있는가?

주요 결과

  • 사용자 연구에 참여한 6명의 참가자가 60분 이내에 두 개의 데이터셋에서 모두 데이터 보완을 성공적으로 수행하여 CAVA의 학습 가능성과 사용성 확인.
  • CAVA는 사용자가 다중 힙 지식 그래프 쿼리를 시각적으로 구성할 수 있도록 하여 의미 있는 속성 보완을 이끌어내었으며, 이는 후속 분석 작업의 성능 향상에 기여함.
  • 통합된 데이터 분포와 예시 그래프 경로의 시각적 미리보기가 사용자가 후보 속성의 관련성과 품질을 평가하는 데 크게 기여함.
  • 분석 워크플로우에 데이터 보완을 통합함으로써 사용자가 통찰 생성과 데이터 향상 사이를 반복적으로 이동할 수 있었으며, 이는 더 정보 기반이고 효과적인 분석 결정을 이끌어냄.
  • 시각적 신호와 상호작용 기반의 모호성 해소 지원을 통해 데이터 희소성과 엔티티 해석의 모호성 문제를 효과적으로 완화함.
  • 추가적인 두 가지 사용 사례를 통해 예측 모델링과 통찰 생성 과제에서의 효과성을 입증하며 일반화 가능성 확인.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.