[논문 리뷰] Facetize: An Interactive Tool for Cleaning and Transforming Datasets for Facilitating Exploratory Search
Facetize는 비기술자도 CSV, SPARQL 결과 등의 정적 또는 동적 데이터셋을 단계별로 시각화된 작업을 통해 필터링, 변환, 정렬하여 필터 기반 검색에 적합한 형식으로 정리할 수 있도록 돕는 인터랙티브하고 사용자 친화적인 편집기입니다. 필터링, 값 치환, 계층 및 간격 생성, 파생 속성 생성, 지리적 태그 지정 등의 핵심 데이터 준비 작업을 지원하며, 실제 사용자 평가에서 70%의 작업 완료 성공률을 기록하여 높은 사용성 입증.
There is a plethora of datasets in various formats which are usually stored in files, hosted in catalogs, or accessed through SPARQL endpoints. In most cases, these datasets cannot be straightforwardly explored by end users, for satisfying recall-oriented information needs. To fill this gap, in this paper we present the design and implementation of Facetize, an editor that allows users to transform (in an interactive manner) datasets, either static (i.e. stored in files), or dynamic (i.e. being the results of SPARQL queries), to datasets that can be directly explored effectively by themselves or other users. The latter (exploration) is achieved through the familiar interaction paradigm of Faceted Search (and Preference-enriched Faceted Search). Specifically in this paper we describe the requirements, we introduce the required set of transformations, and then we detail the functionality and the implementation of the editor Facetize that realizes these transformations. The supported operations cover a wide range of tasks (selection, visibility, deletions, edits, definition of hierarchies, intervals, derived attributes, and others) and Facetize enables the user to carry them out in a user-friendly and guided manner, without presupposing any technical background (regarding data representation or query languages). Finally we present the results of an evaluation with users. To the best of your knowledge, this is the first editor for this kind of tasks.
연구 동기 및 목표
- 일반 텍스트 데이터셋(예: CSV, SPARQL 결과)을 직접 필터 기반 검색으로 탐색할 수 있도록 하는 데 어려움을 해결하기 위해.
- 원시 데이터셋을 사용자 우아하고 필터 기반 검색에 적합한 형식으로 변환하기 위한 핵심 요구사항을 규명하기 위해.
- 프로그래밍이나 기술적 데이터 지식 없이도 데이터 정제, 변환, 강화를 지원하는 인터랙티브 편집기를 설계하고 구현하기 위해.
- 실제 데이터 준비 시나리오에서 도구의 사용성과 효과성을 평가하기 위해.
- 정적 및 동적 데이터셋 처리를 모두 지원하며, 직접 SPARQL 엔드포인트 통합까지 가능하도록 하기 위해.
제안 방법
- 사용자가 행 필터링, 값 편집, 속성 삭제 또는 숨기기 등의 데이터 변환 작업을 수행할 수 있도록 시각적이고 단계별 인터페이스를 제공합니다.
- 위치 계층 구조 등 계층적 그룹화와 가격 범위 등 수치 간격 생성을 통해 필터의 사용성을 향상시킵니다.
- 규칙 기반 인터페이스를 통해 기존 값 기반으로 새로운 파생 속성(예: '애완동물 및 금연 여부' 플래그)을 정의할 수 있습니다.
- 위도/경도 등의 지리적 속성은 후속 필터 기반 검색 시스템에서 공간 시각화를 위해 명시적으로 표시할 수 있습니다.
- 정적 데이터셋(예: CSV 파일)과 SPARQL 엔드포인트를 통해 가져온 동적 데이터셋을 모두 지원하며, 프로젝트 저장 기능을 통해 점진적인 편집을 보장합니다.
- 데이터셋 새로 고침 시에도 사용자가 정의한 설정을 유지하는 프로젝트 기반 시스템을 통해 변환 워크플로우를 관리합니다.
실험 결과
연구 질문
- RQ1비기술자가 코드나 쿼리 언어 없이도 일반 텍스트 데이터셋(예: CSV, SPARQL 결과)을 필터 기반 검색 시스템에서 효과적으로 정제하고 정렬할 수 있는 방법은 무엇인가요?
- RQ2탐색적 검색을 위해 데이터셋을 준비하기 위해 가장 효과적이고 직관적인 데이터 변환 작업 조합은 무엇인가요?
- RQ3실제 데이터 준비 작업에서 전통적인 데이터 워글링 툴과 비교해 볼 때, 인터랙티브하고 단계별 편집기의 사용성은 어떻게 평가될 수 있나요?
- RQ4Facetize와 같은 도구가 정적 및 동적 데이터셋(예: SPARQL 쿼리 결과)을 통합된 사용자 우량한 인터페이스에서 얼마나 잘 지원할 수 있나요?
- RQ5가이드된 시각적 변환 워크플로우가 데이터 준비 과정에서 작업 완료 성공률과 오류율에 미치는 영향은 무엇인가요?
주요 결과
- 사용자 70%가 전체 데이터 변환 작업을 성공적으로 완료하여 Hippalus와 같은 필터 기반 검색 시스템에 정상적으로 로드할 수 있는 데이터셋을 생성했습니다.
- 10~15분 동안 작업에 투자한 사용자가 가장 높은 성공률 기록을 보였으며, 이는 효과적인 데이터 변환을 위해 적정한 시간 투자가 필요함을 시사합니다.
- 성공률가 가장 높은 사용자들은 1~3건의 오류를 범했으며(35% 성공률), 오류가 없는 사용자들은 오직 20%의 성공률에 머물러 있어, 소규모 오류가 성능에 큰 영향을 주지 않는다는 점을 시사합니다.
- 사용자 40%가 Facetize를 '매우 유용함'으로 평가했고, 60%는 '유용함'으로 평가하여 참가자들 사이에서 강한 실용적 가치를 인식하고 있음을 보여줍니다.
- 사용자 10%만 작업을 포기했으며, 대부분의 실패 사례는 시스템의 본질적 결함보다는 잘못된 사용 방식 때문이었습니다.
- 기술적 배경이 없는 사용자들 역시 계층적 그룹화, 간격 생성, 파생 속성 생성과 같은 복잡한 변환 작업을 성공적으로 수행할 수 있었습니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.