Skip to main content
QUICK REVIEW

[논문 리뷰] Big Data Quality: A systematic literature review and future research directions

Mostafa Mirzaie, Behshid Behkamal|arXiv (Cornell University)|2019. 04. 10.
Data Quality and Management참고 문헌 84인용 수 5
한 줄 요약

이 논문은 2009년에서 2019년 사이의 대용량 데이터 품질 연구에 대한 체계적인 문헌 고찰을 제시하며, 데이터 처리 유형(스트림, 배치, 하이브리드), 주요 과제, 평가 방법을 기반으로 분류하는 계층적 프레임워크를 제안한다. 기존 접근 방식의 핵심적 격차를 규명하고 실제 응용 분야에서 대용량 데이터 품질을 향상시키기 위한 향후 연구 방향을 제시한다.

ABSTRACT

One of the most significant problems of Big Data is to extract knowledge through the huge amount of data. The usefulness of the extracted information depends strongly on data quality. In addition to the importance, data quality has recently been taken into consideration by the big data community and there is not any comprehensive review conducted in this area. Therefore, the purpose of this study is to review and present the state of the art on the quality of big data research through a hierarchical framework. The dimensions of the proposed framework cover various aspects in the quality assessment of Big Data including 1) the processing types of big data, i.e. stream, batch, and hybrid, 2) the main task, and 3) the method used to conduct the task. We compare and critically review all of the studies reported during the last ten years through our proposed framework to identify which of the available data quality assessment methods have been successfully adopted by the big data community. Finally, we provide a critical discussion on the limitations of existing methods and offer suggestions on potential valuable research directions that can be taken in future research in this domain.

연구 동기 및 목표

  • 대용량 데이터 환경에서 데이터 품질 확보의 도전이 점점 커지는 데 대비하여, 낮은 품질의 데이터가 지식 추출과 의사결정을 약화시킨다는 점을 해결하기 위함.
  • 지난 10년간 대용량 데이터 품질 연구의 최신 동향을 규명하고 분석하여, 방법론적 추세와 응용 맥락에 중점을 두기 위함.
  • 다양한 대용량 데이터 처리 유형과 과제에서 기존 데이터 품질 평가 방법의 효과성과 도입 수준을 평가하기 위함.
  • 기존 접근 방식의 한계를 부각하고, 향후 대용량 데이터 품질 분야의 연구를 위한 실질적이고 근거 기반의 권고 사항을 제시하기 위함.

제안 방법

  • arXiv와 DBLP를 포함한 주요 학술 데이터베이스 및 저장소에서 사전 정의된 검색 기준을 활용한 체계적 문헌 고찰 수행.
  • 처리 유형(스트림, 배치, 하이브리드), 주요 과제(예: 데이터 정제, 검증), 평가 방법을 기반으로 대용량 데이터 품질 연구를 분류하기 위한 계층적 프레임워크 개발.
  • 2009년에서 2019년 사이에 출판된 126篇의 관련 연구를 분석하여 대용량 데이터 품질 연구의 추세, 방법론, 응용 분야를 맵핑.
  • 기존 데이터 품질 평가 기법 간의 비판적 비교를 수행하여, 그 적합성, 확장성, 실세계 적용 가능성에 중점을 두기 위함.
  • 다양한 대용량 데이터 처리 파이프라인에서 데이터 품질 평가에 대한 반복적인 방법론적 격차와 일관성 없는 점을 규명하기 위함.
  • 결과를 종합하여 현재 접근 방식의 한계에 대한 체계적인 논의를 정리하고, 구체적인 향후 연구 방향을 제안하기 위함.

실험 결과

연구 질문

  • RQ12009년에서 2019년 사이의 대용량 데이터 연구에서 가장 널리 채택된 데이터 품질 평가 방법은 무엇인가?
  • RQ2스트림, 배치, 하이브리드 대용량 데이터 처리 유형 간 데이터 품질 접근 방식은 어떻게 다를까?
  • RQ3대용량 데이터 품질 연구에서 가장 흔한 과제는 무엇이며, 각 과제에 가장 효과적인 방법은 무엇인가?
  • RQ4대용량 데이터 환경에서 현재의 데이터 품질 평가 기법에 대한 주요 한계는 무엇인가?
  • RQ5실제 응용에서 대용량 데이터 품질을 향상시키기 위해 가장 유망한 향후 연구 방향은 무엇인가?

주요 결과

  • 대용량 데이터 품질 연구의 대부분은 배치 처리에 집중되어 있으며, 실시간 스트림 처리에 대한 연구는 상대적으로 적어 동적 데이터 품질 관리 분야에 연구 격차가 있음을 시사한다.
  • 규칙 기반 검증, 통계적 프로파일링, 기계학습과 같은 데이터 품질 평가 방법은 널리 사용되고 있지만, 대용량 데이터 플랫폼과의 통합은 여전히 제한되어 있다.
  • 연구의 소수(15% 미만)만이 생산 환경에서 데이터 품질을 평가하여 실제 배포 환경에서의 경험적 검증 부족을 드러낸다.
  • 대용량 데이터 시스템 내 데이터 품질 평가를 위한 표준화된 지표와 벤치마크가 부족하여 평가 방식이 일관되지 못한 상황이다.
  • 현대 데이터 파이프라인에서 점점 더 널리 사용되고 있음에도 불구하고 하이브리드 처리 모델은 데이터 품질 연구에서 다소 간과되어 있다.
  • 향후 연구는 Spark와 Kafka와 같은 대용량 데이터 처리 프레임워크와 자연스럽게 통합되는 확장성 있고 자동화된, 맥락 인식 기반의 데이터 품질 기법 개발을 우선시해야 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.