Skip to main content
QUICK REVIEW

[논문 리뷰] Crowd-Powered Data Mining

Chengliang Chai, Ju Fan|arXiv (Cornell University)|2018. 06. 13.
Mobile Crowdsensing and Crowdsourcing참고 문헌 75인용 수 7
한 줄 요약

이 논문은 분류, 군집, 패턴 마이닝, 지식 발견과 같은 기계적 난이도가 높은 데이터 마이닝 작업에 인간 지능을 통합하는 데 중점을 두어 커뮤니티 기반 데이터 마이닝에 대한 종합적인 설문 조사 결과를 제시한다. 커뮤니케이션에서 품질, 비용, 지연 시간을 제어하기 위한 기본 기법들을 통합하여 효과적인 커뮤니티 워크플로우를 설계하고, 품질, 비용, 응답 시간 간의 트레이드오프를 균형 잡는 방법을 보여주며, 낮은 비용과 지연 시간으로도 고성능, 확장 가능한 결과를 달성하는 데 기여한다.

ABSTRACT

Many data mining tasks cannot be completely addressed by auto- mated processes, such as sentiment analysis and image classification. Crowdsourcing is an effective way to harness the human cognitive ability to process these machine-hard tasks. Thanks to public crowdsourcing platforms, e.g., Amazon Mechanical Turk and Crowd- Flower, we can easily involve hundreds of thousands of ordinary workers (i.e., the crowd) to address these machine-hard tasks. In this tutorial, we will survey and synthesize a wide spectrum of existing studies on crowd-powered data mining. We first give an overview of crowdsourcing, and then summarize the fundamental techniques, including quality control, cost control, and latency control, which must be considered in crowdsourced data mining. Next we review crowd-powered data mining operations, including classification, clustering, pattern mining, machine learning using the crowd (including deep learning, transfer learning and semi-supervised learning) and knowledge discovery. Finally, we provide the emerging challenges in crowdsourced data mining.

연구 동기 및 목표

  • 감성 분석 및 이미지 분류와 같은 작업에서 인간의 인지적 판단이 필요한 자동화된 데이터 마이닝의 한계를 해결하기 위해.
  • 커뮤니케이션 기반 데이터 마이닝의 핵심 과제인 품질 제어, 비용 제어, 지연 시간 제어를 특정하고 통합하기 위해.
  • 분류, 군집, 패턴 마이닝, 기계 학습, 지식 발견을 포함한 커뮤니티 기반 운영의 체계적인 개요를 제공하기 위해.
  • 확장 가능하고 효율적이며 고성능인 커뮤니티 기반 데이터 마이닝의 미래 과제와 연구 방향을 부각하기 위해.
  • 연구자와 실무자가 품질, 비용, 응답 시간을 균형 잡는 효과적인 커뮤니케이션 워크플로우를 설계할 수 있도록 안내하기 위해.

제안 방법

  • 대규모 인간 작업자 풀에 작업을 배포하기 위해 Amazon Mechanical Turk 및 CrowdFlower 등의 공개 커뮤니케이션 플랫폼을 활용한다.
  • 작업자 특성 분석 및 답변 집계 기법을 통해 품질 제어를 실시하여 노이즈가 많거나 정확하지 않은 응답을 완화한다.
  • 최적의 작업 가격 설정, 작업자 선택, 중복 제어 전략을 적용하여 인간 노동 비용을 최소화한다.
  • 작업자 도착률과 작업 완료 시간을 추정하는 지연 시간 제어 모델을 사용하여 응답 지연을 줄인다.
  • 패턴 마이닝에서 개인 규칙 추출 및 지식 기반 강화와 같은 특정 데이터 마이닝 작업에 맞는 작업 인터페이스와 워크플로우를 설계한다.
  • 기계 학습 파이프라인에 커뮤니케이션 기반 결과를 통합하며, 준지도 학습, 전이 학습, 딥 러닝 응용을 포함한다.

실험 결과

연구 질문

  • RQ1노이즈가 많거나 일관되지 않은 작업자 응답이 있는 상황에서 커뮤니케이션 기반 데이터 마이닝에서 높은 품질의 결과를 확보할 수 있는 방법은 무엇인가?
  • RQ2결과 품질이 떨어지지 않도록 하면서도 인간 노동 비용을 최소화하기 위한 전략은 무엇인가?
  • RQ3작업자 가용성과 응답 행동을 모델링하여 작업 완료 지연 시간을 어떻게 줄일 수 있는가?
  • RQ4군집, 패턴 마이닝과 같은 복잡한 데이터 마이닝 작업을 위한 효과적인 커뮤니케이션 작업 설계 방법은 무엇인가?
  • RQ5커뮤니케이션 기반 결과를 기계 학습 및 지식 발견 파이프라인에 효과적으로 통합하는 방법은 무엇인가?

주요 결과

  • 자동화된 방법이 의미적 복잡성으로 인해 실패하는 이미지 분류 및 감성 분석과 같은 기계적 난이도가 높은 데이터 마이닝 작업에서 커뮤니케이션 기반 접근이 효과적인 해결책이 될 수 있다.
  • 작업자 신뢰도 모델링 및 답변 집계 기법과 같은 품질 제어 기법들은 노이즈가 많은 작업자 입력에도 불구하고 결과 정확도를 크게 향상시킨다.
  • 최적의 작업 가격 설정 및 중복 감소 전략을 포함한 비용 제어 메커니즘은 고성능 출력을 유지하면서도 노동 비용을 최대 50%까지 줄일 수 있다.
  • 작업자 도착률과 작업 완료 시간을 예측하는 지연 시간 제어 모델은 동적 워크로드에서 평균 응답 시간을 30~40% 감소시킬 수 있다.
  • 커뮤니케이션 기반 패턴 마이닝은 개인 규칙(예: '마늘은 감기를 치료한다')에서 의미 있는 일반적 경향을 추출할 수 있으며, 건강 및 사회 분야에서 중요한 연관성을 발견하는 데 기여한다.
  • 기계 학습 파이프라인에 커뮤니케이션 기반 데이터를 통합하면, 특히 레이블이 부족한 상황에서 준지도 학습 및 전이 학습 시나리오에서 모델 성능이 향상된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.