Skip to main content
QUICK REVIEW

[논문 리뷰] Getting It All from the Crowd

Beth Trushkowsky, Tim Kraska|arXiv (Cornell University)|2012. 02. 10.
Mobile Crowdsensing and Crowdsourcing참고 문헌 28인용 수 8
한 줄 요약

이 논문은 전통적인 닫힌 세계 가정이 더 이상 성립하지 않는 커스터마이징된 데이터베이스 시스템에서 쿼리의 완전성 문제를 해결하기 위해 종 추정 기반 통계 방법을 제안한다. 인적 자원으로부터의 데이터 수집을 종 추정 문제로 모델링함으로써, 저자들은 쿼리의 완전성 정도를 추정하고 비용-시간 트레이드오프를 안내하는 도구를 개발하여, 사용자가 '모든 것을 확보했는가'를 판단할 수 있도록 한다.

ABSTRACT

Hybrid human/computer systems promise to greatly expand the usefulness of query processing by incorporating the crowd for data gathering and other tasks. Such systems raise many database system implementation questions. Perhaps most fundamental is that the closed world assumption underlying relational query semantics does not hold in such systems. As a consequence the meaning of even simple queries can be called into question. Furthermore query progress monitoring becomes difficult due to non-uniformities in the arrival of crowdsourced data and peculiarities of how people work in crowdsourcing systems. To address these issues, we develop statistical tools that enable users and systems developers to reason about tradeoffs between time/cost and completeness. These tools can also help drive query execution and crowdsourcing strategies. We evaluate our techniques using experiments on a popular crowdsourcing platform.

연구 동기 및 목표

  • 닫힌 세계 가정이 더 이상 적용되지 않는 하이브리드 인간-컴퓨터 데이터베이스 시스템에서 쿼리 의미론의 근본적 과제를 해결하기 위해.
  • 사용자 및 시스템 개발자가 커스터마이징된 데이터 수집에서 쿼리 비용, 실행 시간, 완전성 간의 트레이드오프를 분석할 수 있도록 지원하기 위해.
  • 개방형 환경에서 쿼리 실행 및 커스터마이징 전략 결정을 지원하는 통계 도구를 제공하기 위해.
  • 결과 집합이 유계가 아니며 완전하지 않을 수 있는 환경에서 열거 쿼리(예: SELECT * 또는 COUNT(*))의 신뢰성을 향상시키기 위해.

제안 방법

  • 생태학 및 통계 분야에서 기존에 사용된 비모수적 종 추정 기법을 응용하여, 커스터마이징된 관계 내 고유한 튜플 수를 추정한다.
  • Chao1 및 Chao2와 같은 표준 추정기법을 사용하여, 커스터마이징된 데이터에서 관측된 항목의 빈도를 바탕으로 미관측 항목의 수를 추정한다.
  • 두 가지 새로운 히우리스틱 기법을 제안한다: 하나는 '스트리커'(많은 수의 중복 또는 유효하지 않은 응답을 제출하는 작업자)를 보정하기 위한 것이고, 다른 하나는 기존 목록에 항목을 체계적으로 추가하는 '리스트 워킹' 행동을 탐지하기 위한 것이다.
  • 추정된 완전성 수준을 기반으로 쿼리 실행 전략을 안내하며, 예를 들어 새로운 작업을 더 이상 발행할 시점이나 커스터마이징 전략을 조정할 시점을 결정한다.
  • 표준 입력 방식과 '부정적 제안' 모드를 조합한 하이브리드 사용자 인터페이스를 활용하여, 이미 목록에 있는 항목 외의 새로운 항목만 제출하도록 제한함으로써 데이터 품질과 커버리지 향상을 도모한다.
  • 아마존 메카니컬 터크에서의 실험을 통해 다양한 쿼리 유형에 걸쳐 완전성 추정의 효과성을 검증한다.

실험 결과

연구 질문

  • RQ1결과 집합이 잠재적으로 무한할 수 있는 커스터마이징된 데이터베이스 시스템에서, 열거 쿼리에 대해 '완전성'을 의미적으로 정의할 수 있는가?
  • RQ2진짜 카디널리티가 알려져 있지 않고 데이터가 비균일하고 확률적으로 도착하는 상황에서, 고유한 결과 수(예: 미국 주 전체 또는 취업 시장의 박사 과정 학생 전체)를 어떻게 추정할 수 있는가?
  • RQ3부분적 표본 추출이 이루어진 상황에서, 커뮤니티로부터 모든 관련 결과를 수집했을 가능성을 추정하는 데 사용할 수 있는 통계 기법은 무엇인가?
  • RQ4리스트 워킹이나 스트리킹과 같은 작업자 행동이 완전성 추정의 정확성에 미치는 영향은 무엇이며, 이를 어떻게 완화할 수 있는가?
  • RQ5통계적 추정 도구가 쿼리 처리를 위한 비용 효율적이고 효율적인 커스터마이징 전략을 얼마나 잘 안내할 수 있는가?

주요 결과

  • Chao1 및 Chao2와 같은 표준 종 추정 기법은 표본 수가 제한된 경우에도 커스터마이징된 결과 집합 내 고유 항목 수를 놀랍도록 강력하게 추정할 수 있다.
  • '스트리커'—많은 수의 중복 또는 유효하지 않은 응답을 제출하는 작업자—의 존재는 표준 추정기법의 정확도를 심각하게 떨어뜨리지만, 제안된 보정 히우리스틱 기법은 추정 품질을 향상시킨다.
  • 리스트 워킹 행동(기존 목록을 따르며 항목을 추가하는 행동)을 탐지함으로써, 부정적 제안 인터페이스로 전환하는 등 커스터마이징 전략을 사전에 조정할 수 있다.
  • 이미 목록에 있는 항목만 제출을 금지하는 부정적 제안 사용자 인터페이스는 집합을 확장하고 희귀하거나 이전에 발견되지 않은 항목을 발견하는 데 효과적임이 입증되었다.
  • 통계적 완전성 추정을 쿼리 실행에 통합함으로써, 비용과 완전성의 균형을 고려한 데이터 수집 종료 시점을 데이터 기반으로 결정할 수 있다.
  • 제안된 방법들은 CrowdDB를 넘어서, Qurk 및 sCOOP와 같은 다른 하이브리드 인간-기계 데이터베이스 시스템에도 일반화 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.