Skip to main content
QUICK REVIEW

[논문 리뷰] Fault-Tolerant Entity Resolution with the Crowd

Anja Gruenheid, Besmira Nushi|arXiv (Cornell University)|2015. 12. 02.
Mobile Crowdsensing and Crowdsourcing참고 문헌 38인용 수 14
한 줄 요약

이 논문은 빈도 높은 작업자 입력의 노이즈를 고려하여 실수에 강한 엔티티 해석(ER) 프레임워크를 제안한다. 투표 그래프와 MinMax 결정 함수를 도입하여 노이즈가 있는 작업자 입력을 해석하면서도 긍정적 및 부정적 신호를 모두 유지한다. 예산 제약 조건 하에서 작업 선택과 병렬 처리를 최적화함으로써 공감 기반 방법보다 최소 20% 높은 ER 품질을 달성한다.

ABSTRACT

In recent years, crowdsourcing is increasingly applied as a means to enhance data quality. Although the crowd generates insightful information especially for complex problems such as entity resolution (ER), the output quality of crowd workers is often noisy. That is, workers may unintentionally generate false or contradicting data even for simple tasks. The challenge that we address in this paper is how to minimize the cost for task requesters while maximizing ER result quality under the assumption of unreliable input from the crowd. For that purpose, we first establish how to deduce a consistent ER solution from noisy worker answers as part of the data interpretation problem. We then focus on the next-crowdsource problem which is to find the next task that maximizes the information gain of the ER result for the minimal additional cost. We compare our robust data interpretation strategies to alternative state-of-the-art approaches that do not incorporate the notion of fault-tolerance, i.e., the robustness to noise. In our experimental evaluation we show that our approaches yield a quality improvement of at least 20% for two real-world datasets. Furthermore, we examine task-to-worker assignment strategies as well as task parallelization techniques in terms of their cost and quality trade-offs in this paper. Based on both synthetic and crowdsourced datasets, we then draw conclusions on how to minimize cost while maintaining high quality ER results.

연구 동기 및 목표

  • 신뢰할 수 없고 노이즈가 많은 커스텀 작업자 입력 문제를 해결하면서 비용을 최소화하고 결과 품질을 최대화하기 위해.
  • 모순되고 잘못된 작업자 답변을 처리하면서도 부정적 피드백을 버리지 않는 강력한 데이터 해석 메커니즘을 개발하기 위해.
  • 다음 커스텀 소스 문제를 해결하기 위해 최적의 레코드 쌍을 선택하여 단위 비용당 정보 수확을 최대화하기 위해.
  • 비용-품질 트레이드오프를 고려한 증분적이고 고장 내성적인 ER에서의 작업 할당 및 병렬 처리 전략을 평가하기 위해.
  • 실세계 및 시뮬레이션 데이터셋에서 고장 내성 메커니즘이 공감 기반 접근 방식을 능가하는지 입증하기 위해.

제안 방법

  • 작업자로부터 온 긍정적 및 부정적 신호를 모두 캡처하기 위해 쌍별 관계와 그 신뢰도를 기록하는 투표 그래프 데이터 구조를 도입한다.
  • 노이즈가 많은 투표를 처리하기 위한 고장 내성적인 방법으로 MinMax 결정 함수를 제안하며, 고율의 오류가 존재하더라도 작업자 신호와 일관성을 유지한다.
  • 새로운 커스텀 응답이 수집될 때마다 MinMax 행렬과 투표 그래프를 점진적으로 갱신함으로써 온라인 및 증분적 ER을 가능하게 한다.
  • 다음 커스텀 소스 문제를 해결하기 위한 큐잉 전략을 설계하여 기대 정보 수확을 기반으로 작업을 우선순위 정렬함으로써 불확실성 또는 오류를 최소화한다.
  • 내부 및 상호 작업 병렬 처리 기법을 활용하여 효율성을 향상시키고 비용과 결과 품질 간의 트레이드오프를 평가한다.
  • 고장 내성적인 해석 및 작업 선택 메커니즘을 증분적 ER 프레임워크에 통합하여 시간이 지남에 따라 일관성과 정확성을 유지한다.

실험 결과

연구 질문

  • RQ1부정적 피드백을 버리지 않고도 노이즈가 많고 모순되며 악성일 수 있는 커스텀 작업자 입력을 엔티티 해석에서 어떻게 해석할 수 있는가?
  • RQ2비용을 최소화하면서 정보 수확을 최대화하기 위해 다음으로 커스텀 소스로 쿼리할 레코드 쌍을 선택하는 최적의 전략은 무엇인가?
  • RQ3다양한 작업 할당 및 병렬 처리 전략은 커스텀 기반 ER의 품질과 비용에 어떤 영향을 미치는가?
  • RQ4실세계 ER 시나리오에서 고장 내성적인 데이터 해석 메커니즘이 공감 기반 접근 방식을 얼마나 뛰어나게 성능을 높이는가?
  • RQ5고장 내성적인 ER은 커스텀 소스를 넘어 다른 신뢰할 수 없는 데이터 소스로 일반화될 수 있는가?

주요 결과

  • 제안된 MinMax 결정 함수는 긍정적 및 부정적 작업자 신호를 모두 유지하고 추론함으로써 ER 품질을 크게 향상시키며, 두 개의 실세계 데이터셋에서 공감 기반 방법보다 최소 20% 높은 성능을 기록한다.
  • 불확실성 감소 또는 오류 최소화를 우선순위로 삼는 다음 커스텀 소스 큐잉 전략은 무작위 또는 히우리스틱 기반의 작업 선택보다 더 낮은 예산으로 더 높은 결과 품질을 달성한다.
  • 내부 및 상호 작업 병렬 처리 기법은 결과 품질을 떨어뜨리지 않으면서도 실행 효율성을 향상시켜 프레임워크의 확장 가능한 구현을 가능하게 한다.
  • 시뮬레이션 및 커스텀 데이터(아마존 메카니컬 터크를 통해)에 대한 실험적 평가 결과, 고장 내성 메커니즘이 최대 30%의 작업자 오류율에서도 강건함을 입증한다.
  • 이 프레임워크는 커스텀 소스를 넘어선 일반화가 가능하며, 데이터 품질이 불확실한 모든 신뢰할 수 없는 데이터 소스에 적용 가능하다.
  • 부정적 피드백을 통합하고 고장 내성적인 해석을 사용하는 것이 핵심임을 입증한다. 모순을 간과할 경우 최적화되지 않고 일관성 없는 ER 결과가 도출된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.