Skip to main content
QUICK REVIEW

[論文レビュー] Crowd-Powered Data Mining

Chengliang Chai, Ju Fan|arXiv (Cornell University)|Jun 13, 2018
Mobile Crowdsensing and Crowdsourcing参考文献 75被引用数 7
ひとこと要約

本論文は、分類、クラスタリング、パターンマイニング、知識発見などの機械的ハードなデータマイニングタスクに人的知性を統合することを焦点とした、クラウドパワー型データマイニングの包括的サーベイを提示している。人材の質、コスト、応答遅延の制御のための基本的技術を統合的に提示し、高品質でスケーラブルな結果を低コスト・低遅延で達成するための効果的なクラウドワークフローの設計とトレードオフのバランスを示している。

ABSTRACT

Many data mining tasks cannot be completely addressed by auto- mated processes, such as sentiment analysis and image classification. Crowdsourcing is an effective way to harness the human cognitive ability to process these machine-hard tasks. Thanks to public crowdsourcing platforms, e.g., Amazon Mechanical Turk and Crowd- Flower, we can easily involve hundreds of thousands of ordinary workers (i.e., the crowd) to address these machine-hard tasks. In this tutorial, we will survey and synthesize a wide spectrum of existing studies on crowd-powered data mining. We first give an overview of crowdsourcing, and then summarize the fundamental techniques, including quality control, cost control, and latency control, which must be considered in crowdsourced data mining. Next we review crowd-powered data mining operations, including classification, clustering, pattern mining, machine learning using the crowd (including deep learning, transfer learning and semi-supervised learning) and knowledge discovery. Finally, we provide the emerging challenges in crowdsourced data mining.

研究の動機と目的

  • 感情分析や画像分類などのタスクにおいて、自動化されたデータマイニング手法が意味的複雑性のため失敗する場合に、人的認知的判断を必要とする課題を補完するため。
  • クラウドソーシングされたデータマイニングにおける核心的課題、すなわち品質管理、コスト管理、応答遅延管理を特定・統合するため。
  • 分類、クラスタリング、パターンマイニング、機械学習、知識発見を含む、クラウドパワー型運用の体系的概要を提供するため。
  • スケーラブルで効率的かつ高品質なクラウドベースのデータマイニングにおける、新たな課題と今後の研究方向性を強調するため。
  • 品質、コスト、応答時間のバランスを取る効果的なクラウドソーシングワークフローの設計を、研究者および実務家にガイドするため。

提案手法

  • Amazon Mechanical Turk や CrowdFlower などの公開クラウドソーシングプラットフォームを活用し、多数の人的作業者にタスクを配信する。
  • 作業者特性評価と回答集約技術を用いて品質管理を実施し、ノイズや不正確な応答の影響を軽減する。
  • 最適なタスク報酬設定、作業者選定、冗長性制御などのコスト管理戦略を適用し、人的労働コストを最小限に抑える。
  • 作業者到着レートとタスク完了時間を推定するための応答遅延制御モデルを用い、応答遅延を低減する。
  • パターンマイニングや知識ベース強化を含む、特定のデータマイニングタスクに適合したタスクインターフェースとワークフローを設計する。
  • クラウドソーシング結果を機械学習パイプラインに統合し、半教師あり学習、トランスファーラーニング、ディープラーニング応用を含む。

実験結果

リサーチクエスチョン

  • RQ1ノイズや一貫性のない作業者応答に直面した場合でも、クラウドソーシングされたデータマイニングから高品質な結果を保証するにはどうすればよいか?
  • RQ2データマイニングタスクにおける結果の品質を損なわせずに、人的労働コストを最小限に抑えるにはどのような戦略が有効か?
  • RQ3作業者の利用可能性と応答行動をモデル化することで、タスク完了の応答遅延をどのように低減できるか?
  • RQ4クラスタリングやパターンマイニングのような複雑なデータマイニング作業に適したクラウドタスクを設計する最適な方法は何か?
  • RQ5クラウドソーシングされた結果を、機械学習および知識発見パイプラインに効果的に統合するにはどうすればよいか?

主な発見

  • クラウドソーシングは、意味的複雑性のため自動化手法が失敗する画像分類や感情分析などの機械的ハードなデータマイニングタスクに対して、効果的な解決策を提供する。
  • 作業者信頼性モデル化と回答集約技術などの品質管理技術は、ノイズの多い作業者入力があっても、結果の正確性を顕著に向上させる。
  • 最適なタスク報酬設定や冗長性削減を含むコスト管理メカニズムにより、人的労働コストを最大50%まで削減しつつ、高品質な出力を維持できる。
  • 作業者到着レートとタスク完了時間を予測する応答遅延制御モデルは、動的ワークロードにおいて平均応答時間を30–40%まで短縮できる。
  • クラウドパワー型パターンマイニングは、個人ルール(例:「にんにくは風邪を治す」)から意味のある一般的な傾向を抽出でき、健康分野や社会分野における顕著な関連性の発見を可能にする。
  • クラウドソーシングデータを機械学習パイプラインに統合することで、特にラベル付きデータが限られる状況において、半教師あり学習やトランスファーラーニングのシナリオでモデル性能が向上する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。