Skip to main content
QUICK REVIEW

[論文レビュー] Comparison-Based Framework for Psychophysics: Lab versus Crowdsourcing

Siavash Haghiri, Patricia Rubisch|arXiv (Cornell University)|May 17, 2019
Mental Health Research Topics参考文献 31被引用数 8
ひとこと要約

本稿では、三重比較質問(「XとYの間の類似性とXとZの間の類似性のどちらが強いですか?」)を用いた比較ベースの心理物理学フレームワークを提案し、機械学習と組み合わせることで知覚的類似性を予測する。ノイズが多く制御の難しい環境下でも、アマゾン・メカニカル・トゥルクを用いたクラウドソーシングによるデータ収集で、ラボ実験と比較して約5%以内の予測精度を達成した。これは、比較ベースの手法が、堅牢な学習アルゴリズムと組み合わせることで、制御の難しい環境下でも信頼できる心理物理学的データを提供できることを示している。

ABSTRACT

Traditionally, psychophysical experiments are conducted by repeated measurements on a few well-trained participants under well-controlled conditions, often resulting in, if done properly, high quality data. In recent years, however, crowdsourcing platforms are becoming increasingly popular means of data collection, measuring many participants at the potential cost of obtaining data of worse quality. In this paper we study whether the use of comparison-based (ordinal) data, combined with machine learning algorithms, can boost the reliability of crowdsourcing studies for psychophysics, such that they can achieve performance close to a lab experiment. To this end, we compare three setups: simulations, a psychophysics lab experiment, and the same experiment on Amazon Mechanical Turk. All these experiments are conducted in a comparison-based setting where participants have to answer triplet questions of the form "is object x closer to y or to z?". We then use machine learning to solve the triplet prediction problem: given a subset of triplet questions with corresponding answers, we predict the answer to the remaining questions. Considering the limitations and noise on MTurk, we find that the accuracy of triplet prediction is surprisingly close---but not equal---to our lab study.

研究の動機と目的

  • 制御の難しい環境下でも、三重比較を用いた比較ベースの心理物理学が信頼できる結果をもたらすかどうかを調査すること。
  • 機械学習モデルが、一部の応答から未質問の三重比較の答えを正確に予測できるかどうかを評価することにより、大規模なデータ収集の可能性を検討すること。
  • ラボ実験(制御済み)とクラウドソーシング(MTurk、非制御)の両環境において、予測精度と一貫性の観点から三重比較のパフォーマンスを比較すること。
  • 複数の参加者からの応答を統合することで予測精度が向上するかどうか、および順序埋め込み法が意味のある知覚的構造を明らかにできるかどうかを評価すること。

提案手法

  • ラボとMTurkの両環境で参加者が、パラメータ(到達距離、一貫性、粗さ)を変化させた100枚の画像の間における知覚的類似性を比較するランダムな三重比較質問に回答した。
  • 三重比較の必要応答数をO(n³)から管理可能なサブセットに削減するためのサブサンプリング戦略が採用され、実用的なデータ収集が可能になった。
  • 機械学習モデルは、サブセットの三重比較応答を用いて、未質問の三重比較の答えを予測するように訓練され、ホールドアウトされたテストセットで評価された。
  • 訓練データセットのサイズや参加者プールの種類(複数のセッションを統合した場合を含む)に応じて、予測精度を測定した。
  • 順序埋め込み技術(例:t-STE)を用いて、三重比較の答えから推定される知覚的類似性空間を2次元ユークリッド空間に可視化した。
  • ラボとMTurkのパフォーマンスを統計的に比較し、ラボとMTurkの両方のセッション間で交差検証を実施することで、知覚の一貫性を評価した。

実験結果

リサーチクエスチョン

  • RQ1三重比較質問と機械学習を組み合わせた比較ベースのフレームワークは、クラウドソーシング環境でも信頼できる知覚的類似性予測を達成できるか?
  • RQ2MTurkからの三重比較の予測精度は、良好に制御されたラボ実験のものと比べてどの程度か?
  • RQ3複数の参加者からの応答を統合することで、三重比較予測モデルの精度が向上するか?
  • RQ4順序埋め込み技術は、比較ベースのデータから意味のある知覚的次元を明らかにできるか?
  • RQ5三重比較の答えから推定される知覚的類似性構造は、ラボ参加者とクラウドソーシング参加者の間で一貫性を示すか?

主な発見

  • アマゾン・メカニカル・トゥルクでの三重比較応答の予測精度は、制御されたラボ環境での精度と約5%以内であり、知覚的判断の高い一貫性を示している。
  • 4つのセッション分のデータを統合すると予測精度が約5パーセンテージポイント向上したが、さらに統合を進めてもさらなる向上は得られず、情報量の飽和が示唆された。
  • ラボ/MTurk間の交差検証では、両環境の参加者が画像の類似性を非常に一貫して認識しており、平均的な精度差はわずかにとどまっていることがわかった。
  • ボックスプロットの結果、MTurkの予測には特に困難な観察者において、より高い分散が認められ、クラウドソーシングデータに大きなノイズが存在することが示された。
  • 三重比較データの順序埋め込みにより、知覚的空間の1つの次元が到達距離パラメータと強く相関しており、もう1つの次元が粗さパラメータと相関していることが明らかになった。これは、推定された空間内に意味のある構造が存在することを示唆している。
  • これらの結果から、機械学習を用いた比較ベースのデータ収集は、クラウドソーシングにおける実験的制御の欠如を補うのに効果的であり、従来のラボベースの心理物理学の代替手段として有効であると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。