Skip to main content
QUICK REVIEW

[论文解读] Comparison-Based Framework for Psychophysics: Lab versus Crowdsourcing

Siavash Haghiri, Patricia Rubisch|arXiv (Cornell University)|May 17, 2019
Mental Health Research Topics参考文献 31被引用 8
一句话总结

本文提出一种基于比较的身心物理学框架,结合三元组问题('X与Y更相似,还是X与Z更相似?')与机器学习,以预测感知相似性。尽管处于嘈杂、非受控的环境中,通过亚马逊Mechanical Turk众包收集的数据,其三元组预测准确率与实验室实验相比仅低约5%,表明当与稳健的学习算法结合时,基于比较的方法即使在低控制环境下也能产生可靠的身心物理学数据。

ABSTRACT

Traditionally, psychophysical experiments are conducted by repeated measurements on a few well-trained participants under well-controlled conditions, often resulting in, if done properly, high quality data. In recent years, however, crowdsourcing platforms are becoming increasingly popular means of data collection, measuring many participants at the potential cost of obtaining data of worse quality. In this paper we study whether the use of comparison-based (ordinal) data, combined with machine learning algorithms, can boost the reliability of crowdsourcing studies for psychophysics, such that they can achieve performance close to a lab experiment. To this end, we compare three setups: simulations, a psychophysics lab experiment, and the same experiment on Amazon Mechanical Turk. All these experiments are conducted in a comparison-based setting where participants have to answer triplet questions of the form "is object x closer to y or to z?". We then use machine learning to solve the triplet prediction problem: given a subset of triplet questions with corresponding answers, we predict the answer to the remaining questions. Considering the limitations and noise on MTurk, we find that the accuracy of triplet prediction is surprisingly close---but not equal---to our lab study.

研究动机与目标

  • 探究在非受控环境下,基于三元组比较的身心物理学方法是否仍能实现可靠结果。
  • 评估机器学习模型能否准确预测未被询问的三元组答案,从而实现大规模数据收集的可行性。
  • 从准确率和一致性角度,比较实验室实验(受控)与众包环境(MTurk,非受控)在三元组预测上的表现。
  • 评估整合多位参与者的回答是否能提升三元组预测的准确率,以及序数嵌入技术是否能揭示有意义的感知结构。

提出的方法

  • 实验室和MTurk环境下的参与者回答了随机生成的三元组问题,比较100张通过不同参数(可达性、一致性、颗粒度)生成的图像之间的感知相似性。
  • 采用子采样策略,将所需三元组响应数量从O(n³)减少到可管理的子集,从而实现实际可行的数据收集。
  • 训练机器学习模型,利用部分三元组响应预测未被询问的三元组答案,并在保留的测试集上进行评估。
  • 在不同训练集大小和参与者群体(包括多位参与者的数据合并会话)下,测量预测准确率。
  • 应用序数嵌入技术(如t-STE)将三元组答案推断出的感知相似性空间可视化为二维欧几里得空间。
  • 对实验室与MTurk的表现进行统计比较,包括在实验室与MTurk会话之间进行交叉验证,以评估感知的一致性。

实验结果

研究问题

  • RQ1基于三元组问题和机器学习的比较式框架是否能在众包环境中实现可靠的感知相似性预测?
  • RQ2MTurk中三元组响应的预测准确率与受控实验室实验相比如何?
  • RQ3整合多位参与者的数据是否能提升三元组预测模型的准确率?
  • RQ4序数嵌入技术能否从基于比较的数据中揭示有意义的感知维度?
  • RQ5从三元组响应中推断出的感知相似性结构在实验室与众包参与者之间是否具有一致性?

主要发现

  • 在亚马逊Mechanical Turk上,三元组响应的预测准确率与受控实验室环境相比仅低约5%,表明感知判断具有高度一致性。
  • 当整合四个会话的数据时,预测准确率提高了约5个百分点,但进一步整合更多会话未带来额外增益,表明信息增益已趋于饱和。
  • 实验室/MTurk交叉验证表明,来自两种环境的参与者对图像相似性的感知高度一致,仅存在微小的平均准确率差距。
  • 箱线图显示,MTurk的预测方差更高,尤其在最难的观察者中更为明显,表明众包数据中存在更大的噪声。
  • 三元组数据的序数嵌入显示,感知空间的一个维度与可达性参数强相关,另一个维度与颗粒度参数强相关,表明推断空间中存在有意义的结构。
  • 结果表明,结合机器学习的比较式数据收集方法,能够有效弥补众包环境中实验控制的缺失,使其成为传统实验室身心物理学的可行替代方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。