[论文解读] Four Years in Review: Statistical Practices of Likert Scales in Human-Robot Interaction Studies
本文回顾了2016至2019年间110项人机交互(HRI)研究中李克特量表的统计误用问题,发现仅有3篇论文采用了恰当的设计与分析方法。研究提出了最佳实践建议,如使用多项目量表、验证假设以及校正多重比较,以提升HRI研究中数据的严谨性与有效性。
As robots become more prevalent, the importance of the field of human-robot interaction (HRI) grows accordingly. As such, we should endeavor to employ the best statistical practices. Likert scales are commonly used metrics in HRI to measure perceptions and attitudes. Due to misinformation or honest mistakes, most HRI researchers do not adopt best practices when analyzing Likert data. We conduct a review of psychometric literature to determine the current standard for Likert scale design and analysis. Next, we conduct a survey of four years of the International Conference on Human-Robot Interaction (2016 through 2019) and report on incorrect statistical practices and design of Likert scales. During these years, only 3 of the 110 papers applied proper statistical testing to correctly-designed Likert scales. Our analysis suggests there are areas for meaningful improvement in the design and testing of Likert scales. Lastly, we provide recommendations to improve the accuracy of conclusions drawn from Likert data.
研究动机与目标
- 识别并解决HRI研究中李克特量表使用过程中的常见统计与设计错误。
- 通过系统性回顾国际人机交互会议论文集,评估2016至2019年这四年内HRI研究中李克特量表实践的现状。
- 基于心理测量学文献,建立共识性最佳实践,用于李克特量表的设计与分析。
- 促进依赖感知与态度数据的HRI研究在方法论上的严谨性与可重复性。
- 鼓励HRI社区采纳标准化、经验证的问卷设计与统计检验实践。
提出的方法
- 系统回顾心理测量学文献,以界定李克特量表设计与分析的最佳实践。
- 调查2016至2019年国际人机交互会议(HRI)中110篇HRI论文,评估其对最佳实践的遵循程度。
- 评估论文中是否存在错误,包括将响应格式错误标记为“李克特量表”、使用单个项目测量多维构念,以及不恰当的统计检验。
- 评估是否在应用参数检验前验证了参数检验的假设(如正态性)。
- 在适当情况下应用事后多重比较校正方法,并评估报告的透明度。
- 基于心理测量学文献中的共识与HRI实践中观察到的缺陷,提出一系列可操作的建议。
实验结果
研究问题
- RQ12016至2019年间,HRI研究中李克特量表的不当设计或分析频率如何?
- RQ2HRI研究中李克特量表使用最常见的统计与方法论错误是什么?
- RQ3HRI研究人员在对李克特数据应用参数统计检验前,验证假设的程度如何?
- RQ4李克特量表的误用如何影响HRI研究结论的有效性与可靠性?
- RQ5有哪些基于证据的最佳实践可推荐以改进HRI研究中李克特量表数据的设计、分析与报告?
主要发现
- 在2016至2019年间的110篇HRI论文中,仅有3篇(2.7%)按照最佳实践正确设计并检验了李克特量表。
- 56%的被评阅论文未能验证应用于李克特量表数据的参数检验所要求的正态性假设。
- 约50%的论文错误地将单个响应量表称为“李克特量表”,犯了常见的术语误用错误。
- 18%的论文使用少于四个项目来测量复杂且多维的构念,违反了可靠性标准。
- 多数论文分析的是单个李克特量表项目,而非聚合后的量表总分,从而削弱了测量的有效性。
- 本研究发现四年内统计实践未见改善,表明改革需求长期存在。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。