[論文レビュー] Four Years in Review: Statistical Practices of Likert Scales in Human-Robot Interaction Studies
この論文は、2016年から2019年までの110件のヒューマンロボットインタラクション(HRI)研究におけるリッカート尺度の統計的誤用をレビューし、正しい設計と分析を採用した論文はわずか3件にとどまることを明らかにした。本研究では、複数項目尺度の使用、仮定の検証、多重比較補正などのベストプラクティスを提案することで、HRI研究におけるデータの厳密さと妥当性を向上させることを目的としている。
As robots become more prevalent, the importance of the field of human-robot interaction (HRI) grows accordingly. As such, we should endeavor to employ the best statistical practices. Likert scales are commonly used metrics in HRI to measure perceptions and attitudes. Due to misinformation or honest mistakes, most HRI researchers do not adopt best practices when analyzing Likert data. We conduct a review of psychometric literature to determine the current standard for Likert scale design and analysis. Next, we conduct a survey of four years of the International Conference on Human-Robot Interaction (2016 through 2019) and report on incorrect statistical practices and design of Likert scales. During these years, only 3 of the 110 papers applied proper statistical testing to correctly-designed Likert scales. Our analysis suggests there are areas for meaningful improvement in the design and testing of Likert scales. Lastly, we provide recommendations to improve the accuracy of conclusions drawn from Likert data.
研究の動機と目的
- HRI研究におけるリッカート尺度の使用に関する一般的な統計的および設計上の誤りを特定し、是正すること。
- 2016年から2019年の4年間にわたり、国際的ヒューマンロボットインタラクション会議(HRI)の会議録を系統的にレビューすることで、HRI分野におけるリッカート尺度の実態を評価すること。
- 心理測定学の文献に基づき、コンSENSUSに基づくベストプラクティスを、リッカート尺度の設計と分析に関して確立すること。
- 知覚的および態度的データに依存するHRI研究における方法論的厳密さと再現可能性を促進すること。
- HRIコミュニティが、標準化され、検証済みの方法でアンケート設計と統計的検定を採用するよう促すこと。
提案手法
- 心理測定学の文献を包括的にレビューし、リッカート尺度の設計と分析におけるベストプラクティスを定義した。
- 2016年から2019年までの国際的ヒューマンロボットインタラクション会議(HRI)から抽出された110件のHRI論文を調査し、ベストプラクティスへの適合度を評価した。
- リッカート尺度として誤って記述された応答形式の誤用、多面的構成概念を測定するために単一項目を使用した、不適切な統計的検定などの誤りを評価した。
- リッカート尺度データにパラメトリック検定を適用する前に、正規性仮定が検証されているかを評価した。
- 適切な場合には、多重比較補正手法を後処理として適用し、報告の透明性を評価した。
- 心理測定学の文献におけるコンセンサスと、HRI実務における観察された欠陥に基づき、実行可能な推奨事項のセットを提言した。
実験結果
リサーチクエスチョン
- RQ12016年から2019年の間、HRI研究においてリッカート尺度がどの程度不適切に設計されたり分析されたりしているか。
- RQ2HRI研究におけるリッカート尺度の使用に関して、最も一般的な統計的およびメソドロジカルな誤りは何か。
- RQ3HRI研究者が、リッカートデータにパラメトリック統計的検定を適用する前に、仮定をどの程度検証しているか。
- RQ4リッカート尺度の誤用が、HRI研究から導かれる結論の妥当性と信頼性にどのように影響しているか。
- RQ5HRIにおけるリッカート尺度データの設計、分析、報告を改善するために、根拠に基づくベストプラクティスとして何を推奨できるか。
主な発見
- 2016年から2019年の110件のHRI論文のうち、ベストプラクティスに従って適切に設計・検証されたリッカート尺度を用いたのはわずか3件(2.7%)であった。
- 調査された論文の56%が、パラメトリック検定をリッカート尺度データに適用するにあたり、正規性仮定を検証していなかった。
- 約50%の論文が、個々の応答尺度を誤って「リッカート尺度」と呼んでおり、一般的な用語の誤用を犯していた。
- 18%の論文が、複雑で多面的な構成概念を測定するために4項目未満の項目を使用しており、信頼性基準に違反していた。
- 大多数の論文が、スケールスコアの集計値ではなく、個々のリッカート項目を分析しており、測定の妥当性を損なっていた。
- 本研究では、4年間のレビュー期間を通じて統計的実務に改善が見られず、改革の継続的必要性が示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。