[论文解读] Latent Feature Extraction for Process Data via Multidimensional Scaling
本文提出一种基于多维尺度变换(MDS)的方法,从计算机化评估中的响应过程提取潜在特征,将操作序列视为高维数据以捕捉行为模式。该方法在预测读写能力和算术能力得分方面优于传统二元响应模型,即使使用较少题目,过程数据也能提升预测准确性。
Computer-based interactive items have become prevalent in recent educational assessments. In such items, the entire human-computer interactive process is recorded in a log file and is known as the response process. This paper aims at extracting useful information from response processes. In particular, we consider an exploratory latent variable analysis for process data. Latent variables are extracted through a multidimensional scaling framework and can be empirically proved to contain more information than classic binary responses in terms of out-of-sample prediction of many variables.
研究动机与目标
- 开发一种通用的、探索性的方法,用于从计算机化评估中的复杂、非标准响应过程中提取潜在变量。
- 解决传统模型无法处理日志数据中可变长度、分类的操作序列的问题。
- 证明过程数据包含比二元对错响应更多的预测信息,用于结果变量的预测。
- 实现在不依赖先验认知模型或题目特定摘要的情况下,对响应过程进行可扩展的、与题目无关的分析。
- 通过整合从响应序列中提取的MDS特征,提升读写能力和算术能力得分的预测性能。
提出的方法
- 使用多维尺度变换(MDS)基于操作序列之间的成对差异性,将响应过程嵌入低维欧几里得空间。
- 采用差异性度量(如Levenshtein距离或最优符号对齐)量化不同响应过程之间的差异。
- 从MDS坐标中提取前20个主成分,作为代表行为模式的潜在特征。
- 将这些特征与二元题目结果一起整合到线性预测器中,用于得分预测。
- 应用向前AIC选择法识别最具信息量的题目,并使用L2正则化防止过拟合。
- 通过测试集验证该方法,并使用样本外决定系数(OSR²)评估性能。
实验结果
研究问题
- RQ1与仅使用二元响应相比,从响应过程中提取的潜在特征是否能提升对读写能力和算术能力得分的预测?
- RQ2当仅使用部分题目时,包含过程数据如何影响预测准确性?
- RQ3响应过程是否包含比二元结果更多的信息,尤其是在错误答案中?
- RQ4基于MDS的特征提取是否可作为教育评估中过程数据分析的通用、与题目无关的方法?
- RQ5不同人口统计群体的行为模式差异在提取的MDS特征中如何体现?
主要发现
- 包含20个MDS衍生特征的过程模型在预测读写能力和算术能力得分方面显著优于仅使用二元响应的基线模型。
- 仅使用五个题目时,过程模型的OSR²与基线模型使用全部14个题目的结果相当。
- 预测性能的提升在读写能力方面比算术能力更显著,表明过程数据更能反映与读写能力相关的素养。
- 错误回答通常包含更丰富的操作序列,而过程模型捕捉到了这一额外信息,从而在错误答案的预测中表现更优。
- 基于MDS的特征提取方法在不同人口统计群体中均表现稳健,且无需事先了解题目结构或认知模型。
- 该方法展现出强大的样本外预测性能,验证了过程数据在传统响应格式之外的实用价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。