[论文解读] Measuring Conversational Productivity in Child Forensic Interviews
本文提出一种计算框架,通过主题建模和词汇同化(lexical entrainment)来衡量儿童司法访谈中的对话生产力,评估儿童对访谈目标的响应效率。通过构建动态访谈议程并评分响应与议程的契合度与响应性,该方法在捕捉信息相关性方面优于传统的字数统计指标,并对年龄相关的语言差异表现出更强的鲁棒性。
Child Forensic Interviewing (FI) presents a challenge for effective information retrieval and decision making. The high stakes associated with the process demand that expert legal interviewers are able to effectively establish a channel of communication and elicit substantive knowledge from the child-client while minimizing potential for experiencing trauma. As a first step toward computationally modeling and producing quality spoken interviewing strategies and a generalized understanding of interview dynamics, we propose a novel methodology to computationally model effectiveness criteria, by applying summarization and topic modeling techniques to objectively measure and rank the responsiveness and conversational productivity of a child during FI. We score information retrieval by constructing an agenda to represent general topics of interest and measuring alignment with a given response and leveraging lexical entrainment for responsiveness. For comparison, we present our methods along with traditional metrics of evaluation and discuss the use of prior information for generating situational awareness.
研究动机与目标
- 开发一种客观、可计算的度量方法,用于评估儿童司法访谈中的言语生产力,摆脱主观或简化的衡量方式。
- 通过引入基于主题模型的方法,弥补传统指标(如字数统计和人工编码的‘丰富度’)的局限性,以评估信息的相关性及与访谈目标的一致性。
- 利用主题模型动态建模访谈议程,以表示访谈者的信息目标,并评估儿童回应与这些目标的一致程度。
- 将词汇同化作为响应性和亲密度的代理指标,反映对话双方互动中的信任与参与度。
- 构建一种可扩展的自动化评估系统,减少对人工标注的依赖,同时提升评估质量的一致性与保真度。
提出的方法
- 利用先前访谈转录本的主题建模(如LDA或三元语法模型)构建动态访谈议程,以表示访谈者希望引出的关键主题。
- 通过测量回应与当前议程主题之间的词汇重叠程度,使用TF-IDF或类似加权方法,对每个儿童的语句进行‘议程契合度’评分。
- 通过词汇同化来衡量‘响应性’——实时量化儿童词汇与访谈者词汇的匹配程度,反映亲密度与参与度。
- 使用加权参数β和γ将议程契合度与响应性结合,形成综合生产力评分。
- 对会话间得分进行归一化处理,并利用值迭代或决策理论模型,指导自适应访谈策略。
- 使用527份司法访谈转录本验证模型,将各项指标与年龄、字数及人工编码基准进行比较。
实验结果
研究问题
- RQ1能否利用主题建模和词汇同化客观衡量儿童在司法访谈中回应的生产力?
- RQ2所提出的生产力度量指标在捕捉信息相关性方面,与传统字数统计和人工编码的丰富度相比表现如何?
- RQ3该模型的性能在多大程度上受儿童年龄影响?其对语言能力发展差异的鲁棒性如何?
- RQ4基于议程的框架是否可用于生成实时、自适应的访谈策略,以优化信息获取?
- RQ5所提出的度量指标与已知的亲密度和有效访谈指标的相关性如何?
主要发现
- 所提出的综合生产力度量(结合议程契合度与响应性)与儿童年龄的相关性虽具统计显著性但较弱(r = 0.25),低于字数统计的相关性(r = 0.46),表明其对语言发展差异的敏感性较低。
- 基于议程的模型成功过滤了低相关性语句,生成了比字数统计更稀疏但更具信息量的信号,后者表现出高波动性和低保真度。
- 词汇同化作为响应性的代理指标表现强劲,与已知的亲密度指标高度一致,支持其作为亲密度度量的有效性。
- 模型采用三元语法主题模型取得了优异表现,表明即使在高风险司法语境下,简单的NLP技术也能产生有意义的洞察。
- 综合生产力评分(π*)在各年龄组间表现出更高的稳定性和更低的方差,表明其具有更强的鲁棒性与可靠性。
- 该框架支持实时、自适应评分,可用于预先定义‘黄金标准’议程,推动基于证据的访谈政策发展。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。