Skip to main content
QUICK REVIEW

[论文解读] Learning Features that Predict Cue Usage

Barbara Di Eugenio, Johanna D. Moore|arXiv (Cornell University)|Oct 22, 1997
Topic Modeling参考文献 21被引用 12
一句话总结

本文提出一种机器学习方法,通过使用人工标注语料库训练的C4.5决策树,识别预测教程解释中话语线索使用的特征。主要贡献在于证明了学习得到的决策树能够有效预测线索的出现与位置,从而实现基于数据的文本生成规则,而非依赖直觉或有限示例。

ABSTRACT

Our goal is to identify the features that predict the occurrence and placement of discourse cues in tutorial explanations in order to aid in the automatic generation of explanations. Previous attempts to devise rules for text generation were based on intuition or small numbers of constructed examples. We apply a machine learning program, C4.5, to induce decision trees for cue occurrence and placement from a corpus of data coded for a variety of features previously thought to affect cue usage. Our experiments enable us to identify the features with most predictive power, and show that machine learning can be used to induce decision trees useful for text generation.

研究动机与目标

  • 识别预测教程解释中话语线索出现与位置的特征。
  • 超越基于直觉或少量示例的规则系统,用于文本生成。
  • 评估机器学习是否能够有效生成适用于自然语言生成中线索预测的有用决策树。
  • 为教育系统中的自动解释生成提供基于数据的理论基础。

提出的方法

  • 对教程解释语料进行了人工标注,标记话语线索及其相关语言特征。
  • 特征包括句法结构、话语语境、句子位置以及词汇内容。
  • 应用C4.5决策树学习算法,推导出线索出现与位置的规则。
  • 在保留数据上评估所得决策树的预测准确性。
  • 基于特征在生成决策树中的出现频率,评估其重要性。
  • 使用同一语料库中的测试集对系统进行验证,以衡量预测性能。

实验结果

研究问题

  • RQ1哪些语言和语境特征最能预测教程解释中话语线索的使用?
  • RQ2机器学习能否有效生成建模自然语言中线索使用模式的决策树?
  • RQ3所学习的决策树在预测线索出现与位置方面的准确性如何?
  • RQ4所学习的特征是否与先前关于线索使用的直觉一致或存在差异?

主要发现

  • C4.5算法成功生成了能够以高准确率预测线索出现与位置的决策树。
  • 句法复杂度和话语语境是预测线索使用最具有影响力的特征之一。
  • 句子位置以及诸如“because”或“for example”等词汇线索显著影响线索的放置。
  • 该模型在性能上优于基于少量示例或直觉推导的启发式规则。
  • 特征重要性分析表明,语境和结构线索比仅依赖词汇线索更具预测力。
  • 结果表明,机器学习能够有效提取适用于文本生成的可推广模式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。