Skip to main content
QUICK REVIEW

[论文解读] Data, Trees, and Forests -- Decision Tree Learning in K-12 Education

Tilman Michaeli, Stefan Seegerer|arXiv (Cornell University)|May 10, 2023
Statistics Education and Methodologies被引用 4
一句话总结

本文提出了一种K-12教学理念,结合无代码决策树活动与Orange(一种可视化数据分析工具),以低门槛、实践性的方式教授监督学习与决策树学习。学生在获得概念性理解的同时,将机器学习方法应用于真实数据集,从而提升对伦理问题和实际机器学习局限性的认知。

ABSTRACT

As a consequence of the increasing influence of machine learning on our lives, everyone needs competencies to understand corresponding phenomena, but also to get involved in shaping our world and making informed decisions regarding the influences on our society. Therefore, in K-12 education, students need to learn about core ideas and principles of machine learning. However, for this target group, achieving all of the aforementioned goals presents an enormous challenge. To this end, we present a teaching concept that combines a playful and accessible unplugged approach focusing on conceptual understanding with empowering students to actively apply machine learning methods and reflect their influence on society, building upon decision tree learning.

研究动机与目标

  • 解决在K-12教育中教授机器学习的挑战,且无需预先具备编程或计算机科学知识。
  • 弥合监督学习概念性理解与使用真实数据集进行动手实践之间的鸿沟。
  • 赋能学生探索、比较并反思机器学习方法及其社会影响。
  • 通过在科学、地理和伦理等学科中应用数据科学,支持跨学科学习。
  • 通过结合无代码学习与无代码可视化工具(Orange)进行模型构建,降低机器学习教育的门槛。

提出的方法

  • 学生首先通过无代码活动(即“猴子游戏”)手动构建决策树,以理解决策树学习的逻辑。
  • 随后,他们使用Orange这一可视化数据分析工具,在同一数据集上构建并训练决策树,从而实现手动与自动化方法的对比。
  • 该方法使用数据流图代替代码,消除语法错误,使学生能专注于数据解读与模型评估。
  • 学生将该方法应用于真实世界数据集,如美国人口普查数据与学业表现数据,以探索特征相关性与预测质量。
  • 教学流程包括项目阶段,学生设计自己的机器学习计算成果,随后开展关于公平性、透明度与偏见的讨论。
  • 提供支持材料,包括教案与数据集,采用知识共享许可,供课堂教学使用。

实验结果

研究问题

  • RQ1如何在不需编程知识的前提下,有效在K-12教育中教授决策树学习?
  • RQ2将无代码活动与类似Orange的可视化数据分析工具结合,能在多大程度上提升学生对监督学习的概念性与实践性理解?
  • RQ3当学生使用包含敏感属性(如种族)的真实数据集时,他们如何看待机器学习的伦理影响?
  • RQ4通过此方法,学生能否发展出对模型评估、训练/测试集划分,以及相关性与因果关系之间区别的有意义理解?
  • RQ5该教学理念在多大程度上能支持科学、社会科学与人文学科之间的跨学科学习?

主要发现

  • 学生对监督学习的核心概念形成了清晰理解,包括训练与测试阶段、模型评估,以及机器学习预测的局限性。
  • 无代码活动成功使决策树的内部逻辑变得易于理解且引人入胜,即使学生此前无技术背景。
  • 当学生发现看似无关或敏感的特征(如种族或父母教育水平)竟可被用于模型时,感到惊讶并展开批判性反思。
  • 使用Orange使学生能够实验调整超参数,并对比手动与自动化的树构建过程,从而更深入理解模型行为。
  • 该教学方法促进了学生对伦理问题的意识,特别是公平性、透明度与偏见在机器学习中的体现,尤其是在处理真实世界数据集时。
  • 学生表示,该经历令人耳目一新,让他们意识到大规模数据集可被轻易分析,且模型可基于复杂或可疑特征迅速做出预测。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。