Skip to main content
QUICK REVIEW

[论文解读] Interpretable and Pedagogical Examples

Smitha Milli, Pieter Abbeel|arXiv (Cornell University)|Nov 2, 2017
Explainable Artificial Intelligence (XAI)参考文献 22被引用 11
一句话总结

本文提出一种迭代训练方法:首先在随机样本上训练学生网络,随后训练教师网络,以选择适合该固定学生的教学示例。该方法生成可解释、人类可理解的教学策略,在教授基于规则、概率、布尔和分层概念方面,优于随机示例,适用于神经网络和人类学习。

ABSTRACT

Teachers intentionally pick the most informative examples to show their students. However, if the teacher and student are neural networks, the examples that the teacher network learns to give, although effective at teaching the student, are typically uninterpretable. We show that training the student and teacher iteratively, rather than jointly, can produce interpretable teaching strategies. We evaluate interpretability by (1) measuring the similarity of the teacher's emergent strategies to intuitive strategies in each domain and (2) conducting human experiments to evaluate how effective the teacher's strategies are at teaching humans. We show that the teacher network learns to select or generate interpretable, pedagogical examples to teach rule-based, probabilistic, boolean, and hierarchical concepts.

研究动机与目标

  • 为解决神经网络教师与学生之间涌现通信协议缺乏可解释性的问题。
  • 探究先训练学生后训练教师的迭代训练方法是否能产生更具可解释性的教学策略。
  • 评估所得教学策略是否与人类直觉、教学原则相一致。
  • 通过受控的人类实验,测试教师生成示例在教授人类方面的有效性。
  • 探索联合优化约束是否能导致更具可解释性且与人类兼容的教学协议。

提出的方法

  • 在非教学性、随机分布的示例上训练学生网络,以建立可解释的学习策略。
  • 固定学生网络后,训练教师网络,使其选择或生成能最大化学生性能的示例。
  • 采用软最大化策略(受理性教学启发)定义教师目标:选择最能提升学生对正确概念后验信念的示例。
  • 应用递归贝叶斯框架(源自理性教学)建模师生交互,教师的示例选择基于对学生改进的期望。
  • 通过与人类设计的直觉策略的相似性以及人类在概念学习中的实验,评估可解释性。
  • 使用迭代优化解耦教师与学生训练,避免联合优化导致的任意、不可解释映射。

实验结果

研究问题

  • RQ1教师与学生网络的迭代训练能否产生与人类教学直觉一致的可解释教学策略?
  • RQ2教师生成示例在教授人类概念方面的表现与随机示例相比如何?
  • RQ3所涌现的教学策略在基于规则、概率、布尔和分层领域中,与人类设计的直觉教学策略在多大程度上相似?
  • RQ4在训练教师前固定学生是否能产生比联合优化更具可解释性和有效性的教学协议?
  • RQ5学生归纳偏置和先验假设在塑造可解释的教师行为中起到何种作用?

主要发现

  • 教师网络学习到生成可解释的教学示例,在所有测试领域(基于规则、概率、布尔和分层概念)中,其表现与人类设计的策略高度相似。
  • 在人类实验中,使用教师生成示例教学的参与者在概率概念上的平均准确率为18%,显著高于随机示例组的8%(p < 0.001)。
  • 对于布尔概念,使用教师生成示例的参与者平均准确率为76%,高于随机示例组的71%,差异具有统计学显著性(p < 0.001)。
  • 教师组在概率概念上的最高准确率为70%,而随机组仅为20%,表明教学示例能释放更大的学习潜力。
  • 人类受试者常误判概念结构(如将双峰分布误认为单峰分布),表明即使有优质示例,先验假设和模型不匹配仍会限制学习。
  • 先训练学生后训练教师的迭代训练流程,产生了可解释的教学策略,而联合优化则未能实现,证明了学生归纳偏置在塑造教师行为中的关键作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。