[论文解读] Learning to Scaffold: Optimizing Model Explanations for Teaching
本文提出 SMaT(Scaffold-Maximizing Training),一种元学习框架,通过优化模型解释以提升学生模型模拟教师模型预测的能力。通过将解释质量视为学生可模拟性的函数,SMaT 训练一种基于注意力的解释器,以在 NLP 和视觉任务中生成更有效、更符合人类认知的解释,显著优于静态或基于梯度的基线方法,在模拟准确性和合理性方面表现更优。
Modern machine learning models are opaque, and as a result there is a burgeoning academic subfield on methods that explain these models' behavior. However, what is the precise goal of providing such explanations, and how can we demonstrate that explanations achieve this goal? Some research argues that explanations should help teach a student (either human or machine) to simulate the model being explained, and that the quality of explanations can be measured by the simulation accuracy of students on unexplained examples. In this work, leveraging meta-learning techniques, we extend this idea to improve the quality of the explanations themselves, specifically by optimizing explanations such that student models more effectively learn to simulate the original model. We train models on three natural language processing and computer vision tasks, and find that students trained with explanations extracted with our framework are able to simulate the teacher significantly more effectively than ones produced with previous methods. Through human annotations and a user study, we further find that these learned explanations more closely align with how humans would explain the required decisions in these tasks. Our code is available at https://github.com/coderpat/learning-scaffold
研究动机与目标
- 解决缺乏一种原则性、可度量的标准来评估和改进模型解释,而不仅仅是依赖定性期望。
- 将解释质量形式化为学生模型仅通过解释模拟教师行为的能力,与教学支架理论保持一致。
- 开发一种直接优化解释以提升学生学习效果的框架,而非评估现有方法。
- 通过与人类决策过程中的推理模式对齐,提升解释的合理性。
- 实现解释器的端到端训练,无需人工标注的推理过程,以可模拟性作为可解释性的代理指标。
提出的方法
- 将解释优化问题形式化为双层优化:解释器根据学生在模拟教师模型方面的表现进行更新。
- 使用高阶微分技术,反向传播通过学生训练过程,实现解释器的端到端优化。
- 提出一种参数化的基于注意力的解释器模块,可使用 SMaT 进行训练,并可适配任意基于注意力的模型(如 Transformer)。
- 训练学生模型利用输入和解释来预测教师的输出,同时更新解释器参数以最大化推理时的模拟准确率。
- 将框架集成到多种任务中——文本分类、图像分类和多语言文本回归——并使用预训练的 Transformer 模型。
- 通过自动化可模拟性指标和人工标注的合理性进行解释质量评估,包括在图像分类任务中的人工研究。
实验结果
研究问题
- RQ1我们能否优化模型解释,使学生模型更准确地模拟教师模型?
- RQ2与现有方法相比,我们框架生成的解释是否更符合人类推理模式?
- RQ3SMaT 框架是否可在无需架构约束的情况下应用于多种模态和任务?
- RQ4通过可模拟性实现解释器的端到端训练,是否能产生比基于梯度或静态注意力方法更忠实、更非平凡的解释?
- RQ5该框架是否可扩展以优化非注意力型解释器,如基于梯度或推理生成的方法?
主要发现
- 使用 SMaT 生成的解释进行训练的学生模型,在未见样本上的模拟准确率显著高于使用静态注意力或基于梯度解释的学生模型。
- 人工标注评估显示,SMaT 生成的解释在文本分类和回归任务中更具合理性,且更接近人类推理过程。
- 在图像分类的用户研究中,参与者认为 SMaT 生成的解释更具直观性,且更符合人类决策过程,优于基线方法。
- 该框架成功避免了早期可模拟性优化解释器常见的琐碎解释协议(如仅关注标点符号或停用词)。
- 参数化的注意力解释器在 Transformer 中发现了有意义的注意力头,展示了超越标准注意力可视化方法的可解释性。
- SMaT 在任务间具有良好的泛化能力,在无需架构修改的情况下,同时提升了 NLP 和计算机视觉基准中的可模拟性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。