Skip to main content
QUICK REVIEW

[论文解读] Interpreting Expert Annotation Differences in Animal Behavior

Megan Tjandrasuwita, Jennifer J. Sun|arXiv (Cornell University)|Jun 11, 2021
Explainable Artificial Intelligence (XAI)参考文献 22被引用 9
一句话总结

该论文提出了一种程序综合方法,通过联合选择相关轨迹特征并学习反映标注者随时间对特征加权的时序滤波器,来学习动物行为视频中专家标注风格的可解释符号模型。该方法在准确性和可解释性方面优于基线模型,所学习到的滤波器能够清晰可视化专家在标注行为时的差异,从而提高神经科学研究中的可重复性。

ABSTRACT

Hand-annotated data can vary due to factors such as subjective differences, intra-rater variability, and differing annotator expertise. We study annotations from different experts who labelled the same behavior classes on a set of animal behavior videos, and observe a variation in annotation styles. We propose a new method using program synthesis to help interpret annotation differences for behavior analysis. Our model selects relevant trajectory features and learns a temporal filter as part of a program, which corresponds to estimated importance an annotator places on that feature at each timestamp. Our experiments on a dataset from behavioral neuroscience demonstrate that compared to baseline approaches, our method is more accurate at capturing annotator labels and learns interpretable temporal filters. We believe that our method can lead to greater reproducibility of behavior annotations used in scientific studies. We plan to release our code.

研究动机与目标

  • 为解决动物行为标注中的标注者间差异问题,该问题会损害神经科学研究的可重复性。
  • 开发一种方法,以解释专家标注的差异,而无需依赖事后模型解释。
  • 构建一个符号化、可解释的标注行为模型,反映专家如何随时间加权运动特征。
  • 将该方法与现有领域工具(如 Bento)集成,以供神经科学家实际使用。
  • 与黑箱模型(如 1D CNN 或决策树)相比,提升数据效率和模型可解释性。

提出的方法

  • 使用程序综合学习一种领域特定语言(DSL),将特征选择与可学习的时序滤波器结合,用于行为分类。
  • 将每位标注者风格建模为一个程序(α, θ),其中 α 定义架构,θ 定义参数,通过预测误差与结构复杂度之间的权衡进行优化。
  • 采用自顶向下的程序架构搜索策略,使用可微分搜索方法联合优化程序结构与参数。
  • 通过两个滤波器的析取(disjunction)实现时序滤波,允许在目标帧周围对特征进行非对称、平滑的加权。
  • 采用损失函数平衡预测准确性(F1 分数)与模型简洁性(结构成本 s(α)),以偏好可解释的程序。
  • 在 Bento(一种领域特定工具)中可视化所学习的滤波器,以支持领域专家的解释与验证。

实验结果

研究问题

  • RQ1我们如何自动解释专家在动物行为标注中的差异,而不仅仅是标签的一致性?
  • RQ2程序综合能否生成可解释的符号化模型,以反映专家如何随时间加权运动特征?
  • RQ3在行为神经科学背景下,所学习模型的可解释性与黑箱模型(如 1D CNN)和简单模型(如决策树)相比如何?
  • RQ4该方法在多大程度上提升了数据效率和在不同标注者间的性能?
  • RQ5所学习的模型能否通过现有神经科学工具被领域专家有效可视化与验证?

主要发现

  • 所提出方法在所有测试模型中对检测交互行为的 F1 分数最高,优于单滤波器程序,并与浅层决策树性能相当。
  • 在攻击行为检测中,基于析取的程序综合模型表现与单层决策树相当,后者由于过拟合减少而比深层树更准确。
  • 该方法表现出更优的数据效率,尤其在“交互 vs. 其他”任务中,析取模型即使在训练数据有限时仍保持高性能。
  • 所学习的时序滤波器在视觉上平滑且在预测帧周围非对称,比噪声较多的神经网络滤波器或决策树中的隐式阈值更易于领域专家理解。
  • 与基线模型相比,该方法降低了性能方差,其稳定性与 1D CNN 或 Morlet 滤波器相当或更优。
  • 与 Bento 的集成实现了所学习滤波器的直接可视化,证实领域专家认为这些符号化程序在行为分析中具有定性可解释性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。