Skip to main content
QUICK REVIEW

[论文解读] Are Graph Neural Networks Miscalibrated?

Leonardo Vilela Teixeira, Brian Jalaian|arXiv (Cornell University)|May 7, 2019
Advanced Graph Neural Networks参考文献 44被引用 7
一句话总结

本文研究了图神经网络(GNNs)在多个基准数据集上的校准性能,发现尽管部分GNNs校准良好,但许多GNNs在更复杂的任务上存在显著的校准偏差。即使应用了最先进的校准技术(如温度缩放和蒙特卡洛丢弃),模型的校准性能依然较差,表明现有方法无法解决由于GNNs的关联性、非独立同分布(non-i.i.d.)数据结构所导致的根本性校准偏差问题。

ABSTRACT

Graph Neural Networks (GNNs) have proven to be successful in many classification tasks, outperforming previous state-of-the-art methods in terms of accuracy. However, accuracy alone is not enough for high-stakes decision making. Decision makers want to know the likelihood that a specific GNN prediction is correct. For this purpose, obtaining calibrated models is essential. In this work, we perform an empirical evaluation of the calibration of state-of-the-art GNNs on multiple datasets. Our experiments show that GNNs can be calibrated in some datasets but also badly miscalibrated in others, and that state-of-the-art calibration methods are helpful but do not fix the problem.

研究动机与目标

  • 评估最先进GNNs在标准图基准数据集上的校准性能。
  • 评估原本为独立同分布(i.i.d.)数据设计的现有校准方法——如温度缩放和蒙特卡洛丢弃(MCD)——在关系型(非i.i.d.)数据上训练的GNNs中是否能有效纠正校准偏差。
  • 确定GNNs中的校准偏差是否为系统性问题,无法通过当前校准技术解决。
  • 为GNN预测中softmax置信度分数在高风险决策中的可靠性提供实证证据。

提出的方法

  • 使用期望校准误差(ECE)在多个数据集上对GNNs(GCN、GAT、GIN)进行经验校准评估。
  • 应用标准校准技术:温度缩放和蒙特卡洛丢弃(MCD),以提升模型校准性能。
  • 使用平衡准确率和ECE指标评估模型性能与校准质量,其中ECE基于置信度分箱计算。
  • 使用交叉熵损失进行模型训练,并将softmax置信度输出与真实预测频率进行对比。
  • 在具有不同复杂度和类别分布的数据集上,比较校准与未校准模型的性能。
  • 报告ECE≥50指标,用于衡量高置信度预测中的校准误差,以突出在关键决策中的可靠性。

实验结果

研究问题

  • RQ1最先进GNNs在多样化图数据集上是否校准良好?
  • RQ2现有校准技术(如温度缩放和MCD)在多大程度上能改善GNNs的校准性能?
  • RQ3图数据的非i.i.d.特性是否加剧了GNNs相较于标准深度学习模型的校准偏差?
  • RQ4为i.i.d.数据设计的校准方法能否有效纠正关系型GNNs中的校准偏差?
  • RQ5GNNs中的校准偏差是否为持续性问题,无法通过当前校准技术解决?

主要发现

  • 在Cora-Full数据集上,GIN模型准确率为62.45%,但ECE≥50高达3.73,表明置信度校准差。
  • 在PubMed数据集上,GIN模型准确率为87.38%,但ECE≥50为1.22,表明即使准确率高,仍存在校准偏差。
  • 在CiteSeer数据集上,GIN模型准确率为69.49%,ECE≥50为7.33,揭示高置信度预测中存在显著校准偏差。
  • 即使在应用温度缩放和MCD后,Cora-Full和CiteSeer等复杂数据集上的GNNs仍表现出持续的校准偏差,ECE≥50值保持较高(例如,GIN-MCD在Cora-Full上的ECE≥50为18.83)。
  • 在Facebook和Amazon-Ph数据集上,GNNs表现出高准确率(如Amazon-Ph上为94.24%),但ECE≥50分别为1.66和2.70,表明置信度估计不可靠。
  • 结果表明,对i.i.d.数据有效的校准方法无法解决GNNs中的校准偏差,尤其在复杂、非i.i.d.图结构数据上。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。