Skip to main content
QUICK REVIEW

[论文解读] Neural Methods for Point-wise Dependency Estimation

Yao-Hung Hubert Tsai, Han Zhao|arXiv (Cornell University)|Jun 9, 2020
Neural Networks and Applications参考文献 52被引用 6
一句话总结

本文提出基于神经网络的逐点依赖(PD)估计方法,将PD估计建模为监督分类或密度比拟合问题,以避免互信息(MI)变分界中的方差问题。所提出的概率分类器与密度比拟合方法实现了低方差、稳定的PD估计,优于先前的MI估计器,并在自监督表示学习与跨模态检索任务中表现更优。

ABSTRACT

Since its inception, the neural estimation of mutual information (MI) has demonstrated the empirical success of modeling expected dependency between high-dimensional random variables. However, MI is an aggregate statistic and cannot be used to measure point-wise dependency between different events. In this work, instead of estimating the expected dependency, we focus on estimating point-wise dependency (PD), which quantitatively measures how likely two outcomes co-occur. We show that we can naturally obtain PD when we are optimizing MI neural variational bounds. However, optimizing these bounds is challenging due to its large variance in practice. To address this issue, we develop two methods (free of optimizing MI variational bounds): Probabilistic Classifier and Density-Ratio Fitting. We demonstrate the effectiveness of our approaches in 1) MI estimation, 2) self-supervised representation learning, and 3) cross-modal retrieval task.

研究动机与目标

  • 通过引入实例级依赖性分析的逐点依赖(PD)估计,解决互信息(MI)作为汇总统计量的局限性。
  • 克服神经网络MI变分界中高方差的问题,该问题在实践中阻碍了可靠估计。
  • 开发无需边缘似然估计、可扩展至高维复杂结构数据的、数据驱动的神经网络方法。
  • 展示PD估计在MI估计、自监督表示学习与跨模态检索任务中的实用性。
  • 利用基于PD的分析检测多模态数据集中对抗性或异常样本。

提出的方法

  • 将PD估计建模为使用概率分类器的监督二分类任务,其中模型区分联合样本与独立边缘样本。
  • 使用神经网络训练分类器,采用交叉熵损失,确保优化稳定且方差降低。
  • 提出密度比拟合方法,通过最小化真实与估计PD之间的最小二乘差来避免对数与指数运算,提升数值稳定性。
  • 采用独立的判别器架构,共享x与y的特征编码器,其中logits通过个体表示的点积计算。
  • 在概率分类器中使用ReLU激活函数,隐藏层为512-128结构,输出层使用Sigmoid以实现概率解释。
  • 使用Adam优化器,批量大小为512,训练100个周期,利用经验风险最小化与大数定律实现泛化。

实验结果

研究问题

  • RQ1能否在不依赖高方差MI变分界的情况下,利用神经网络有效估计逐点依赖?
  • RQ2在MI估计任务中,概率分类器与密度比拟合在方差、稳定性与性能方面如何比较?
  • RQ3PD估计能否在浅层与深层神经网络架构中提升自监督表示学习性能?
  • RQ4PD估计在识别跨模态数据集(如语音-文本对)中对抗性或异常样本方面的能力如何?
  • RQ5在高维设置下,PD估计是否在偏差与方差方面优于现有MI估计器?

主要发现

  • 所提出的PD估计方法相比先前的神经MI估计器,偏差与方差更低,尤其避免了MI下界估计的不稳定性。
  • 密度比拟合启发了一种新型对比损失,其在浅层与深层自监督表示学习模型中均持续提升了性能。
  • 在跨模态检索中,PD估计成功识别出147个词(占训练集的0.45%)具有负PMI,表明音频与文本特征间存在低或负依赖性。
  • 以'ly'和's'结尾的词在负PMI中占比过高,表明其很可能是对抗性或错位样本。
  • PD估计器在高维连续数据上表现出鲁棒性,在可扩展性与准确性方面优于基于核方法与似然的方法。
  • 实证结果表明,通过概率分类器与密度比拟合实现的PD估计,可有效用于多模态学习中的数据集调试,尤其适用于识别异常或对抗性样本。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。