Skip to main content
QUICK REVIEW

[论文解读] Information Theoretic Co-Training

David McAllester|arXiv (Cornell University)|Feb 21, 2018
Gaussian Processes and Bayesian Inference参考文献 7被引用 10
一句话总结

本文提出了一种基于信息论的协同训练框架,用于无监督表示学习,通过联合训练一个从过去到假设的模型和一个从未来到假设的确认模型,以最大化过去和未来感官输入之间的互信息。通过将假设建模为离散符号,并利用交叉熵优化互信息的下界,该方法在21个音素的子集上实现了47.3%的帧级音素准确率——尽管没有使用任何标注数据——展示了基于信息论的新型无监督学习方法。

ABSTRACT

This paper introduces an information theoretic co-training objective for unsupervised learning. We consider the problem of predicting the future. Rather than predict future sensations (image pixels or sound waves) we predict "hypotheses" to be confirmed by future sensations. More formally, we assume a population distribution on pairs $(x,y)$ where we can think of $x$ as a past sensation and $y$ as a future sensation. We train both a predictor model $P_Φ(z|x)$ and a confirmation model $P_Ψ(z|y)$ where we view $z$ as hypotheses (when predicted) or facts (when confirmed). For a population distribution on pairs $(x,y)$ we focus on the problem of measuring the mutual information between $x$ and $y$. By the data processing inequality this mutual information is at least as large as the mutual information between $x$ and $z$ under the distribution on triples $(x,z,y)$ defined by the confirmation model $P_Ψ(z|y)$. The information theoretic training objective for $P_Φ(z|x)$ and $P_Ψ(z|y)$ can be viewed as a form of co-training where we want the prediction from $x$ to match the confirmation from $y$.

研究动机与目标

  • 开发一种基于信息论的新型无监督学习目标,避免直接测量原始感官熵。
  • 实现预测模型与确认模型的联合学习,使其在基于感官输入的事实共享符号表示上达成一致。
  • 通过训练模型分别预测和确认假设,来度量过去与未来感官数据之间的互信息。
  • 探索通过协同训练,共享的、低熵符号语言是否能自然涌现,从而实现有效的无监督表示学习。
  • 在无监督语音表示学习任务上评估该方法,训练过程中不使用任何标注数据。

提出的方法

  • 该方法定义了三元组 (x, z, y) 的联合分布,其中 x 表示过去的感觉输入,y 表示未来的感官输入,z 是从 x 预测出的假设或由 y 确认的假设。
  • 利用数据处理不等式,在由 P_Ψ(z|y) 导出的分布下,以 I(x,z) 作为 I(x,y) 的上界,从而得到一个下界 H_Ψ(z) - H⁺_Ψ,Φ(z|x)。
  • 训练目标为最大化 H_Ψ(z) - H⁺_Ψ,Φ(z|x),其中 H_Ψ(z) 是在小批量数据上 z 的经验熵,H⁺_Ψ,Φ(z|x) 是 P_Φ(z|x) 在 P_Ψ(z|y) 样本上的交叉熵。
  • 模型使用具有64维隐藏状态的GRU和64个符号的字母表,通过带有学习率调度的随机梯度下降进行训练。
  • 为稳定训练,该方法采用一种“克隆”过程,将死亡符号替换为活跃符号的噪声版本,使 H(z) 和 H(z|x) 各增加1比特。
  • 目标函数端到端训练,z 作为 x 的伪标签,确认模型 P_Ψ(z|y) 用于为预测模型 P_Φ(z|x) 生成目标。

实验结果

研究问题

  • RQ1在无法直接访问原始感官熵的情况下,能否有效估计并最大化过去与未来感官输入之间的互信息?
  • RQ2在无标注数据条件下,通过预测模型与确认模型的协同训练,是否能自然涌现出共享的符号语言?
  • RQ3最大化互信息的下界是否能导致无监督学习中产生有意义且解耦的表示?
  • RQ4当训练过程中不使用任何语音标签时,该方法在学习语音表示方面的有效性如何?
  • RQ5该目标是否可扩展至序列等结构化输出?其实际约束是什么?

主要发现

  • 在保留的21个音素子集上,模型实现了47.3%的帧级准确率,显著优于随机猜测,证明了无监督学习的有效性。
  • 在所有帧上,包括罕见或未见音素的帧,模型准确率达到35.1%,表明其在最常见标签之外也具备良好的泛化能力。
  • 无监督符号分布的熵 H_Ψ(z|u) 测量为5.0比特(困惑度32),表明符号集合具有合理的多样性与信息量。
  • 在开发集的窗口位置中,从 x 预测出的最可能假设与从 y 确认的最可能假设一致率达到78.6%,显示出模型间极强的一致性。
  • 在21个最常见音素上,无监督符号的分布较为均匀,表明对假设空间的有效探索。
  • 该方法成功地仅通过协同训练和无标注数据,从原始语音帧中学习到了语音内容的符号表示,其符号多样性与一致性与监督基线方法相当。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。