Skip to main content
QUICK REVIEW

[论文解读] Evaluation of Complex-Valued Neural Networks on Real-Valued Classification Tasks

Nils Mönning, Suresh Manandhar|arXiv (Cornell University)|Nov 29, 2018
Neural Networks and Applications参考文献 21被引用 17
一句话总结

本文在模型容量相当的前提下,对实值分类任务中的复值神经网络(CVNNs)进行了评估。结果表明,当参数数量匹配时,CVNNs 的性能与实值网络相当或略差,这是由于权重初始化和梯度传播方面的挑战所致,提示 CVNNs 在数据或噪声天然存在于复平面上时最具优势。

ABSTRACT

Complex-valued neural networks are not a new concept, however, the use of real-valued models has often been favoured over complex-valued models due to difficulties in training and performance. When comparing real-valued versus complex-valued neural networks, existing literature often ignores the number of parameters, resulting in comparisons of neural networks with vastly different sizes. We find that when real and complex neural networks of similar capacity are compared, complex models perform equal to or slightly worse than real-valued models for a range of real-valued classification tasks. The use of complex numbers allows neural networks to handle noise on the complex plane. When classifying real-valued data with a complex-valued neural network, the imaginary parts of the weights follow their real parts. This behaviour is indicative for a task that does not require a complex-valued model. We further investigated this in a synthetic classification task. We can transfer many activation functions from the real to the complex domain using different strategies. The weight initialisation of complex neural networks, however, remains a significant problem.

研究动机与目标

  • 通过匹配模型容量,对复值神经网络(CVNNs)与实值网络在实值分类任务上的表现进行公平比较。
  • 研究激活函数、深度、宽度和参数预算对 CVNN 性能的影响。
  • 识别在实值数据上 CVNNs 相较于实值模型具有优势的条件。
  • 考察权重初始化和梯度传播在 CVNN 训练稳定性与性能中的作用。
  • 确定当任务本身并不要求复数表示时,复值模型是否能有效从实值输入中学习。

提出的方法

  • 提出两种公平比较策略:固定每层的实值神经元数量,以及固定实值参数的总数。
  • 采用具有复权重、偏置和输入的复值多层感知机(MLP)架构,并使用 Wirtinger 微积分进行反向传播。
  • 通过分别处理实部和虚部来应用各种激活函数,包括 ReLU 和复可微变体。
  • 采用 Trabelsi 等人 [26] 提出的权重初始化方法以减轻训练不稳定性,尽管该问题仍是重大挑战。
  • 每项实验采用多次随机初始化以降低方差并评估训练对初始化的敏感性。
  • 在 MNIST、CIFAR-10、CIFAR-100 和 Reuters-21578 上进行实验,并增加合成任务以分析权重动态。

实验结果

研究问题

  • RQ1当参数数量相当时,复值神经网络在实值分类任务上的表现与实值网络相比如何?
  • RQ2不同激活函数对复值网络训练稳定性和性能有何影响?
  • RQ3在实值数据上训练时,网络权重的实部与虚部在多大程度上发生偏离?
  • RQ4当输入数据本质上为实值时,使用复数是否能带来性能优势?
  • RQ5权重初始化如何影响复值神经网络训练的收敛性和可靠性?

主要发现

  • 当通过实值参数数量匹配模型容量时,复值 MLP 在实值分类任务上的表现与实值 MLP 相当或略差。
  • 在实值数据上训练的 CVNN 中,权重的虚部紧密跟随实部,表明复数表示未带来优势。
  • 对实部和虚部分别应用 ReLU 激活函数,可在所测试函数中实现最稳定的训练和最佳性能。
  • 权重初始化仍是重大挑战,尽管 Trabelsi 等人 [26] 的方法降低了但未完全消除对初始化的敏感性。
  • 数值不稳定性源于无界激活函数,尤其在深层网络中更为明显,可通过使用有界或分量式 ReLU 类函数缓解。
  • 能够通过训练期间实部与虚部权重分量的非对称或发散行为,识别出复值模型具有优势的任务。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。