[论文解读] Neural Trajectory Analysis of Recurrent Neural Network In Handwriting Synthesis
本文引入神经轨迹分析,以解释循环神经网络(RNNs)如何生成多样的手写风格。通过将高斯过程因子分析(GPFA)应用于LSTM激活,研究发现不同的书写风格被编码在神经网络内部空间的不同子空间中,而单个字符则在每种风格的子空间内表现为独特的状态动态——凸显了特定循环层在风格保持和字符生成中的作用。
Recurrent neural networks (RNNs) are capable of learning to generate highly realistic, online handwritings in a wide variety of styles from a given text sequence. Furthermore, the networks can generate handwritings in the style of a particular writer when the network states are primed with a real sequence of pen movements from the writer. However, how populations of neurons in the RNN collectively achieve such performance still remains poorly understood. To tackle this problem, we investigated learned representations in RNNs by extracting low-dimensional, neural trajectories that summarize the activity of a population of neurons in the network during individual syntheses of handwritings. The neural trajectories show that different writing styles are encoded in different subspaces inside an internal space of the network. Within each subspace, different characters of the same style are represented as different state dynamics. These results demonstrate the effectiveness of analyzing the neural trajectory for intuitive understanding of how the RNNs work.
研究动机与目标
- 理解RNN如何在群体层面上共同表征手写风格与字符动态。
- 研究基于RNN的手写生成中风格迁移的内部神经表征。
- 确定不同的书写风格是否被编码在RNN隐藏空间的不同子空间中。
- 考察单个字符如何在特定风格子空间内以动态状态轨迹的形式被表征。
- 识别单个循环层在风格与字符表征中的功能特化。
提出的方法
- 对来自三个循环层的LSTM激活时间序列应用高斯过程因子分析(GPFA)以降低维度。
- 使用中值滤波器(核大小为3)预处理LSTM激活,以解决协方差矩阵的秩不足问题。
- 使用期望最大化(EM)算法,将GPFA模型拟合到多个启动条件和目标文本下的120次试验。
- 提取低维神经轨迹,总结手写生成过程中群体活动的动态。
- 使用KL散度定量比较不同启动条件和文本条件下神经轨迹分布的差异。
- 可视化并比较各层的轨迹,以评估风格与字符的表征。
实验结果
研究问题
- RQ1不同的手写风格是否对应于RNN内部神经空间中的不同子空间?
- RQ2单个字符在特定书写风格的子空间内如何被表征?
- RQ3哪一层循环神经网络在生成过程中对维持书写风格起最关键作用?
- RQ4同一字符的神经轨迹在不同文本和书写者之间是否具有一致性?
- RQ5启动条件如何影响RNN隐藏空间中神经轨迹的结构?
主要发现
- 不同手写风格被编码在RNN内部神经空间的不同子空间中,神经轨迹分布的显著差异证实了这一点。
- 同一字符在不同书写者之间的神经轨迹存在差异,但在同一风格内保持一致,表明字符特异性模式以动态方式被编码。
- 第二层循环神经网络在不同书写风格之间的神经轨迹差异最为显著,表明其在风格保持中起关键作用。
- 统计分析(Mann-Whitney U检验,p < 0.001)证实,不同风格之间的轨迹差异显著大于同一风格内部的差异。
- 第一层和第三层循环神经网络在不同风格之间也表现出显著的轨迹模式差异,表明风格信息以分布式方式表征。
- 同一风格的字符在其对应子空间内以不同的状态动态形式被表征,表明字符级别的信息被嵌入在时间动态之中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。