Skip to main content
QUICK REVIEW

[论文解读] Lossless compression with state space models using bits back coding

James T. Townsend, Iain Murray|arXiv (Cornell University)|Mar 18, 2021
Gaussian Processes and Bayesian Inference参考文献 16被引用 4
一句话总结

本文提出 IconoCLaSM,一种通过将 bits-back 编码与时间步交错进行,利用状态空间模型(SSMs)实现顺序数据无损压缩的新方法,可在仅 O(1) 初始开销下实现接近模型 ELBO 的压缩率。该方法结合深度隐变量模型,可实现高效且可扩展的时间序列数据压缩,如视频压缩。

ABSTRACT

We generalize the 'bits back with ANS' method to time-series models with a latent Markov structure. This family of models includes hidden Markov models (HMMs), linear Gaussian state space models (LGSSMs) and many more. We provide experimental evidence that our method is effective for small scale models, and discuss its applicability to larger scale settings such as video compression.

研究动机与目标

  • 解决在使用具有隐马尔可夫结构的模型压缩顺序数据时,标准 bits-back 编码存在的高初始比特开销问题。
  • 将 bits-back 与 ANS(BB-ANS)框架扩展至状态空间模型(SSMs),SSMs 通过隐马尔可夫链建模序列。
  • 通过交错编码与解码步骤,将初始开销降低至 O(1),实现对长序列的高效、可扩展的无损压缩。
  • 证明对于长序列,压缩率可收敛至模型的 ELBO,使该方法适用于视频压缩等大规模应用。
  • 提供一个通用框架,适用于 HMM、LGSSM 和具有可 tractable 后验条件的深度隐变量模型。

提出的方法

  • 提出 IconoCLaSM,一种将 bits-back 编码步骤与状态空间模型中的时间步交错进行的方法,以减少初始开销。
  • 要求近似后验的因子分解形式:$ Q(z_{1},\text{...},z_{T}|x_{1},\text{...},x_{T}) = Q(z_{T}|x_{1},\text{...},x_{T}) \prod_{t=1}^{T-1} Q(z_{t}|x_{1},\text{...},x_{t},z_{t+1}) $,以支持反向采样。
  • 使用 ANS 编码与解码,通过条件分布的压入/弹出操作:$ x_t \rightarrow P(x_t|z_t) $,$ z_t \leftarrow Q(z_t|x_{1..t}, z_{t+1}) $,$ z_t \rightarrow P(z_t|z_{t-1}) $。
  • 采用反向编码顺序:从 $ z_T $ 开始,接着 $ x_T $,$ z_{T-1} $,...,$ x_1 $,$ z_1 $,以在编码过程中实现 bits-back。
  • 解码按正向顺序进行:$ z_1 \leftarrow P(z_1) $,$ x_1 \leftarrow P(x_1|z_1) $,...,$ z_T \rightarrow Q(z_T|x_{1..T}) $,以重建序列。
  • 利用消息传递或基于 RNN 的推理方法计算所需的后验条件分布,使该方法可应用于 HMM 和深度 SSM。

实验结果

研究问题

  • RQ1能否将 bits-back 编码推广至具有隐马尔可夫结构的顺序模型,以实现接近最优的压缩率且初始开销极小?
  • RQ2在状态空间模型中,为实现交错 bits-back 编码,所需的近似后验因子分解形式为何?
  • RQ3IconoCLaSM 的压缩率是否如原始 BB-ANS 一样,在长序列下收敛至 ELBO?
  • RQ4当结合深度隐变量模型时,IconoCLaSM 是否可应用于真实世界的顺序数据(如文本或视频)?
  • RQ5是否可行将 IconoCLaSM 扩展至层次化模型,或与蒙特卡洛方法结合以进一步提升 ELBO?

主要发现

  • 对于长序列,IconoCLaSM 的压缩率收敛至信息内容 $ h(x) $,实现接近最优的压缩。
  • 在小型 HMM 的实验中,压缩消息长度与信息内容之比 $ l(m)/h(x) $ 随序列长度 $ T $ 增加而趋近于 1。
  • 该方法在合成数据(HMM 精确采样)和真实数据(《战争与和平》文本)上均实现了接近 ELBO 的压缩率。
  • 初始比特开销随序列长度增加而减小,表明开销呈 O(1) 缩放,这对可扩展性至关重要。
  • 即使模型未完全匹配数据,该方法依然有效,如使用在不同文本段落上训练的 HMM 压缩英文文本所示。
  • 该框架具有通用性,适用于 HMM、线性高斯 SSM 和深度隐变量模型,前提是所需的后验条件分布可获得。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。