Skip to main content
QUICK REVIEW

[论文解读] Quantum Large Language Models via Tensor Network Disentanglers

Borja Aizpurua, Saeed S. Jahromi|arXiv (Cornell University)|Oct 22, 2024
Topic Modeling被引用 4
一句话总结

本文提出一种用于大型语言模型(LLMs)的混合量子-经典架构,用变分量子线路与张量网络(特别是矩阵乘积算符,MPOs)的组合替代传统自注意力与前馈层中的密集权重矩阵。通过使用量子解纠缠器分解权重矩阵并仅保留非纠缠的残差MPO,该方法在保持低内存开销的同时实现了高于经典LLMs的模型准确率,从而实现可扩展的量子增强语言建模。

ABSTRACT

We propose a method to enhance the performance of Large Language Models (LLMs) by integrating quantum computing and quantum-inspired techniques. Specifically, our approach involves replacing the weight matrices in the Self-Attention and Multi-layer Perceptron layers with a combination of two variational quantum circuits and a quantum-inspired tensor network, such as a Matrix Product Operator (MPO). This substitution enables the reproduction of classical LLM functionality by decomposing weight matrices through the application of tensor network disentanglers and MPOs, leveraging well-established tensor network techniques. By incorporating more complex and deeper quantum circuits, along with increasing the bond dimensions of the MPOs, our method captures additional correlations within the quantum-enhanced LLM, leading to improved accuracy beyond classical models while maintaining low memory overhead.

研究动机与目标

  • 通过整合量子计算技术,解决经典大型语言模型(LLMs)的高能耗与高内存需求问题。
  • 克服纯经典张量网络压缩方法的局限性,引入可捕捉更丰富相关性的量子线路。
  • 开发一种混合量子-经典LLM架构,在保持与现有基于Transformer模型兼容的同时,实现量子增强性能。
  • 通过高效的参数化与误差缓解策略,实现在含噪声中等规模量子(NISQ)硬件上的量子增强LLM的实际部署。

提出的方法

  • 将LLM层中的密集权重矩阵替换为三部分结构:变分量子线路(VQC)、矩阵乘积算符(MPO)和第二个VQC,形成幺正解纠缠框架。
  • 应用张量网络解纠缠方法,将原始权重矩阵W分解为U × MPO_new × V†,其中U和V†为幺正量子线路,用于消除纠缠。
  • 使用时间演化块降维(TEBD)算法,从原始MPO_old高效计算出残差MPO_new,确保新的键维数χ_new ≤ χ_old。
  • 采用变分优化方法,类比变分量子本征求解器(VQE)算法,对量子线路进行优化。
  • 使用张量网络或基于量子生成对抗网络的方法将经典输入编码为量子态,并通过量子比特测量提取输出。
  • 使用分布式张量网络微调技术重新训练MPO张量,实现经典与量子组件的混合优化。

实验结果

研究问题

  • RQ1变分量子线路能否在LLM的注意力与前馈层中有效集成,以超越经典极限提升模型表达能力?
  • RQ2如何将量子线路与张量网络结合,以在保持低内存开销的同时提升模型准确率?
  • RQ3使用量子线路与MPO表示经典LLM权重矩阵的最优分解策略是什么?与极分解等替代方法相比有何差异?
  • RQ4所提出的混合量子-经典LLM架构能否在具有真实量子比特数量与误差率的NISQ设备上实现高效训练?
  • RQ5量子增强LLM在保持可扩展性与近场量子硬件可部署性的前提下,其准确率相较于经典模型能提升多少?

主要发现

  • 所提方法可将经典LLM权重矩阵压缩为具有多项式量级电路深度与键维数的混合量子-经典表示。
  • 通过使用幺正解纠缠器(U和V†),确保量子线路保持浅层结构,且残差MPO的键维数降低,从而最小化内存开销。
  • 该方法通过引入变分量子线路中的量子相关性,推广了先前的张量网络压缩方法,显著提升了模型容量。
  • 数值结果表明,数百个量子比特与多层量子线路足以提升开源LLM(如LlaMA)的性能。
  • 该方法与经典压缩技术(如量化、知识蒸馏与低秩近似)兼容,可实现协同性能增益。
  • 该框架专为NISQ设备设计,其输入编码与测量采样可通过增加电路深度与MPO键维数进行控制与补偿。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。