Skip to main content
QUICK REVIEW

[论文解读] QClusformer: A Quantum Transformer-based Framework for Unsupervised Visual Clustering

Xuan-Bac Nguyen, Hoang-Quan Nguyen|arXiv (Cornell University)|May 30, 2024
Retinal Imaging and AnalysisMedicine被引用 3
一句话总结

QClusformer 提出了一种基于量子变换器的新型框架,用于无监督视觉聚类,通过在自注意力机制中引入参数化量子电路,提升了经典数据上的聚类性能。该方法在 MS-Celeb-1M 和 DeepFashion 基准测试中达到最先进水平,Pairwise F1 得分为 74.50%,BCubed F1 得分为 82.09%,展示了量子增强注意力在大规模聚类任务中的潜力。

ABSTRACT

Unsupervised vision clustering, a cornerstone in computer vision, has been studied for decades, yielding significant outcomes across numerous vision tasks. However, these algorithms involve substantial computational demands when confronted with vast amounts of unlabeled data. Conversely, quantum computing holds promise in expediting unsupervised algorithms when handling large-scale databases. In this study, we introduce QClusformer, a pioneering Transformer-based framework leveraging quantum machines to tackle unsupervised vision clustering challenges. Specifically, we design the Transformer architecture, including the self-attention module and transformer blocks, from a quantum perspective to enable execution on quantum hardware. In addition, we present QClusformer, a variant based on the Transformer architecture, tailored for unsupervised vision clustering tasks. By integrating these elements into an end-to-end framework, QClusformer consistently outperforms previous methods running on classical computers. Empirical evaluations across diverse benchmarks, including MS-Celeb-1M and DeepFashion, underscore the superior performance of QClusformer compared to state-of-the-art methods.

研究动机与目标

  • 解决在大规模无标签视觉数据集上,经典无监督聚类方法计算成本过高的问题。
  • 探索量子计算在通过量子机器学习加速和改进无监督聚类方面的潜力。
  • 设计一种量子变换器架构,将参数化量子电路整合到自注意力和变换器模块中,实现端到端聚类。
  • 尽管当前 NISQ 硬件存在限制,仍证明量子增强聚类在真实世界视觉基准中的可行性和优越性。
  • 建立一种利用量子叠加和纠缠的框架,以提升在噪声或复杂数据上的聚类准确率和鲁棒性。

提出的方法

  • 设计一种量子变换器架构,将自注意力机制重新构想为使用参数化量子电路(PQCs)计算查询、键和值向量。
  • 为查询、键和值向量分别实现 PQCs(1Q-1K-1V),或共享 PQCs(1QKV),以支持量子态编码和注意力计算中的酉演化。
  • 利用泡利矩阵测量从量子态中提取经典信息,最大限度减少量子比特数量和电路深度,同时保留与聚类相关的特征。
  • 使用预训练的经典卷积神经网络提取的特征嵌入,通过经典反向传播训练端到端的 QClusformer 框架,量子电路通过参数化梯度进行优化。
  • 集成 k-最近邻(k-NN)进行初始聚类,并利用量子注意力机制优化预测结果,以提升聚类分配质量。
  • 由于硬件限制,在 NISQ 时代量子硬件上模拟 QClusformer,仅使用 T=1 的变换器模块,确保与经典基线方法的公平比较。

实验结果

研究问题

  • RQ1基于参数化量子电路的量子变换器架构是否能在无监督视觉聚类任务中超越经典变换器基聚类模型?
  • RQ2量子自注意力机制的集成如何提升在 MS-Celeb-1M 和 DeepFashion 等大规模真实视觉数据集上的聚类性能?
  • RQ3不同 PQC 配置(如 1Q-1K-1V 与 1QKV)对 QClusformer 框架中聚类准确率和资源效率的影响如何?
  • RQ4在不同聚类数量下,QClusformer 与先前的量子聚类方法(如 QKMeans)相比,在 F1 得分和鲁棒性方面表现如何?
  • RQ5量子计算原理(如叠加和纠缠)在多大程度上能增强视觉任务中注意力机制的表征学习能力和聚类性能?

主要发现

  • 在 MS-Celeb-1M 的 584K 测试集上,QClusformer 达到 74.50% 的 Pairwise F1 得分和 82.09% 的 BCubed F1 得分,优于经典聚类变换器(63.31% 和 79.74%)。
  • 在 DeepFashion 数据集上,QClusformer 达到 35.71% 的 Pairwise F1 得分和 60.00% 的 BCubed F1 得分,优于 K-means 和 DBSCAN 等经典方法,且与经典 Clusformer 方法保持竞争力。
  • 在 100 类设置下,QClusformer 将 F1 得分从 QKMeans 的 84.40% 提升至 85.36%(Pairwise),从 88.91% 提升至 91.15%(BCubed),表明其在先前量子聚类方法上持续取得优势。
  • 在 1000 类设置下,QClusformer 达到 54.70% 的 Pairwise F1 得分和 74.93% 的 BCubed F1 得分,显著优于相同条件下的 QKMeans(48.84% 和 71.95%)。
  • 1QKV 配置(一个 PQC 同时用于查询、键和值)实现了最高的 BCubed F1 得分 60.10%,表明共享量子电路可在降低资源开销的同时保持聚类性能。
  • 消融研究证实,1Q-1K-1V 设置实现了最佳的 Pairwise F1 得分 35.71%,凸显了在注意力计算中对查询、键和值独立进行量子处理的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。