[论文解读] Online Semi-Supervised Learning with Bandit Feedback
本文提出GCNUCB,一种新颖的在线半监督学习算法,将图卷积网络(GCN)与上下文Bandit结合,以处理部分奖励反馈——即标签缺失或仅观察到二元奖励(1/0)。通过利用图结构的未标记数据进行特征学习,并在线性Bandit框架中对插补奖励进行约束,GCNUCB在LINUCB和ROGCN基线方法上表现更优,尤其在标签稀疏性较高的情况下,CNAE-9数据集上准确率最高达77%(标签缺失25%时)。
We formulate a new problem at the intersectionof semi-supervised learning and contextual bandits,motivated by several applications including clini-cal trials and ad recommendations. We demonstratehow Graph Convolutional Network (GCN), a semi-supervised learning approach, can be adjusted tothe new problem formulation. We also propose avariant of the linear contextual bandit with semi-supervised missing rewards imputation. We thentake the best of both approaches to develop multi-GCN embedded contextual bandit. Our algorithmsare verified on several real world datasets.
研究动机与目标
- 解决在线学习中部分观测奖励的挑战,即真实标签缺失,仅能获得二元反馈(1/0)。
- 将半监督学习技术,特别是GCN,整合到在线Bandit设置中,以利用未标记数据提升泛化能力。
- 开发一种方法,有效插补缺失奖励,同时限制插补误差,防止性能下降。
- 融合GCN在表征学习方面的优势与上下文Bandit在不确定性下的在线决策能力。
- 在不同标签缺失水平下,于真实世界数据集上评估所提方法,以验证其鲁棒性与可扩展性。
提出的方法
- 提出ROGCN,作为GCN的半监督扩展,利用图拉普拉斯正则化在标签缺失时仍能通过未标记数据传播标签。
- 引入BILINUCB,即线性上置信度上限(LINUCB)Bandit算法的变体,结合带边界的半监督奖励插补,以减少误差传播。
- 通过将GCN-based上下文特征与上下文Bandit框架结合,设计GCNUCB,其中每个动作的上下文由对应类别的二元GCN头生成。
- 使用t-SNE可视化比较学习到的上下文与权重向量空间,表明GCNUCB学习到的聚类更紧密、更具可分性,优于LINUCB。
- 对插补施加边界,以在使用不准确插补方法(如随机插补)时稳定学习过程,尤其在标签缺失率较高时。
- 在Bandit探索项中将α设为0,以实现贪婪评估用于可视化,聚焦于上下文-权重对齐的质量。
实验结果
研究问题
- RQ1图卷积网络能否有效适应具有部分反馈的在线半监督学习?
- RQ2在真实标签缺失的情况下,有界奖励插补如何提升上下文Bandit的鲁棒性?
- RQ3将基于GCN的特征学习与上下文Bandit决策机制相结合,在部分奖励设置下能在多大程度上提升性能?
- RQ4当插补不准确时(尤其是标签稀疏性高时),插补边界如何影响学习的稳定性与准确性?
- RQ5使用图结构表示是否能相比原始特征,在Bandit决策空间中实现更好的类别特定上下文分离?
主要发现
- 在CNAE-9数据集上,标签缺失25%时,GCNUCB准确率达77%,显著优于LINUCB(68%)及其他基线方法。
- 在75%标签缺失时,BILINUCB使用k-means插补可达到57.16%准确率,而随机插补下降至49.77%,凸显了插补质量与边界的至关重要性。
- t-SNE可视化证实,GCNUCB学习到的上下文聚类紧密且具有类别判别性,权重向量与正确标签簇对齐,从而实现更优的动作选择。
- 当插补不准确时(如随机插补),插补边界能带来显著性能增益;而使用准确方法(如k-means)时,增益微乎其微。
- 将GCN提取的特征整合进LINUCB框架(即GCNUCB)在所有数据集与缺失率水平下,均持续优于标准LINUCB与ROGCN基线。
- 该方法在高标签稀缺条件下表现出强鲁棒性,BILINUCB在75%标签缺失时仍保持稳定性能,而标准LINUCB则显著下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。