[论文解读] Deep Policies for Online Bipartite Matching: A Reinforcement Learning Approach
本文提出了一种基于深度神经网络的强化学习框架,从历史图数据中学习近似最优的在线二分图匹配策略。通过将匹配过程建模为马尔可夫决策过程,并结合图结构、节点属性和匹配历史,该方法在合成数据集和真实世界数据集上均比贪心基线方法提升了3–10%的匹配质量。
The challenge in the widely applicable online matching problem lies in making irrevocable assignments while there is uncertainty about future inputs. Most theoretically-grounded policies are myopic or greedy in nature. In real-world applications where the matching process is repeated on a regular basis, the underlying data distribution can be leveraged for better decision-making. We present an end-to-end Reinforcement Learning framework for deriving better matching policies based on trial-and-error on historical data. We devise a set of neural network architectures, design feature representations, and empirically evaluate them across two online matching problems: Edge-Weighted Online Bipartite Matching and Online Submodular Bipartite Matching. We show that most of the learning approaches perform consistently better than classical baseline algorithms on four synthetic and real-world datasets. On average, our proposed models improve the matching quality by 3--10\\% on a variety of synthetic and real-world datasets. Our code is publicly available at https://github.com/lyeskhalil/CORL.
研究动机与目标
- 自动化设计复杂变体的在线二分图匹配策略,无需人工算法设计。
- 利用历史图实例(超越仅到达分布)来学习上下文感知的、非短视的匹配决策。
- 将节点属性、图稀疏性以及匹配历史整合到统一的强化学习框架中,以提升决策质量。
- 通过不变神经网络架构,在不同图规模和结构变化下实现良好泛化能力。
- 证明基于强化学习的策略在边权加权和子模匹配设置下优于贪心和监督基线方法。
提出的方法
- 将在线二分图匹配建模为马尔可夫决策过程(MDP),其中状态由当前图、部分匹配和节点特征定义。
- 设计六种深度学习架构:前馈网络、图神经网络及其不变变体,均包含与不包含历史编码。
- 工程化节点级特征(如度数、权重、属性)和图级特征(如|U|/|V|比例、稀疏性、社区结构)。
- 在历史图实例上使用策略梯度强化学习训练策略,以最大化累积匹配奖励。
- 使用图神经网络建模节点间的依赖关系,并捕捉二分图中的结构模式。
- 应用不变性技术,确保模型性能在不同图规模和节点身份下保持稳定。
实验结果
研究问题
- RQ1强化学习能否学习到优于经典贪心算法或基于分布估计的算法的在线匹配策略?
- RQ2将图结构、节点属性和匹配历史整合到策略网络中有多有效?
- RQ3不变神经网络架构是否在不同图规模和拓扑结构下具有更好的泛化能力?
- RQ4该强化学习框架能否处理复杂变体,如在线子模二分图匹配(OSBM),其中边权重依赖于先前匹配?
- RQ5使用历史数据是否能使智能体学习到非贪心、具有战略性的匹配行为?
主要发现
- 与贪心和基线算法相比,所提出的基于强化学习的策略在四个合成和真实世界数据集上平均提升了3–10%的匹配质量。
- 包含历史信息的模型(如 gnn-hist 和 inv-ff-hist)始终优于无历史信息的对应模型,尤其在密集或结构化图中表现更优。
- 图神经网络模型(如 gnn-hist)在 OSBM 问题上表现最佳,尤其当存在节点属性时。
- 不变模型在更大图上泛化能力更强,而非不变模型在图规模增大时性能下降,即使网络架构大小保持不变。
- 由于动态边权重随解路径变化,强化学习框架在 OSBM 上优于监督微调方法(ff-supervised)。
- 该方法减少了对手动设计算法的依赖,并实现了在多种 OBM 变体(包括子模目标)上的自动策略学习。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。