[论文解读] Deep Neural Linear Bandits: Overcoming Catastrophic Forgetting through Likelihood Matching
本文提出了一种内存高效的神经线性上下文Bandit算法,通过使用半定规划(SDP)更新先验分布,匹配旧的和新的深度神经网络表征的似然性,从而克服灾难性遗忘。该方法在真实世界中的回归、分类和情感分析任务中表现出色,即使在内存受限的情况下,性能也优于线性基线方法和全内存神经线性方法。
We study the neural-linear bandit model for solving sequential decision-making problems with high dimensional side information. Neural-linear bandits leverage the representation power of deep neural networks and combine it with efficient exploration mechanisms, designed for linear contextual bandits, on top of the last hidden layer. Since the representation is being optimized during learning, information regarding exploration with "old" features is lost. Here, we propose the first limited memory neural-linear bandit that is resilient to this phenomenon, which we term catastrophic forgetting. We evaluate our method on a variety of real-world data sets, including regression, classification, and sentiment analysis, and observe that our algorithm is resilient to catastrophic forgetting and achieves superior performance.
研究动机与目标
- 解决在表示学习过程中使用有限内存时,神经线性Bandit中的灾难性遗忘问题。
- 开发一种方法,在动态的深度神经网络特征下仍能保持准确的不确定性估计和探索效率。
- 通过在内存约束下结合深度表示学习与线性Bandit方法,实现在深度强化学习中的有效探索。
- 展示在在线学习中,通过似然匹配实现先验适应的有效性。
提出的方法
- 在深度神经网络的最后隐藏层使用Thompson Sampling(TS)以在上下文Bandit中实现高效探索。
- 应用半定规划(SDP)将新特征下的奖励估计似然性与旧特征下的似然性相匹配,以保持不确定性估计。
- 通过SDP近似调整先验均值,结合最后一层权重和先验协方差,以在表示变化时保持一致性。
- 实现一个仅存储最近经验的有限内存缓冲区,避免完整回放缓冲区的存储需求。
- 每当深度神经网络特征更新时,通过似然匹配重新计算先验,确保对遗忘的鲁棒性。
- 使用神经网络(MLP或CNN)进行特征提取,顶层为线性层用于Bandit决策。
实验结果
研究问题
- RQ1当表示网络持续更新时,神经线性Bandit在内存受限条件下是否能保持性能?
- RQ2当深度神经网络特征随时间变化时,如何有效适应先验分布?
- RQ3在旧的和新的特征表示之间进行似然匹配是否能减少神经线性Bandit中的灾难性遗忘?
- RQ4该方法是否能在非线性、高维设置下超越全内存基线和线性Bandit?
主要发现
- 在十个数据集中的八个上,采用先验计算的有限内存神经线性Bandit(算法3)的性能优于或匹配全内存基线(算法2)。
- 在四个数据集(Mushroom、Financial、Statlog、Epileptic)上,算法3超越了无限制内存基线,显示出对遗忘的强鲁棒性。
- 在使用CNN对Amazon评论进行情感分析(输入大小~8k)时,有限内存方法获得了3143.9(±33.5)的累积奖励,几乎与全内存版本持平,并显著优于ε-greedy(2963.9 ±68.5)。
- 在非线性数据集上,有限内存神经线性Bandit在五个案例中的四个上优于线性Thompson Sampling,表明即使在内存受限下,表示学习仍具优势。
- 该方法在减少内存和计算复杂度至O(T)的同时,实现了与先前全内存方法相当或更优的性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。