Skip to main content
QUICK REVIEW

[论文解读] Tsetlin Machine for Solving Contextual Bandit Problems

Raihan Seraj, Jivitesh Sharma|arXiv (Cornell University)|Feb 4, 2022
Machine Learning and Algorithms被引用 5
一句话总结

本文提出了一种基于Tsetlin Machine(TM)的可解释上下文Bandit算法,利用命题逻辑进行决策,通过位运算实现,并结合Thompson采样。实验结果表明,该TM-based学习器在九个数据集中的八个上优于其他基线学习器,同时通过命题表达式实现了透明且基于逻辑的臂选择解释。

ABSTRACT

This paper introduces an interpretable contextual bandit algorithm using Tsetlin Machines, which solves complex pattern recognition tasks using propositional logic. The proposed bandit learning algorithm relies on straightforward bit manipulation, thus simplifying computation and interpretation. We then present a mechanism for performing Thompson sampling with Tsetlin Machine, given its non-parametric nature. Our empirical analysis shows that Tsetlin Machine as a base contextual bandit learner outperforms other popular base learners on eight out of nine datasets. We further analyze the interpretability of our learner, investigating how arms are selected based on propositional expressions that model the context.

研究动机与目标

  • 开发一种结合高性能与可解释性的上下文Bandit算法,利用命题逻辑实现。
  • 将Tsetlin Machine——一种基于逻辑的模式识别器——适配于上下文Bandit场景下的在线、增量学习。
  • 通过自助采样技术,在非参数化、基于逻辑的学习器(如Tsetlin Machine)中实现Thompson采样。
  • 通过从学习到的子句中提取的显式命题表达式,提供可解释的臂选择策略。
  • 在多样化数据集上,通过实证验证TM-based Bandit算法相较于主流基线学习器的性能。

提出的方法

  • 使用Tsetlin Machine作为基线学习器,通过命题逻辑子句建模每个臂的期望奖励。
  • 每个臂的选择策略表示为析取范式(DNF)表达式,由输入特征及其否定的逻辑与(AND)构成的子句通过逻辑或(OR)连接而成。
  • 通过位级操作高效计算子句评估,实现快速且可解释的推理。
  • 通过自助采样实现Thompson采样:训练多个TM于重采样数据上,以估计臂值的后验分布。
  • 最终通过从TM预测的后验分布中采样,选择得分最高的臂进行选择。
  • 通过提取并分析控制每个上下文下臂选择的命题逻辑表达式,实现可解释性。

实验结果

研究问题

  • RQ1Tsetlin Machine能否被有效适配为上下文Bandit问题的基线学习器?
  • RQ2如何在非参数化、基于逻辑的模型(如Tsetlin Machine)中实现Thompson采样?
  • RQ3Tsetlin Machine-based上下文Bandit在累积遗憾方面相较于现有基线学习器的性能优势有多大?
  • RQ4Tsetlin Machine生成的臂选择策略在命题逻辑表达式上的可解释性程度如何?
  • RQ5上下文二值化对性能有何影响?该影响能否通过模型固有的可解释性与高效性得到补偿?

主要发现

  • 在九个基准数据集中的八个上,Tsetlin Machine-based上下文Bandit在累积遗憾方面优于其他基线学习器。
  • 由于采用位级操作和高效的子句评估,该方法在显著降低计算复杂度的同时保持了具有竞争力的性能。
  • 通过显式的命题逻辑表达式实现了可解释性,这些表达式可直接将上下文特征与臂选择关联,例如在Iris数据集上,Arm-1的表达式为 'x10 ∨ x14 ∨ x15 ∨ x3'。
  • 通过使用自助采样的TM,成功在非参数设置下实现了Thompson采样,同时保持了性能与可解释性。
  • 尽管需要进行上下文二值化,模型仍保持了强劲的性能,表明逻辑抽象能有效捕捉关键模式。
  • 模型的可解释性使用户能够通过逻辑规则追踪决策过程,例如 '¬x10 ∨ ¬x11 ∨ ¬x15 ∨ (x1 ∧ ¬x12 ∧ …)',从而清晰揭示选择逻辑。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。