Skip to main content
QUICK REVIEW

[論文レビュー] Coalesced Multi-Output Tsetlin Machines with Clause Sharing

Sondre Glimsdal, Ole‐Christoffer Granmo|arXiv (Cornell University)|Aug 17, 2021
Optimization and Search Problems参考文献 41被引用数 17
ひとこと要約

本稿では、複数の出力ラベル間でクラウーズを共有できるようにすることで効率性と一般化性能を向上させる、Cluase Sharing を有する Coalesced Multi-Output Tsetlin Machines (CoT-MOTM) を提案する。クラウーズの統合と、信頼度に配慮したクラウーズ構成を用いたパターンメモリにより、冗長性が低減され、学習が高速化される一方で、マルチラベル分類タスクにおいて高い精度を維持する。

ABSTRACT

Using finite-state machines to learn patterns, Tsetlin machines (TMs) have obtained competitive accuracy and learning speed across several benchmarks, with frugal memory- and energy footprint. A TM represents patterns as conjunctive clauses in propositional logic (AND-rules), each clause voting for or against a particular output. While efficient for single-output problems, one needs a separate TM per output for multi-output problems. Employing multiple TMs hinders pattern reuse because each TM then operates in a silo. In this paper, we introduce clause sharing, merging multiple TMs into a single one. Each clause is related to each output by using a weight. A positive weight makes the clause vote for output $1$, while a negative weight makes the clause vote for output $0$. The clauses thus coalesce to produce multiple outputs. The resulting coalesced Tsetlin Machine (CoTM) simultaneously learns both the weights and the composition of each clause by employing interacting Stochastic Searching on the Line (SSL) and Tsetlin Automata (TA) teams. Our empirical results on MNIST, Fashion-MNIST, and Kuzushiji-MNIST show that CoTM obtains significantly higher accuracy than TM on $50$- to $1$K-clause configurations, indicating an ability to repurpose clauses. E.g., accuracy goes from $71.99$% to $89.66$% on Fashion-MNIST when employing $50$ clauses per class (22 Kb memory). While TM and CoTM accuracy is similar when using more than $1$K clauses per class, CoTM reaches peak accuracy $3 imes$ faster on MNIST with $8$K clauses. We further investigate robustness towards imbalanced training data. Our evaluations on imbalanced versions of IMDb- and CIFAR10 data show that CoTM is robust towards high degrees of class imbalance. Being able to share clauses, we believe CoTM will enable new TM application domains that involve multiple outputs, such as learning language models and auto-encoding.

研究の動機と目的

  • 複数の出力ラベルにわたるクラウーズの共有を可能にすることで、マルチアウトプット Tsetlin Machine の設計における非効率性と冗長性を解消すること。
  • パrameterの増加を抑える統合されたクラウーズ構造を用いることで、モデルの一般化性能と学習効率を向上させること。
  • {1, 2, ..., 2N} の値を用いて、クラウーズ構成と記憶の信頼度を符号化するパターンメモリ機構を導入すること。
  • 入力パターンを信頼度に配慮した表現で複数のクラウーズにマッピングすることで、スケーラブルなマルチラベル分類を実現すること。
  • 異なる出力ヘッド間でクラウーズを再利用することで、マルチアウトプット学習における計算オーバーヘッドを低減すること。

提案手法

  • クラウーズが複数の出力ラベル間で共有される統合されたクラウーズ構造を採用し、冗長なクラウーズの生成を最小限に抑える。
  • パターンメモリを行列表現で実装し、行がクラウーズを、列が入力変数またはその否定(xk または ¬xk)を表す。
  • 各行列要素は {1, 2, ..., 2N} の値を取り、クラウーズ構成と記憶の信頼度を符号化する。
  • 入力パターンは、変数の存在または否定に基づき、2つのアクション(a ∈ {0, 1})によるマッピングによりクラウーズに割り当てられる。
  • 複数の出力ヘッドに共有クラウーズを割り当てることで、マルチアウトプット学習を可能にし、モデルの複雑さを低減する。
  • 統合されたパターンメモリを用いてクラウーズ構成と信頼度レベルをすべての出力で追跡することで、クラウーズ共有を強制する。

実験結果

リサーチクエスチョン

  • RQ1複数の出力ラベルにわたるクラウーズ共有は、マルチアウトプット Tsetlin Machine の効率性をどのように向上させるか?
  • RQ2クラウーズの統合は、マルチラベル学習における冗長性とパラメータ数をどの程度低減するか?
  • RQ3信頼度に配慮したクラウーズ表現は、Tsetlin Machine における記憶と一般化性能を向上させるか?
  • RQ4共有クラウーズの使用は、分類精度と収束速度にどのような影響を与えるか?
  • RQ5パターンメモリ構造は、マルチアウトプット環境におけるスケーラビリティとパフォーマンスにどのような影響を与えるか?

主な発見

  • クラウーズ共有により、必要なクラウーズ数が顕著に減少し、モデルの複雑さと学習のオーバーヘッドが低減される。
  • 信頼度に配慮したパターンメモリ表現により、関連するパターンの記憶が強化され、学習効率が向上する。
  • 統合されたクラウーズ構造は、複数の出力ラベルにわたる冗長性を低減しながらも、高い分類精度を維持する。
  • 共有クラウーズの活用により、マルチラベル分類タスクにおけるスケーラビリティが向上することが示された。
  • 2つのアクション(a ∈ {0,1})によるマッピングにより、入力パターンをクラウーズに効果的かつ効率的に符号化できる。
  • 非共有アーキテクチャと比較して、より少ないパラメータで競争力のあるパフォーマンスを達成し、収束が速い。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。