Skip to main content
QUICK REVIEW

[논문 리뷰] Coalesced Multi-Output Tsetlin Machines with Clause Sharing

Sondre Glimsdal, Ole‐Christoffer Granmo|arXiv (Cornell University)|2021. 08. 17.
Optimization and Search Problems참고 문헌 41인용 수 17
한 줄 요약

이 논문은 다중 출력 Tsetlin 기계의 효율성과 일반화 능력을 향상시키기 위해 다중 출력 레이블 간에 클라우즈를 공유할 수 있도록 하는 새로운 아키텍처인 Clause Sharing를 통한 통합 다중 출력 Tsetlin 기계(Coalesced Multi-Output Tsetlin Machines, CoT-MOTM)를 제안한다. 클라우즈를 통합하고, 신뢰도 기반 클라우즈 조합을 활용한 패턴 메모리로 인해 재현을 줄이고 학습 속도를 높이며, 동시에 다중 레이블 분류 작업에서 높은 정확도를 유지한다.

ABSTRACT

Using finite-state machines to learn patterns, Tsetlin machines (TMs) have obtained competitive accuracy and learning speed across several benchmarks, with frugal memory- and energy footprint. A TM represents patterns as conjunctive clauses in propositional logic (AND-rules), each clause voting for or against a particular output. While efficient for single-output problems, one needs a separate TM per output for multi-output problems. Employing multiple TMs hinders pattern reuse because each TM then operates in a silo. In this paper, we introduce clause sharing, merging multiple TMs into a single one. Each clause is related to each output by using a weight. A positive weight makes the clause vote for output $1$, while a negative weight makes the clause vote for output $0$. The clauses thus coalesce to produce multiple outputs. The resulting coalesced Tsetlin Machine (CoTM) simultaneously learns both the weights and the composition of each clause by employing interacting Stochastic Searching on the Line (SSL) and Tsetlin Automata (TA) teams. Our empirical results on MNIST, Fashion-MNIST, and Kuzushiji-MNIST show that CoTM obtains significantly higher accuracy than TM on $50$- to $1$K-clause configurations, indicating an ability to repurpose clauses. E.g., accuracy goes from $71.99$% to $89.66$% on Fashion-MNIST when employing $50$ clauses per class (22 Kb memory). While TM and CoTM accuracy is similar when using more than $1$K clauses per class, CoTM reaches peak accuracy $3 imes$ faster on MNIST with $8$K clauses. We further investigate robustness towards imbalanced training data. Our evaluations on imbalanced versions of IMDb- and CIFAR10 data show that CoTM is robust towards high degrees of class imbalance. Being able to share clauses, we believe CoTM will enable new TM application domains that involve multiple outputs, such as learning language models and auto-encoding.

연구 동기 및 목표

  • 다중 출력 Tsetlin 기계 설계에서의 비효율성과 재현을 줄이기 위해 다중 출력 레이블 간에 클라우즈를 공유할 수 있도록 하는 것.
  • 과도한 파라미터 증가를 방지하기 위해 통합된 클라우즈 구조를 통해 모델의 일반화 능력과 학습 효율성을 향상시키는 것.
  • 클라우즈 조합과 메모리 신뢰도를 {1, 2, ..., 2N}의 값으로 표현하는 패턴 메모리 메커니즘을 도입하는 것.
  • 신뢰도 기반 표현을 활용해 입력 패턴을 클라우즈에 매핑함으로써 확장 가능한 다중 레이블 분류를 가능하게 하는 것.
  • 다양한 출력 헤드 간에 클라우즈를 재사용하여 다중 출력 학습의 계산 오버헤드를 줄이는 것.

제안 방법

  • 클라우즈를 다수의 출력 레이블 간에 공유하는 통합 클라우즈 구조를 사용하여 중복 클라우즈 생성을 최소화한다.
  • 패턴 메모리에 행렬 표현을 사용하며, 행은 클라우즈를 나타내고 열은 입력 변수 또는 그 부정(¬xk)을 나타낸다.
  • 각 행렬 요소는 클라우즈 조합과 메모리 신뢰도를 모두 인코딩하는 {1, 2, ..., 2N}의 값을 취한다.
  • 입력 패턴은 변수의 존재 또는 부정 여부에 따라 두 행동 매핑(a ∈ {0, 1})을 통해 클라우즈에 매핑된다.
  • 공유된 클라우즈를 다수의 출력 헤드에 할당함으로써 다중 출력 학습을 지원하며, 모델 복잡도를 감소시킨다.
  • 모든 출력에서 클라우즈 조합과 신뢰도 수준을 추적하는 통합 패턴 메모리를 통해 클라우즈 공유를 강제한다.

실험 결과

연구 질문

  • RQ1다중 출력 레이블 간 클라우즈 공유가 다중 출력 Tsetlin 기계의 효율성에 어떻게 기여하는가?
  • RQ2클라우즈 통합이 다중 레이블 학습에서 재현과 파라미터 수를 얼마나 줄이는가?
  • RQ3신뢰도 기반 클라우즈 표현 방식이 Tsetlin 기계의 메모리 강화와 일반화 능력에 어떻게 기여하는가?
  • RQ4공유된 클라우즈 사용이 분류 정확도와 수렴 속도에 어떤 영향을 미치는가?
  • RQ5패턴 메모리 구조가 다중 출력 환경에서 확장성과 성능에 미치는 영향은 무엇인가?

주요 결과

  • 클라우즈 공유로 인해 필요한 클라우즈 수가 크게 감소하여 모델 복잡도와 학습 오버헤드가 감소한다.
  • 신뢰도 기반 패턴 메모리 표현 방식은 관련 패턴의 강력한 메모리 저장을 가능하게 하여 학습 효율성을 향상시킨다.
  • 통합 클라우즈 구조는 다중 출력 레이블 간 재현을 줄이면서도 높은 분류 정확도를 유지한다.
  • 공유된 클라우즈 활용 덕분에 다중 레이블 분류 작업에서 향상된 확장성을 보였다.
  • 두 행동 매핑 기반 입력-클라우즈 매핑(a ∈ {0,1})은 효과적이고 효율적인 패턴 인코딩을 가능하게 한다.
  • 비공유 대비 더 적은 파라미터와 더 빠른 수렴 속도를 달성하면서도 경쟁력 있는 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.