Skip to main content
QUICK REVIEW

[論文レビュー] Massively Parallel and Asynchronous Tsetlin Machine Architecture Supporting Almost Constant-Time Scaling

K. Darshana Abeyrathna, Bimal Bhattarai|arXiv (Cornell University)|Sep 10, 2020
Algorithms and Data Compression参考文献 26被引用数 21
ひとこと要約

本論文は、各節ごとに局所的な投票集計を用いることで、同期のボトルネックを排除する大規模並列的で非同期なTsetlin Machineアーキテクチャを提案している。これにより、GPU上で20〜7,000の節に対してほぼ定常時間の学習スケーリングが可能となる。本手法は、スレッドレベルの並列性とアトミック更新による頑健な分散学習のおかげで、わずかな精度損失で最大50倍の高速化を達成している。これは、古い投票データを用いても成立する。

ABSTRACT

Using logical clauses to represent patterns, Tsetlin Machines (TMs) have recently obtained competitive performance in terms of accuracy, memory footprint, energy, and learning speed on several benchmarks. Each TM clause votes for or against a particular class, with classification resolved using a majority vote. While the evaluation of clauses is fast, being based on binary operators, the voting makes it necessary to synchronize the clause evaluation, impeding parallelization. In this paper, we propose a novel scheme for desynchronizing the evaluation of clauses, eliminating the voting bottleneck. In brief, every clause runs in its own thread for massive native parallelism. For each training example, we keep track of the class votes obtained from the clauses in local voting tallies. The local voting tallies allow us to detach the processing of each clause from the rest of the clauses, supporting decentralized learning. This means that the TM most of the time will operate on outdated voting tallies. We evaluated the proposed parallelization across diverse learning tasks and it turns out that our decentralized TM learning algorithm copes well with working on outdated data, resulting in no significant loss in learning accuracy. Furthermore, we show that the proposed approach provides up to 50 times faster learning. Finally, learning time is almost constant for reasonable clause amounts (employing from 20 to 7,000 clauses on a Tesla V100 GPU). For sufficiently large clause numbers, computation time increases approximately proportionally. Our parallel and asynchronous architecture thus allows processing of massive datasets and operating with more clauses for higher accuracy.

研究の動機と目的

  • 従来のTsetlin Machine学習における同期ボトルネックを克服し、並列処理とスケーラビリティを向上させること。
  • 各節が自らのスレッドで独立して動作できるようにすることで、ネイティブな大規模並列処理を実現すること。
  • 全体制票の同期から切り離すために、節ごとの局所的投票集計を用いることで、分散学習を可能にすること。
  • 古いまたは部分的に計算された制票データを用いても学習の頑健性を評価すること。
  • GPUハードウェア上で20〜7,000の節という広範な節数の範囲で、ほぼ定常時間の学習時間スケーリングを達成すること。

提案手法

  • 各節が自らのスレッドで実行され、GPUコア全体にわたる大規模なネイティブ並列処理が可能となる。
  • 各訓練例ごとに局所的投票集計を維持することで、節の出力を独立して追跡し、節処理とグローバル同期を分離する。
  • 投票集計に対するアトミック操作を用いて、節の更新を非同期で行い、調整のオーバーヘッドを最小限に抑える。
  • システムは大部分の時間、古い投票データを処理しており、最小限の調整で分散学習の制御を模倣している。
  • 最小限のメモリオーバーヘッドで学習と推論の両方をサポートしており、例1つあたり節1つにつき1ビットの追加で集計が可能である。
  • 本手法は、Tesla V100 GPUを用いて、画像分類、語義の解釈、回帰タスクといった多様なベンチマークで評価された。

実験結果

リサーチクエスチョン

  • RQ1グローバル同期なしで、大規模並列処理を用いてTsetlin Machine学習を効率的にスケーリングできるか?
  • RQ2非同期環境下で、節が古くなった投票集計を用いて学習を行うと、性能がどの程度低下するか?
  • RQ3提案されたアーキテクチャは、節の数が変化してもほぼ定常時間の学習時間スケーリングを達成できるか?
  • RQ4学習時間に最大50倍の高速化を達成しながらも、高い精度を維持できるか?
  • RQ5多様な機械学習タスクにおいて、分散的で非同期的な学習メカニズムはどの程度の性能を示すか?

主な発見

  • 提案されたアーキテクチャは、従来のTsetlin Machineと比較して最大50倍の高速化を達成しており、精度に顕著な損失は見られない。
  • Tesla V100 GPU上では、節数が20〜7,000の範囲で学習時間がほぼ一定に保たれ、ほぼ理想に近いスケーリングが実証された。
  • 7,000を超える節数では、計算時間が比例的に増加するため、GPUの5,120コアがその点まで完全に活用されていることが示された。
  • 節が古くなった投票データを用いても、高い精度を維持しており、非同期状態への強い頑健性が確認された。
  • アトミック操作による局所的投票集計の更新のみで十分な調整が可能であり、効率的な分散学習が実現された。
  • 語義の解釈と画像分類タスクにおける実験的評価により、競争力のある精度が得られ、JAVAデータセットではF1スコア97.53%、APPLEデータセットでは95.1%を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。