Skip to main content
QUICK REVIEW

[論文レビュー] COSIME: FeFET based Associative Memory for In-Memory Cosine Similarity Search

Che-Kai Liu, Haobang Chen|arXiv (Cornell University)|Jul 25, 2022
Ferroelectric and Negative Capacitance Devices被引用数 4
ひとこと要約

COSIMEは、フェロエレクトリック FET(FeFET)を用いたメモリ内アソシエイティブメモリを提案し、電流モードアナログ回路とウィナー・トゥク・アール(WTA)論理を活用して、保存されたベクトル間で並列かつ低消費電力なコサイン類似度検索(CSS)を実現する。FeFET技術を用いた近似CSS設計と比較して333倍の遅延低減と90.5倍のエネルギー効率向上を達成し、GPUと比較して47.1倍の高速化と98.5倍のエネルギー効率向上を実現した。HDC推論においては、この性能向上が顕著に現れた。

ABSTRACT

In a number of machine learning models, an input query is searched across the trained class vectors to find the closest feature class vector in cosine similarity metric. However, performing the cosine similarities between the vectors in Von-Neumann machines involves a large number of multiplications, Euclidean normalizations and division operations, thus incurring heavy hardware energy and latency overheads. Moreover, due to the memory wall problem that presents in the conventional architecture, frequent cosine similarity-based searches (CSSs) over the class vectors requires a lot of data movements, limiting the throughput and efficiency of the system. To overcome the aforementioned challenges, this paper introduces COSIME, an general in-memory associative memory (AM) engine based on the ferroelectric FET (FeFET) device for efficient CSS. By leveraging the one-transistor AND gate function of FeFET devices, current-based translinear analog circuit and winner-take-all (WTA) circuitry, COSIME can realize parallel in-memory CSS across all the entries in a memory block, and output the closest word to the input query in cosine similarity metric. Evaluation results at the array level suggest that the proposed COSIME design achieves 333X and 90.5X latency and energy improvements, respectively, and realizes better classification accuracy when compared with an AM design implementing approximated CSS. The proposed in-memory computing fabric is evaluated for an HDC problem, showcasing that COSIME can achieve on average 47.1X and 98.5X speedup and energy efficiency improvements compared with an GPU implementation.

研究の動機と目的

  • ボルツマンアーキテクチャにおけるコサイン類似度検索(CSS)の高エネルギーおよび高遅延のオーバーヘッド(多数の乗算、正規化、除算処理に起因)を是正すること。
  • 従来のシステムにおけるメモリウォール問題を克服し、メモリ内計算によりデータ移動を低減すること。
  • 機械学習ワークロード、特にハイパーディメンショナルコンピューティング(HDC)およびDNN推論に適した汎用的でエネルギー効率が高く、正確なCSSアクセラレータを設計すること。
  • フル精度ソフトウェアCSSと同等の高い正確性を維持しながら、ハードウェア効率を確保すること。
  • FeFET以外の非バキュアメモリ(NVM)技術にも応用可能なスケーラブルかつ耐障害性の高いメモリ内CSSを実現すること。

提案手法

  • 入力クエリと保存済みクラスベクトル間の行単位の内積計算に用いるFeFETアレイと、L2ノルムの推定に用いるビットカウント用のFeFETアレイを2つ使用する。
  • 電流モードのトランスレーティングアナログ回路を用いて、二乗L2ノルムを計算し、コサイン類似度に必要な除算演算を実行する。
  • 入力クエリに対して最大のコサイン類似度を持つベクトルを並列に特定するため、ウィナー・トゥク・アール(WTA)回路を統合する。
  • FeFETの1トランジスタANDゲート機能を活用して、非バキュアストレージとメモリ内計算を実現する。
  • 周辺回路をNVMアレイとは独立に設計することで、出力電流が感出範囲内であれば、ReRAMなどの他のNVMとも互換性を持つ。
  • デジタル算術演算のボトルネックを回避するためアナログ計算を採用し、面積と消費電力を低減する。

実験結果

リサーチクエスチョン

  • RQ1FeFETに基づくメモリ内アソシエイティブメモリは、低遅延かつ低消費電力で高精度なコサイン類似度検索を実現できるか?
  • RQ2本研究で提案するCOSIME設計は、ハミング距離や近似コサイン指標を用いた既存の近似CSSアクセラレータと比較して、性能と正確性でどの程度優れているか?
  • RQ3HDC推論のようなメモリバウンドワークロードにおいて、COSIMEはどの程度データ移動を低減し、スループットを向上させられるか?
  • RQ4実運用環境において、COSIMEはデバイスのばらつきやアナログ回路エラーに対してどの程度耐性を示すか?
  • RQ5COSIMEアーキテクチャは、FeFET以外のNVM技術へも一般化可能か?

主な発見

  • COSIMEは、同じFeFET技術を用いた既存の近似CSS設計と比較して、333倍の高速化と90.5倍のエネルギー低減を達成した。
  • HDC分類タスクにおいて、COSIMEは1,000次元のハイパーベクトルを対象に、NVIDIA 1080 GPUと比較して47.1倍の高いスループットと98.5倍の優れたエネルギー効率を実現した。
  • COSIMEは正確なコサイン類似度計算を可能にすることで、ハミング距離ベースの手法と比較して平均で7%高い分類正確性を維持した。
  • デバイスのばらつきに対しても耐性があり、HDC分類ではAMにおける10%までの誤差率を耐えられることが確認された。これはHDCの内在的な誤差耐性に合致している。
  • 周辺回路がメモリアレイ技術に依存しないため、アクセストランジスタを備えた他のNVMに対しても一般化可能であることが示された。
  • 次元数が高く、クラス数が多いデータセット(例:26クラスのISOLET)では、COSIMEが最大の高速化とエネルギー効率向上を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。