[論文レビュー] Joint Training Deep Boltzmann Machines for Classification
本稿では、深層ボルツマンマシン(DBMs)における統合学習のためのマルチ予測(MP)学習を導入し、グリーディな事前学習を必要とせずエンド・ツー・エンドの学習を可能にする。この手法は、新たな変分近似とマルチインファレンスのテクニックを用い、分類精度が0.91%のテスト誤差を達成する一貫した統合モデルとして、従来の分離されたMLPによる微調整を必要としていた手法を上回る。
We introduce a new method for training deep Boltzmann machines jointly. Prior methods of training DBMs require an initial learning pass that trains the model greedily, one layer at a time, or do not perform well on classification tasks. In our approach, we train all layers of the DBM simultaneously, using a novel training procedure called multi-prediction training. The resulting model can either be interpreted as a single generative model trained to maximize a variational approximation to the generalized pseudolikelihood, or as a family of recurrent networks that share parameters and may be approximately averaged together using a novel technique we call the multi-inference trick. We show that our approach performs competitively for classification and outperforms previous methods in terms of accuracy of approximate inference and classification with missing inputs.
研究の動機と目的
- 分類のためのグリーディな階層的事前学習と別個のMLPによる微調整を必要としている従来のDBM学習手法の限界を解消すること。
- すべてのDBM部品(クラスラベルを含む)を一度の段階で統合的に最適化する一貫した学習手順を開発すること。
- 標準的な分類に加え、欠損入力や一般化された確率的クエリのような困難な状況でも優れた性能を発揮できるようにすること。
- タスク固有のアーキテクチャ拡張を必要としない、単一の生成的学習済みDBMが、タスク特化型のモデルと同等またはそれ以上の性能を発揮できることを示すこと。
提案手法
- すべてのDBMレイヤーの統合的学習を目的とした、一般化された仮想尤度の変分近似を最大化する新規な学習手順、マルチ予測(MP)学習を導入する。
- パラメータを共有する再帰的ネットワークの族としてDBMを定式化し、マルチインファレンスのテクニックを用いて近似的な平均化を実現することで、推論の安定性を向上させる。
- ブロックギブスサンプリングと固定点更新を用いた平均場推論を用い、レイヤー間の条件付き独立性を活用して勾配を効率的に推定する。
- ラオ=ブラックウェル化と、平均場成分を組み込んだ特化した負の段階を適用し、PCD学習中の勾配推定の分散を低減する。
- 1つの目的関数を用いて全DBMを1段階で学習し、グリーディな事前学習や別個の微調整ネットワークの必要性を排除する。
- 複数の推論経路を組み合わせることで、欠損データ下でも特に強固で正確な近似的推論を実現するマルチインファレンスのテクニックを活用する。
実験結果
リサーチクエスチョン
- RQ1グリーディな事前学習を必要とせず、すべてのレイヤーを一度に統合的に学習させることで、強力な分類性能を維持できるか?
- RQ2マルチ予測学習は、センターイングを用いるか否かにかかわらず、標準的なDBM学習に比べてより優れた近似的推論と分類精度を実現できるか?
- RQ31つの生成的学習済みDBMは、タスク特化型の微調整を必要としていないモデルと同等に、欠損入力や一般化されたクエリを処理できるか?
- RQ4MP-DBMの性能は、Salakhutdinov & Hinton (2009) が提唱した最先端のDBM手法と比較して、テスト誤差およびハイパーパrameter設定への感受性の観点で優れているか?
- RQ5マルチインファレンスのテクニックは、確率的DBM推論における推論品質と一般化性能をどの程度向上させるか?
主な発見
- MP-DBMは、すべてのレイヤーを一度の段階で統合的に学習させることで、MNISTデータセットで0.91%のテスト誤差を達成し、別個のMLPによる微調整を必要としていた従来の最先端手法(0.95%)を上回った。
- MP学習は、センターイングに基づく手法と比較して、ハイパーパrameterの選択に対してはるかに感受性が低く、学習率やモーメンタムスケジュールの広い範囲で一貫した性能を示した。
- 入力に欠損がある状況での分類において、MP-DBMは標準的なDBMおよびセンターイングベースのDBMを、入力欠損の大部分の水準で上回った。
- 複数の変数が欠損している一般化された確率的クエリにおいても、MP-DBMは標準的およびセンターイングベースのDBMと比較して優れた性能を示し、特に大きなクエリ集合に対して顕著であった。
- 隠れユニット数を2倍に増やし、マルチインファレンスのテクニックを適用した最良のMP-DBMは、0.91%のテスト誤差を達成し、別個のMLPヘッドを用いるモデルと同等またはそれ以上の性能を発揮した。
- 本手法により、1つの統合モデルが生成的モデルとしても分類器としても優れた性能を発揮でき、タスク特化型のアーキテクチャ拡張の必要性がなくなった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。