Skip to main content
QUICK REVIEW

[論文レビュー] Semi-supervised classification by reaching consensus among modalities

Zining Zhu, Jekaterina Novikova|arXiv (Cornell University)|May 23, 2018
Adversarial Robustness in Machine Learning参考文献 14被引用数 3
ひとこと要約

本稿では、敵対的訓練を通じてモダリティ固有の表現同士の一貫性を強制することにより、マルチモーダルデータを活用する半教師あり学習フレームワーク、伝達的コンセンサスネットワーク(TCNs)を提案する。TCNsは、Bank MarketingおよびDementiaBankデータセットにおいて、20個のラベル付きサンプルのみで、最先端のベンチマークを上回るか同等の性能を示しており、負の相対的ジャンセン・シノン・ダイバージェンスで測定される、モダリティ表現間の安定的かつ近似的に最適な類似性が、優れた分類性能をもたらすことを示している。

ABSTRACT

Deep learning has demonstrated abilities to learn complex structures, but they can be restricted by available data. Recently, Consensus Networks (CNs) were proposed to alleviate data sparsity by utilizing features from multiple modalities, but they too have been limited by the size of labeled data. In this paper, we extend CN to Transductive Consensus Networks (TCNs), suitable for semi-supervised learning. In TCNs, different modalities of input are compressed into latent representations, which we encourage to become indistinguishable during iterative adversarial training. To understand TCNs two mechanisms, consensus and classification, we put forward its three variants in ablation studies on these mechanisms. To further investigate TCN models, we treat the latent representations as probability distributions and measure their similarities as the negative relative Jensen-Shannon divergences. We show that a consensus state beneficial for classification desires a stable but imperfect similarity between the representations. Overall, TCNs outperform or align with the best benchmark algorithms given 20 to 200 labeled samples on the Bank Marketing and the DementiaBank datasets.

研究の動機と目的

  • ラベル付きデータが少ない状況におけるマルチモーダル分類の課題を解決するため、コンセンサスネットワークを半教師あり学習に拡張すること。
  • 限られたラベル付きデータにおけるモデルの一般化性能を向上させる要因としてのコンセンサスと分類メカニズムの役割を調査すること。
  • モダリティ表現の類似性と下流の分類性能の関係を理解すること。
  • 病理的および非病理的音声、および表形式データを含む実世界のデータセットにおいて、低ショット学習設定下でTCNsの性能を評価すること。

提案手法

  • コンセンサスメカニズム(モダリティ表現の整合性を図る敵対的訓練)と分類メカニズム(ラベル付きデータに対する教師あり学習)を統合した伝達的コンセンサスネットワーク(TCNs)を提案する。
  • ディスクリミネータを用いて、異なるモダリティ間で識別不能な潜在表現へとマルチモーダル入力を圧縮する敵対的訓練を実施し、コンセンサスを強制する。
  • 潜在表現を確率分布とみなして、負の相対的ジャンセン・シノン・ダイバージェンスを用いてその類似性を測定する。
  • 表現の整合性と予測精度の両立を図るために、反復的にコンセンサスと分類の目的関数を交互に最適化する。
  • メカニズムの寄与を分離するために、3つのアブレーションバージョン(TCN-embed[分類器なし]、TCN-svm[SVMベース分類器]、TCN-AE[オートエンコーダー基盤の再構成])を導入する。
  • 損失の収束に基づく早期停止を実施し、学習が発散した場合は再初期化することで、最適化の安定性を確保する。

実験結果

リサーチクエスチョン

  • RQ1TCNsにおけるコンセンサスメカニズムは、ラベル付きデータが少ない状況下で一般化性能をどのように向上させるか?
  • RQ2効果的な分類を実現するための、モダリティ表現間の類似性の最適レベルは何か?
  • RQ3コンセンサスと分類メカニズムの両方が、それらの個別の構成要素と比較して、TCN性能にどの程度寄与しているか?
  • RQ4TSVM、Ladder、CatGAN、および三重学習といった既存の半教師ありベンチマークと比較して、TCNは実世界のデータセットでどの程度優れているか?
  • RQ5負の相対的ジャンセン・シノン・ダイバージェンスは、マルチモーダル表現学習におけるコンセンサス品質の信頼できる代理指標として機能するか?

主な発見

  • Bank MarketingおよびDementiaBankデータセットにおいて、20~200個のラベル付きサンプルのみで、TCNsは他の最良のベンチマークアルゴリズムを上回るか同等の性能を示した。
  • アブレーションスタディの結果、コンセンサスと分類メカニズムの両方が不可欠であることが判明した。いずれかを除去すると性能が著しく低下し、反復的学習が重要であることが示された。
  • TCN-embedとTCN(フルモデル)は同等の性能を達成しており、両者ともにTCN-AEを著しく上回った。TCN-AEはオートエンコーダーの干渉によりコンセンサスに到達できなかった。
  • TCN-svmは性能が低かったため、SVMベースの分類がこのマルチモーダルで敵対的学習が行われる文脈では効果が薄いことが示された。
  • 負の相対的JSダイバージェンスで測定されるモダリティ表現間の類似性は、学習過程で安定し、最適でないが意味のあるレベルにピークに達する。これは、完全な一致が優れた性能を発揮する必要がないことを示唆している。
  • t-SNE可視化では、ステップ30で、対称的かつ混合されたクラスタが形成されていることが確認された。これは類似性が最も高く、分類性能も最良の状態に一致しており、安定的で有益なコンセンサス状態の存在を裏付けている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。