Skip to main content
QUICK REVIEW

[論文レビュー] Information Theoretic Co-Training

David McAllester|arXiv (Cornell University)|Feb 21, 2018
Gaussian Processes and Bayesian Inference参考文献 7被引用数 10
ひとこと要約

本稿は、過去の入力と未来の入力の間の相互情報量を最大化するように、過去→仮説モデルと未来→仮説確認モデルを同時に学習する情報理論的コトレーニングフレームワークを提案する。仮説を離散的記号としてモデル化し、交差エントロピーを用いて相互情報量の下界を最適化することで、ラベルなしの条件下で21音素のサブセットにおいて47.3%のフレーム単位音素認識精度を達成した。これは、情報理論に裏打ちされた、新たな非教師付き学習のアプローチを示している。

ABSTRACT

This paper introduces an information theoretic co-training objective for unsupervised learning. We consider the problem of predicting the future. Rather than predict future sensations (image pixels or sound waves) we predict "hypotheses" to be confirmed by future sensations. More formally, we assume a population distribution on pairs $(x,y)$ where we can think of $x$ as a past sensation and $y$ as a future sensation. We train both a predictor model $P_Φ(z|x)$ and a confirmation model $P_Ψ(z|y)$ where we view $z$ as hypotheses (when predicted) or facts (when confirmed). For a population distribution on pairs $(x,y)$ we focus on the problem of measuring the mutual information between $x$ and $y$. By the data processing inequality this mutual information is at least as large as the mutual information between $x$ and $z$ under the distribution on triples $(x,z,y)$ defined by the confirmation model $P_Ψ(z|y)$. The information theoretic training objective for $P_Φ(z|x)$ and $P_Ψ(z|y)$ can be viewed as a form of co-training where we want the prediction from $x$ to match the confirmation from $y$.

研究の動機と目的

  • 生体的センサーのエントロピーを直接測定することを避ける情報理論に基づく、非教師付き学習の新しい目的関数の開発。
  • センサー入力に基づいた共有の記号的表現に根ざした予測モデルと確認モデルを、同時に学習可能にする。
  • それぞれのモデルが仮説を予測および確認するように訓練することで、過去と未来のセンサー・データ間の相互情報量を測定する。
  • 共通の低エントロピーの記号的言語が、コトレーニングを通じて自己形成するかどうかを検証する。
  • 教師なし音声表現学習の文脈で、本手法を評価する。この際、学習時に音声ラベルは一切使用しない。

提案手法

  • 本手法は、x(過去の感覚入力)、y(未来の感覚入力)、z(xから予測されるか、yによって確認される仮説)の三つ組みの結合確率分布を定義する。
  • データ処理不等式を用いて、P_Ψ(z|y)が誘導する分布下で、I(x,y) ≤ I(x,z) が成り立つことから、I(x,y) の下界 H_Ψ(z) - H⁺_Ψ,Φ(z|x) を得る。
  • 訓練目的は、H_Ψ(z) - H⁺_Ψ,Φ(z|x) を最大化することである。ここで、H_Ψ(z) はミニバッチ上でのzの経験的エントロピー、H⁺_Ψ,Φ(z|x) はP_Φ(z|x)がP_Ψ(z|y)からのサンプルに対して計算する交差エントロピーである。
  • モデルは64次元の隠れ状態を持つGRUと、64記号のアルファベットを用い、学習率スケジューリングを伴う確率的勾配降下法で訓練される。
  • 訓練の安定化のため、「クローン化」手順を採用。死活状態の記号を活性な記号のノイズ版に置き換え、H(z) と H(z|x) にそれぞれ1ビットを追加する。
  • 目的関数はエンドツーエンドで訓練され、zはxの擬似ラベルとして機能する。確認モデルP_Ψ(z|y)は、予測モデルP_Φ(z|x)のターゲットを生成するために用いられる。

実験結果

リサーチクエスチョン

  • RQ1生体的センサーのエントロピーを直接測定できない状況下でも、過去と未来のセンサー入力間の相互情報量を効果的に推定・最大化できるか?
  • RQ2ラベルなしの状況下で、予測モデルと確認モデルのコトレーニングによって、共通の記号的言語が自己形成するか?
  • RQ3相互情報量の下界を最大化することで、意味的かつ分離可能な表現が非教師付き学習で得られるか?
  • RQ4学習時に音声ラベルを一切使用しない状況下で、本手法は音声表現学習にどの程度有効か?
  • RQ5本手法の目的関数は、系列のような構造的出力にスケーリング可能か?また、実用的な制約は何か?

主な発見

  • ホールドアウトセットにおけるフレーム単位の認識精度は47.3%に達し、これはランダム・ギャッジを著しく上回り、教師なし条件下での意味のある学習を示している。
  • 希少または未学習の音素を含むすべてのフレームにおいて、35.1%の精度を達成しており、最も頻出するラベルに限定されない一般化性能を示している。
  • 非教師付き記号分布のエントロピーH_Ψ(z|u)は5.0ビット(パープレキシティ32)であった。これは、多様で情報量のある記号集合であることを示している。
  • 開発セットでは、xから予測された最も確実な仮説と、yによって確認された最も確実な仮説が、78.6%の窓配置で一致しており、モデル間の強い整合性が確認された。
  • 21つの頻出音素の範囲で、非教師付き記号の分布は比較的均等であった。これは、仮説空間の有効な探索が行われていたことを示している。
  • 本手法は、コトレーニングのみとラベルなしの条件下で、生の音声フレームから音声的コンテンツの記号的表現を学習に成功した。記号の多様性と一致度の観点から、教師ありベースラインと同等の結果を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。