Skip to main content
QUICK REVIEW

[論文レビュー] Information, learning and falsification

David Balduzzi|arXiv (Cornell University)|Oct 17, 2011
Computability, Logic, AI Algorithms参考文献 6被引用数 3
ひとこと要約

本稿では、Kolmogorov複雑性の非計算可能で非ユニバーサルなアナログとしての有効情報——出力カテゴリの鋭さに基づいて情報を定量化する計算可能な指標——を導入する。アルゴリズム的情報、シャノン情報、VCエントロピーおよびラデマッハ複雑性といった統計的学習容量とを結びつけることで、有効情報が情報の増加と仮説の反証を測定できることを示し、物理的システムと因果推論に基づく統一的枠組みを提供する。

ABSTRACT

There are (at least) three approaches to quantifying information. The first, algorithmic information or Kolmogorov complexity, takes events as strings and, given a universal Turing machine, quantifies the information content of a string as the length of the shortest program producing it. The second, Shannon information, takes events as belonging to ensembles and quantifies the information resulting from observing the given event in terms of the number of alternate events that have been ruled out. The third, statistical learning theory, has introduced measures of capacity that control (in part) the expected risk of classifiers. These capacities quantify the expectations regarding future data that learning algorithms embed into classifiers. This note describes a new method of quantifying information, effective information, that links algorithmic information to Shannon information, and also links both to capacities arising in statistical learning theory. After introducing the measure, we show that it provides a non-universal analog of Kolmogorov complexity. We then apply it to derive basic capacities in statistical learning theory: empirical VC-entropy and empirical Rademacher complexity. A nice byproduct of our approach is an interpretation of the explanatory power of a learning algorithm in terms of the number of hypotheses it falsifies, counted in two different ways for the two capacities. We also discuss how effective information relates to information gain, Shannon and mutual information.

研究の動機と目的

  • アルゴリズム的情報(Kolmogorov複雑性)、シャノン情報、統計的学習理論的容量の間の概念的・定量的ギャップを埋める。
  • Kolmogorov複雑性の非計算可能性を回避しつつも、情報の最小記述長という核心的直感を保ち続ける計算可能な情報の測度を開発する。
  • 経験的リスク最小化のような学習プロセスを、仮説の反証を通じて情報生成を行う物理的システムとして解釈する。
  • 経験的VCエントロピーとラデマッハ複雑性が有効情報から自然に導かれるのを示すことにより、情報理論と学習理論の主要概念を統合する。
  • 学習アルゴリズムの出力によって除外された仮説の数を用いて、情報の増加と反証の因果的・物理的解釈を提供する。

提案手法

  • 有効情報を、出力yのもとでの入力の実際のレパートリー(事後分布)と入力の一様事前分布とのKullback-Leibler発散として定義する:$ ei(\mathfrak{m},y) = D[\hat{p}_{\mathfrak{m}}(X|y) \| p_{\text{unif}}(X)] $。
  • 決定的システム $ f: \mathcal{X} \to \mathcal{Y} $ に対して、有効情報は $ ei(f,y) = \log_2|\mathcal{X}| - \log_2|f^{-1}(y)| $ に簡略化され、逆像のサイズの逆数として定量化される。
  • ユニバーサルチューリングマシンを物理的システム $ f $ に置き換えることで、Kolmogorov複雑性の非ユニバーサルアナログを構築し、有効情報は $ ei(f,y) = -\log_2 p_f(y) $ となる。ここで $ p_f(y) $ は出力 $ y $ の有効確率である。
  • 学習理論における経験的リスク最小化にこの枠組みを適用し、ラベル付けから経験的リスクへの写像として学習アルゴリズム $ \mathfrak{L}_{\mathcal{F},\mathcal{D}} $ を物理的システムとしてモデル化する。
  • 経験的VCエントロピーが $ l - \text{有効情報} $ に等しいことを示し、これにより反証された仮説の数と結びつける。
  • 相互情報量が出力分布上での有効情報の期待値として導かれることを示し、シャノン情報と有効情報の統合を実現する。

実験結果

リサーチクエスチョン

  • RQ1非計算可能性を回避しつつも、アルゴリズム的情報の核心的直感を保ちつつ、計算可能な情報の測度をどのように構築できるか。
  • RQ2有効情報がどのようにしてアルゴリズム的情報、シャノン情報、およびVCエントロピーおよびラデマッハ複雑性といった統計的学習容量を統合するか。
  • RQ3経験的リスク最小化の過程で生成される有効情報は、学習プロセスによって反証された仮説の数とどのように関係するか。
  • RQ4有効情報は分類器の一般化性能を説明する物理的・因果的情報増加の測度として機能できるか。
  • RQ5ポパー主義的科学理論評価における反証の観点から、有効情報と反証の関係は何か。

主な発見

  • 有効情報はKolmogorov複雑性の非ユニバーサルアナログを提供し、$ ei(f,y) = -\log_2 p_f(y) $ として計算可能である。ここで $ p_f(y) $ は決定的システム $ f $ における出力 $ y $ の有効確率である。
  • 決定的関数 $ f $ に対して、有効情報は $ ei(f,y) = \log_2|\mathcal{X}| - \log_2|f^{-1}(y)| $ に等しく、逆像が鋭く(小さく)なるほど情報量が高くなる。
  • 経験的VCエントロピーは $ l - \text{有効情報} $ に等しく、$ l $ はデータポイントの数である。これは、有効情報が反証された仮説の数を定量化していることを意味する。
  • 経験的ラデマッハ複雑性も有効情報の観点から表現可能であり、これによりこの容量が仮説の反証による情報増加として新たな解釈が可能になる。
  • シャノンエントロピーと相互情報量は、それぞれ一様分布およびチャネル誘導分布上での有効情報の期待値として導かれる。
  • この枠組みは、情報の増加を学習アルゴリズムが除外した仮説の数として解釈し、ポパーの反証主義的科学理論の強さの基準と整合する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。