[論文レビュー] Kolmogorov's Structure Functions with an Application to the Foundations of Model Selection
本稿は、モデル選択の理論的基盤を確立し、Kolmogorov複雑性の制約を含むモデルとデータからモデルへの符号化から成る2部形式コードの長さを最小化することで、データを最大限に典型とみなす最適なモデルが得られることを証明している。非単調性を示すランダムネス欠际関数の存在にもかかわらず、最短の2部形式コードが計算可能であることを示すことにより、長年の問いを解決し、モデル選択における構造関数およびアルゴリズム的十分統計量の妥当性を裏付けた。
We vindicate, for the first time, the rightness of the original “structure function”, proposed by Kolmogorov in 1974, by showing that minimizing a two-part code consisting of a model subject to (Kolmogorov) complexity constraints, together with a data-to-model code, produces a model of best fit (for which the data is maximally “typical”). The method thus separates all possible model information from the remaining accidental information. This result gives a foundation for MDL, and related methods, in model selection. Settlement of this long-standing question is the more remarkable since the minimal randomness deficiency function (measuring maximal “typicality”) itself cannot be monotonically approximated, but the shortest two-part code can. We furthermore show that both the structure function and the minimum randomness deficiency function can assume all shapes over their full domain (improving an independent unpublished result of Levin on the former function of the early 70s, and extending a partial result of V’yugin on the latter function of the late 80s and also recent results on prediction loss measured by “snooping curves”). We give an explicit realization of optimal two-part codes at all levels of model complexity. We determine the (un)computability properties of the various functions and “algorithmic sufficient statistic ” considered. In our setting the models are finite sets, but the analysis is valid, up to logarithmic additive terms, for the model class of computable probability density functions, or the model class of total recursive functions. 1
研究の動機と目的
- 1974年にKolmogorovが提唱したオリジナルの構造関数が、モデル選択の理論的妥当性を有することを確立すること。
- 2部形式コードを最小化することで、データを最大限に典型とみなすモデルが得られ、最良の適合が達成されることを示すこと。
- 非単調性を示すにもかかわらず、最小ランダムネス欠际関数が有効に近似可能かどうかという長年の問いを解決すること。
- 構造関数および最小ランダムネス欠际関数が定義域全体でとりうるすべての形状の範囲を同定すること。
- 構造関数、ランダムネス欠际関数、およびアルゴリズム的十分統計量の計算可能性および非計算可能性の性質を特定すること。
提案手法
- 2部形式コードを用いる手法で、Kolmogorov複雑性の制約を含むモデル記述と、データからモデルへの符号化から成り、合計符号長を最小化する。
- データが与えられたモデルに対してどれほど典型でないかを測るランダムネス欠际関数を分析し、2部形式コードの最小化が典型性の最大化に対応することを示す。
- 有限集合をモデルとして用い、すべてのモデル複雑性レベルにおいて最適な2部形式コードの明示的実装を構築する。
- 構造関数および最小ランダムネス欠际関数が定義域全体で任意の形状をとりうることを証明し、先行研究を拡張する。
- 計算可能確率密度関数および全再帰関数への分析を、対数的加法項まで拡張する。
- 構造関数およびランダムネス欠际関数の非計算可能性を確立するとともに、最短の2部形式コードが計算可能であることを示す。
実験結果
リサーチクエスチョン
- RQ1Kolmogorovのオリジナルの構造関数は、モデル選択の基礎として正当化可能か?
- RQ2非単調性を示すにもかかわらず、典型性を測る最小ランダムネス欠际関数は有効に近似可能か?
- RQ3構造関数および最小ランダムネス欠际関数がとりうるすべての形状の範囲は何か?
- RQ4構造関数およびアルゴリズム的十分統計量の計算可能性の性質は、モデル選択とどのように関係するか?
- RQ52部形式コードフレームワークは、計算可能密度関数や再帰関数といったより広いモデルクラスに対しても、どの程度有効か?
主な発見
- モデルの複雑さとデータからモデルへの符号化を最小化する2部形式コードのアプローチにより、データを最大限に典型とみなすモデルが得られ、最適な適合が達成される。
- 構造関数は定義域全体で任意の形状をとりうることを確認し、その表現力および一般応用可能性を裏付けた。
- 最小ランダムネス欠际関数は非計算可能であるが、最短の2部形式コードは計算可能であり、アルゴリズム的統計量における重要なパラドックスを解消した。
- 本稿は、すべてのモデル複雑性レベルにおいて最適な2部形式コードの明示的構成を提供し、実装可能性を実証した。
- 結果は、計算可能確率密度関数および全再帰関数のモデルクラスへ、対数的加法項まで拡張可能である。
- アルゴリズム的十分統計量が存在し、最小2部形式コードによって特徴づけられることを確認し、MDLおよび関連手法の基盤を提供した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。