Skip to main content
QUICK REVIEW

[論文レビュー] Mismatched Guesswork

Salman Salamatian, Litian Liu|arXiv (Cornell University)|Jul 1, 2019
Algorithms and Data Compression参考文献 23被引用数 4
ひとこと要約

本稿は、真の分布 $\mu$ の代わりに不一致分布 $\nu$ を用いて推定される推測作業(guesswork)に対する大偏差原理(LDP)を導入する。これにより、漸近的な推測作業の成長は、真の分布 $\mu$ を $\nu$ のねじれ族 $\mathcal{T}_{\nu}$ に射影した分布のエントロピーによって支配されることを示し、一対一のソース符号化はプレフィックスフリー符号化よりも不一致に対してよりロバストであることが判明する。性能損失が消えるのは、真の分布 $\mu$ が $\nu$ のねじれ族上にある場合に限り、そのときのみである。

ABSTRACT

We study the problem of mismatched guesswork, where we evaluate the number of symbols $y \in \mathcal{Y}$ which have higher likelihood than $X \sim μ$ according to a mismatched distribution $ν$. We discuss the role of the tilted/exponential families of the source distribution $μ$ and of the mismatched distribution $ν$. We show that the value of guesswork can be characterized using the tilted family of the mismatched distribution $ν$, while the probability of guessing is characterized by an exponential family which passes through $μ$. Using this characterization, we demonstrate that the mismatched guesswork follows a large deviation principle (LDP), where the rate function is described implicitly using information theoretic quantities. We apply these results to one-to-one source coding (without prefix free constraint) to obtain the cost of mismatch in terms of average codeword length. We show that the cost of mismatch in one-to-one codes is no larger than that of the prefix-free codes, i.e., $D(μ\| ν)$. Further, the cost of mismatch vanishes if and only if $ν$ lies on the tilted family of the true distribution $μ$, which is in stark contrast to the prefix-free codes. These results imply that one-to-one codes are inherently more robust to mismatch.

研究の動機と目的

  • 推測に用いられる分布が真のソース分布と異なる場合の推測作業の大偏差挙動を分析すること。
  • ねじれ族の幾何的性質を用いて、不一致推測作業の漸近的成長率を特徴付けること。
  • 結果を一対一のソース符号化に応用し、プレフィックスフリー符号化と比較してその不一致に対するロバスト性を評価すること。
  • ソース符号化における不一致のコストが消える条件を特定すること。

提案手法

  • 真の分布 $\mu$ と不一致分布 $\nu$ のねじれ(指数)族を用い、これらに沿った射影を活用する。
  • LDPのレート関数は、$\nu$ のねじれ族上に存在する分布と真の分布 $\mu$ 間の相対エントロピーを用いて暗黙的に特徴づけられる。
  • ねじれ族 $\nu$ における変分最適化を通じて、推測作業の漸近的成長率が導出され、それが射影分布のエントロピーと関連づけられる。
  • 符号語長と推測作業値との間の対応関係を介して、推測作業と一対一のソース符号化との関係を確立し、LDPの結果を直接適用可能にする。
  • 不一致一対一符号化における再現性関数と平均符号語長は、L’Hôpitalの定理と極限解析を用いて推測作業のLDPから導出される。
  • 最適な一対一符号が $g_{\mu}(x^n) \leq l(f^*_{\mu}(x^n)) < g_{\mu}(x^n)+1$ を満たすという事実に依拠し、推測作業の結果を符号性能に翻訳可能である。

実験結果

リサーチクエスチョン

  • RQ1推測に用いる分布が真のソース分布と異なる場合、推測作業の大偏差挙動はどのように変化するか?
  • RQ2不一致推測作業の漸近的成長率は何か? そして、情報理論的量としてどのように特徴づけられるか?
  • RQ3一対一ソース符号化における不一致の性能コストは、プレフィックスフリー符号化と比べてどのように異なるか?
  • RQ4一対一ソース符号化において不一致のコストが消える条件は何か?
  • RQ5不一致一対一符号化における再現性関数と平均符号語長は、推測作業のLDPを用いて表現可能か?

主な発見

  • 不一致推測作業は、不一致分布 $\nu$ のねじれ族上に存在する分布と真の分布 $\mu$ 間の相対エントロピーを用いて暗黙的に定義されるレート関数を持つ大偏差原理(LDP)を満たす。
  • 不一致推測作業の漸近的成長率は、$\mu$ を $\nu$ のねじれ族 $\mathcal{T}_{\nu}$ に射影した分布のエントロピー $H(\Pi_{\mathcal{T}_{\nu}}(\mu))$ に等しい。
  • 不一致一対一ソース符号化における平均符号語長は $L(\nu\|\mu) = H(\Pi_{\mathcal{T}_{\nu}}(\mu))$ であり、これは常にプレフィックスフリー符号化のそれ以下である。
  • 一対一符号化における不一致のコストは、真の分布と不一致分布の間のKLダイバージェンス $D(\mu\|\nu)$ によって上界で抑えられ、プレフィックスフリー符号化よりも厳密に小さい。
  • 不一致による性能損失は、真の分布 $\mu$ が $\nu$ のねじれ族上にある、すなわち $\mu \in \mathcal{T}_{\nu}^{+}$ のときに限り、消える。
  • 不一致一対一符号化の再現性関数は $E(R,\nu\|\mu) = J(R)$ であり、推測作業に導出されたLDPレート関数と一致する。これにより、推測作業と符号性能との間の密接な関係が確認される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。