Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement Learning Evaluation and Solution for the Feedback Capacity of the Ising Channel with Large Alphabet

Ziv Aharoni, Oron Sabag|arXiv (Cornell University)|Aug 18, 2020
Reinforcement Learning in Robotics参考文献 13被引用数 5
ひとこと要約

本稿では、特に大規模なアルファベットサイズを有するイジングチャネルを対象として、動的計画法における指数的計算複雑性の課題を克服するため、強化学習(RL)に基づくフィードバック容量の計算手法を提案する。ニューラルネットワークを用いた関数近似を用いることで、容量の数値的下界を導出し、Qグラフを用いて最適解の構造を同定し、双対性手法を用いて解析的上界を確立する。その結果、アルファベットサイズ ≤8 では正確な容量が得られ、より大きなアルファベットサイズに対してもタイトな境界が得られる。

ABSTRACT

We propose a new method to compute the feedback capacity of unifilar finite state channels (FSCs) with memory using reinforcement learning (RL). The feedback capacity was previously estimated using its formulation as a Markov decision process (MDP) with dynamic programming (DP) algorithms. However, their computational complexity grows exponentially with the channel alphabet size. Therefore, we use RL, and specifically its ability to parameterize value functions and policies with neural networks, to evaluate numerically the feedback capacity of channels with a large alphabet size. The outcome of the RL algorithm is a numerical lower bound on the feedback capacity, which is used to reveal the structure of the optimal solution. The structure is modeled by a graph-based auxiliary random variable that is utilized to derive an analytic upper bound on the feedback capacity with the duality bound. The capacity computation is concluded by verifying the tightness of the upper bound by testing whether it is BCJR invariant. We demonstrate this method on the Ising channel with an arbitrary alphabet size. For an alphabet size smaller than or equal to 8, we derive the analytic solution of the capacity. Next, the structure of the numerical solution is used to deduce a simple coding scheme that achieves the feedback capacity and serves as a lower bound for larger alphabets. For an alphabet size greater than 8, we present an upper bound on the feedback capacity. For an asymptotically large alphabet size, we present an asymptotic optimal coding scheme.

研究の動機と目的

  • 大規模なアルファベットサイズを有するユニフィラーFSCのフィードバック容量を計算する際、従来の動的計画法における指数的計算複雑性を解消すること。
  • 状態空間の爆発により従来のMDPソルバーが失敗するようなチャネルにおいて、スケーラブルなフィードバック容量推定手法の開発。
  • RLの関数近似を活用し、数値的にフィードバック容量を推定するとともに、解析的解の導出に役立てる構造的パターンを同定すること。
  • 双対性手法を用いて解析的上界を導出し、BCJR不変性を用いてそのタイトさを検証することで、容量達成可能性を確認すること。
  • 小規模なアルファベットサイズに対して容量を達成する符号化方式を提案し、大規模なアルファベットサイズに対して漸近的境界を導出すること。

提案手法

  • 信念状態と入力分布をパrameter化した連続的状態空間および連続的行動空間を持つマルコフ決定過程(MDP)として、フィードバック容量問題を定式化する。
  • 深層強化学習を用い、ニューラルネットワークによる価値関数および方策の近似を実行することで、大規模な状態空間および行動空間におけるスケーラブルな最適化を可能にする。
  • 数値的RL出力を用いて、MDPの主要な状態と遷移を捉える有限状態表現(Qグラフ)を構築する。
  • Qグラフを補助確率変数として用い、双対性バウンド手法を用いてフィードバック容量の解析的上界を導出する。
  • 遷移行列 $T_{Y|Q}$ のBCJR不変性を検証することで、上界のタイトさをテストし、その達成可能性を確認する。
  • |$\mathcal{X}| \leq 8$ の場合、閉形式の解析的解と、容量を達成するシンプルな符号化方式を導出する。

実験結果

リサーチクエスチョン

  • RQ1動的計画法が失敗する大規模なアルファベットサイズを有するユニフィラーFSCにおいて、強化学習がフィードバック容量を効果的に推定できるか。
  • RQ2アルファベットサイズが増加するに従い、イジングチャネルの最適方策にどのような構造的パターンが現れるか。
  • RQ3RLからの数値的解を用いて、双対性手法を用いて解析的上界を導出可能なQグラフを構築できるか。
  • RQ4導出されたフィードバック容量の上界はタイトか? また、BCJR不変性を用いてそのタイトさを検証できるか。
  • RQ5アルファベットサイズが増大するに従い、イジングチャネルのフィードバック容量の漸近的挙動はいかなるものか。

主な発見

  • アルファベットサイズ $|\mathcal{X}| \leq 8$ において、イジングチャネルのフィードバック容量は解析的に $C_{\text{FB}} = \frac{3}{4} \log \frac{|\mathcal{X}|}{2}$ として決定される。
  • アルファベットサイズ $|\mathcal{X}| \leq 8$ に対して、2つの互いに素なアルファベット部分集合から交互に送信する符号化方式が導出され、これが容量を達成する。
  • アルファベットサイズが増加するに従い、RLベースの数値的下界が向上するため、最適方策の構造が $|\mathcal{X}| = 8$ を超えて変化していることが示唆される。
  • アルファベットサイズ $|\mathcal{X}| > 8$ に対しては、双対性手法を用いて解析的上界が導出されたが、そのタイトさは未検証のままである。
  • BCJR不変性を用いた検証により、上界が $|\mathcal{X}| \leq 8$ においてタイトであることが示され、解析的解の正当性が確認された。
  • 大規模なアルファベットサイズの漸近的挙動に対して、下界と上界が漸近的にタイトであることが導出され、$|\mathcal{X}| \leq 8$ ではレートが $\frac{2}{3}$ に飽和することが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。