Skip to main content
QUICK REVIEW

[논문 리뷰] On redundancy of memoryless sources over countable alphabets

Maryam Hosseini, Narayana Santhanam|arXiv (Cornell University)|2014. 03. 31.
Algorithms and Data Compression참고 문헌 6인용 수 3
한 줄 요약

이 논문은 가산 무한 알파벳 위의 무-memory 소스에서 일련의 동일한 분포를 가진 시퀀스에 대한 일반화 압축의 부족함을 조사하며, 시퀀스 길이가 증가함에 따라 심볼당 부족함이 0으로 감소하는 조건을 규명한다. 유한한 단일 기호 부족함이 심볼당 부족함의 감소를 보장하지는 않으며, 분포의 尾행동을 포함하는 충분조건을 제시하여 부족함의 비선형 성장을 보장함으로써, 큰 알파벳 추정 및 압축 이론의 핵심적 간극을 해결한다.

ABSTRACT

The minimum average number of bits need to describe a random variable is its entropy, assuming knowledge of the underlying statistics On the other hand, universal compression supposes that the distribution of the random variable, while unknown, belongs to a known set $\cal P$ of distributions. Such universal descriptions for the random variable are agnostic to the identity of the distribution in $\cal P$. But because they are not matched exactly to the underlying distribution of the random variable, the average number of bits they use is higher, and the excess over the entropy used is the "redundancy". This formulation is fundamental to problems not just in compression, but also estimation and prediction and has a wide variety of applications from language modeling to insurance. In this paper, we study the redundancy of universal encodings of strings generated by independent identically distributed (iid) sampling from a set $\cal P$ of distributions over a countable support. We first show that if describing a single sample from $\cal P$ incurs finite redundancy, then $\cal P$ is tight but that the converse does not always hold. If a single sample can be described with finite worst-case-regret (a more stringent formulation than redundancy above), then it is known that length-$n$ iid samples only incurs a diminishing (in $n$) redundancy per symbol as $n$ increases. However, we show it is possible that a collection $\cal P$ incurs finite redundancy, yet description of length-$n$ iid samples incurs a constant redundancy per symbol encoded. We then show a sufficient condition on $\cal P$ such that length-$n$ iid samples will incur diminishing redundancy per symbol encoded.

연구 동기 및 목표

  • 가산 무한 알파벳 위의 무-memory 소스에서 일련의 동일한 분포를 가진 시퀀스에 대한 일반화 압축이 시퀀스 길이가 증가함에 따라 심볼당 부족함이 0으로 감소하는 조건을 이해하는 것.
  • 유한한 단일 기호 부족함과 장기 시퀀스에서의 부족함의 渐近적 행동 간의 관계를 명확히 하는 것.
  • 부족함의 비선형 성장을 보장하는 분포 클래스에 대한 충분조건을 제공하여, 고-또는 무한 알파벳 환경에서의 효과적인 압축 및 추정을 가능하게 하는 것.
  • 강한 부족함 및 패턴 기반 압축과 같은 기존 수식의 한계를 보완하기 위해 데이터 유도 일관성과 모델 특화 부족함 감쇠 속도에 초점을 맞추는 것.

제안 방법

  • 시퀀스 길이 j에 대해 log(j)/j에서 유도된 임계값을 사용하여 尾확률과 엔트로피 기여도에 기반해 '좋은' 및 '나쁜' 집합으로 시퀀스를 분해한다.
  • 모델 전반에 걸쳐 균일한 경계를 활용하여 '좋은' 및 '나쁜' 집합에서의 부족함을 별도로 경계하는 일반화된 코딩 체계를 적용한다.
  • 개별 분포 질량의 상한에서 유도된 참조 분포 q(n)를 사용하여 KL 발산을 경계하고, 유한한 단일 기호 부족함을 보장한다.
  • 작은 확률 꼬리에서 p(x)log(1/p(x))의 합에 대한 핵심 부등식을 활용하며, 이 합이 δ→0일 때 0으로 수렴하면 부족함이 감소함을 보여준다.
  • 두 가지 다른 조건 하에서 부족함의 행동을 분석한다: 하나는 꼬리 엔트로피가 0으로 수렴하는 경우이고, 다른 하나는 꼬리 KL 발산이 0으로 수렴하는 경우이며, 이 둘의 비등가성을 입증한다.
  • 예를 들어 클래스 𝒰와 같은 명시적 반례를 구성하여, 둘 중 어느 것도 다른 것을 함의하지 않으며, 둘 다 비선형 부족함 성장을 함께 가질 수 있음을 보여준다.

실험 결과

연구 질문

  • RQ1가산 무한 알파벳 위의 분포 클래스에 대해, 시퀀스 길이가 증가함에 따라 i.i.d. 시퀀스의 심볼당 부족함이 0으로 감소하는 조건은 무엇인가?
  • RQ2유한한 단일 기호 부족함(해당 클래스에서)이 장기 시퀀스에서 심볼당 부족함의 감소를 보장하는가? 만약 그렇지 않다면 추가로 필요한 조건은 무엇인가?
  • RQ3유한한 단일 기호 부족함을 가진 분포 클래스가 장기 i.i.d. 시퀀스에서 일정한 심볼당 부족함을 초래할 수 있는가? 만약 그렇다면, 이러한 행동은 어떻게 특징지을 수 있는가?
  • RQ4장기 시퀀스에서 부족함의 비선형 성장을 보장하는 분포의 꼬리 행동에 대한 충분조건이 존재하는가? 그리고 이는 강한 부족함 또는 패턴 기반 압축과 같은 기존 수식과 어떻게 관련이 있는가?
  • RQ5심볼당 부족함 감소를 위한 조건들이 필수적이고 충분한가, 아니면 현재의 특성화에 간극이 존재하는가?

주요 결과

  • 유한한 단일 기호 부족함이 심볼당 부족함 감소를 의미하지는 않는다. 장기 시퀀스에서 여전히 일정한 심볼당 부족함을 초래하는 유한한 단일 기호 부족함을 가진 클래스가 존재한다.
  • 심볼당 부족함 감소를 위한 충분조건은, 클래스 전반에 걸쳐 분포 p에 대해 T_{p,δ} 꼬리에서 p(x)log(1/p(x))의 합의 상한이 δ→0일 때 0으로 수렴하는 것이다.
  • 0에 큰 원자와 2^{k²}개의 기호에 대해 균일한 질량을 가진 분포 p_k를 포함하는 클래스 𝒰는 유한한 단일 기호 부족함을 가지지만, 꼬리 엔트로피 소멸 조건을 위반한다.
  • 클래스 𝒰에서 꼬리 엔트로피 합은 0에서 멀리 떨어져 있지만, 길이 n의 부족함은 비선형적으로 증가하므로, 이 충분조건이 필수는 아님을 보여준다.
  • 꼬리 엔트로피 합이 0에서 멀리 떨어져 있지만 꼬리 KL 발산 합이 0으로 수렴하는 클래스를 구성하여, 두 조건이 상호 독립적임을 입증한다.
  • 결과적으로 기존 수식(강한 부족함 또는 패턴 기반 압축 등)은 고-또는 무한 알파벳 환경에서의 부족함의 미세한 행동을 포괄하지 못하며, 데이터 유도 일관성과 모델 특화 수렴 속도에 기반한 새로운 특성화가 필요함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.