Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning of Beam Codebooks in Millimeter Wave and Terahertz MIMO Systems

Yu Zhang, Muhammad Alrabeiah|arXiv (Cornell University)|2021. 02. 22.
Millimeter-Wave Propagation and Modeling참고 문헌 31인용 수 6
한 줄 요약

이 논문은 채널 지식, 어레이 기하학, 사용자 위치 정보 없이 수신 전력 측정값만을 사용하여 mmWave/THz MIMO 시스템에서 비스듬한 코드북을 자동으로 최적화하는 딥 강화학습(DRL) 프레임워크를 제안한다. 이 방법은 환경 및 하드웨어에 적응하는 비스듬한 패턴(예: 비선형 시선(NLOS) 환경에서의 다중 lob beam, 위상 불일치 하에서의 왜곡 보정 beam)을 학습하여, 전통적인 코드북에 비해 훨씬 낮은 비스듬한 학습 오버헤드로 근사 최적 성능를 달성한다.

ABSTRACT

Millimeter wave (mmWave) and terahertz MIMO systems rely on pre-defined beamforming codebooks for both initial access and data transmission. Being pre-defined, however, these codebooks are commonly not optimized for specific environments, user distributions, and/or possible hardware impairments. This leads to large codebook sizes with high beam training overhead which increases the initial access/tracking latency and makes it hard for these systems to support highly mobile applications. To overcome these limitations, this paper develops a deep reinforcement learning framework that learns how to iteratively optimize the codebook beam patterns (shapes) relying only on the receive power measurements and without requiring any explicit channel knowledge. The developed model learns how to autonomously adapt the beam patterns to best match the surrounding environment, user distribution, hardware impairments, and array geometry. Further, this approach does not require any knowledge about the channel, array geometry, RF hardware, or user positions. To reduce the learning time, the proposed model designs a novel Wolpertinger-variant architecture that is capable of efficiently searching for an optimal policy in a large discrete action space, which is important for large antenna arrays with quantized phase shifters. This complex-valued neural network architecture design respects the practical RF hardware constraints such as the constant-modulus and quantized phase shifter constraints. Simulation results based on the publicly available DeepMIMO dataset confirm the ability of the developed framework to learn near-optimal beam patterns for both line-of-sight (LOS) and non-LOS scenarios and for arrays with hardware impairments without requiring any channel knowledge.

연구 동기 및 목표

  • mmWave/THz MIMO 시스템에서 전통적인 사전 정의된 비스듬한 코드북의 높은 비스듬한 학습 오버헤드와 비최적 성능 문제를 해결한다.
  • 비선형 시선(NLOS) 전파나 하드웨어 결함에 적응하지 못하는 고정된 단일 lob 비스듬한 패턴의 한계를 극복한다.
  • 명시적 채널 상태 정보, 사용자 위치 지식, 어레이 기하학 가정 없이도 작동하는 학습 프레임워크를 개발한다.
  • 양자화된 위상 시프터와 위상 불일치와 같은 현실적인 하드웨어 제약 조건 하에서도 강건한 비스듬한 코드북 학습을 가능하게 한다.
  • 대규모 안테나 어레이에 따른 위상 양자화로 인해 발생하는 큰 이산 행동 공간에서의 학습 시간과 탐색 복잡도를 감소시킨다.

제안 방법

  • 수신 전력을 유일한 보상 신호로 사용하여 비스듬한 패턴 정책을 학습하는 딥 강화학습(DRL) 프레임워크를 적용한다.
  • 양자화된 위상 시프터로 인해 발생하는 큰 이산 행동 공간을 효율적으로 탐색하기 위해 새로운 Wolpertinger-변형 신경망 아키텍처를 도입한다.
  • 상수 모듈러스 및 양자화된 위상 시프터 제약 조건을 고려한 복소수 신경망을 설계한다.
  • 사용자 위치나 학습 중 정적 상태에 대한 지식이 필요 없이 비스듬한 코드북을 학습하기 위해 클러스터링-할당 전략을 구현한다.
  • 다양한 전파 환경에서 수신 전력을 최대화하는 비스듬한 형성 벡터를 최적화하기 위해 정책 기반 강화학습 목표를 사용한다.
  • 학습된 비스듬한 패턴을 깨끗한 및 손상된 각도 영역에 투영하여 하드웨어 결함에 대한 적응 능력을 검증한다.

실험 결과

연구 질문

  • RQ1명시적 채널 상태 정보가 없이도 DRL 기반 접근 방식이 mmWave/THz MIMO 시스템에서 최적의 비스듬한 코드북을 학습할 수 있는가?
  • RQ2DRL 프레임워크는 비선형 시선(NLOS) 환경(예: 벽 반사가 있는 환경)에 비스듬한 패턴을 얼마나 잘 적응시킬 수 있는가?
  • RQ3학습된 코드북이 위상 불일치나 안테나 간격 오차와 같은 하드웨어 결함을 어느 정도 보완할 수 있는가?
  • RQ4전통적인 대규모 비스듬한 코드북에 비해, DRL 프레임워크가 환경에 적응하는 작고 효율적인 코드북을 학습함으로써 비스듬한 학습 오버헤드를 얼마나 줄일 수 있는가?
  • RQ5완전한 채널 지식 하에서 이상적인 제약 없는 비스듬한 형성 성능에 비해 학습된 코드북의 성능은 어떻게 되는가?

주요 결과

  • 제안된 DRL 프레임워크는 NLOS 환경에서 다중 반사 경로의 에너지를 포착할 수 있는 다중 lob 비스듬한 패턴을 학습하여, 전통적인 단일 lob 비스듬한 형성 코드북보다 우수한 성능를 보인다.
  • NLOS 환경에서 학습된 16비트 코드북은 다중 경로를 활용함으로써 전통적인 비스듬한 형성 코드북보다 더 높은 평균 비스듬한 형성 이득을 달성한다.
  • 표준편차가 최대 0.3λ까지 발생하는 위상 불일치 조건에서도 DRL로 학습된 코드북은 안정적인 성능를 유지하며 미미한 변동만을 보이며, 전통적인 32비트 코드북은 심각하게 성능이 저하된다.
  • 깨끗한 각도 영역에서는 학습된 비스듬한 패턴이 왜곡되어 보이지만, 손상된 각도 영역에서는 날카롭게 집중되는 모습을 보이며 하드웨어 결함에 대한 효과적인 보정이 이루어졌음을 확인한다.
  • DRL로 학습된 코드북은 완전한 채널 지식 하에서 이상적인 제약 없는 비스듬한 형성 벡터와 비슷한 비스듬한 형성 이득을 달성하여 근사 최적 성능를 입증한다.
  • 이 프레임워크는 더 작은 비스듬한 수(예: 8~16개)를 사용함으로써 비스듬한 학습 오버헤드를 줄였으며, 특히 도전적인 전파 및 하드웨어 조건에서 기존의 더 큰 전통적 코드북(예: 32비트)보다 뛰어난 성능를 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.