Skip to main content
QUICK REVIEW

[논문 리뷰] IRS-Assisted Ambient Backscatter Communications Utilizing Deep Reinforcement Learning

Xiaolun Jia, Xiangyun Zhou|arXiv (Cornell University)|2021. 03. 12.
Advanced Wireless Communication Technologies참고 문헌 21인용 수 6
한 줄 요약

이 논문은 사전 채널 상태 정보(CSI)가 없는 환경에서 암묵적 백스캐터링 통신(AmBC) 시스템에서 지능형 반사면(IRS)의 위상 시프트와 리더 비임베딩을 최적화하기 위해 딥 강화학습(DRL) 기반 프레임워크를 제안한다. 수정된 딥 디터미니스틱 정책 경사(DDPG) 알고리즘을 사용하며, 에피소드 단위 학습과 0 할인율을 적용하여, 전체 CSI 기준 성능에 비해 25% 이내의 검출 성능를 달성함으로써, 알려지지 않은 환경 신호와 동적인 fading 환경에서도 효과적인 운영이 가능함을 입증한다.

ABSTRACT

We consider an ambient backscatter communication (AmBC) system aided by an intelligent reflecting surface (IRS). The optimization of the IRS to assist AmBC is extremely difficult when there is no prior channel knowledge, for which no design solutions are currently available. We utilize a deep reinforcement learning-based framework to jointly optimize the IRS and reader beamforming, with no knowledge of the channels or ambient signal. We show that the proposed framework can facilitate effective AmBC communication with a detection performance comparable to several benchmarks under full channel knowledge.

연구 동기 및 목표

  • 모르는 환경 신호와 CSI 부족으로 인한 심각한 직접 링크 간섭(DLI) 문제를 해결한다.
  • 완전한 채널 상태 정보(CSI)가 제공되지 않을 경우 IRS 위상 시프트 최적화의 어려움을 극복한다.
  • 환경 신호의 세기나 채널 계수를 알 필요 없이 관측된 신호 샘플만을 기반으로 학습 기반 프레임워크를 설계한다.
  • 수동 태그와 알려지지 않은 신원으로 인해 CSI 수집이 불가능한 실생활 실내 환경에서 효과적인 IRS 보조 AmBC를 가능하게 한다.
  • 채널 지식이 없고 시간에 따라 변화하는 환경 신호가 존재하는 상황에서도 전체 CSI 기준 성능에 근접한 성능를 달성한다.

제안 방법

  • 부분 관측 가능한 환경에서 작동하도록 수정된 딥 디터미니스틱 정책 경사(DDPG) 알고리즘을 사용하며, CSI가 없는 조건에서 적용한다.
  • 알 수 없는 환경 신호와 fading으로 인한 시간에 따라 변화하는 보상 함수를 처리하기 위해, 에피소드 단위 학습과 할인율 γ = 0을 사용한다.
  • 실시간 검출 성능를 반영하기 위해 순시 신호 대 간섭 및 노이즈 비율(SINR)을 기반으로 보상 함수를 설정한다.
  • IRS가 없는 경우의 최적 고유벡터 조합기로부터 DRL 정책을 초기화하여 탐색과 수렴을 향상시킨다.
  • 소스와 백스캐터링 데이터로부터 관측된 신호 샘플을 사용하여 액터-크리틱 네트워크를 학습시키며, IRS 위상 시프트와 비임베딩 가중치를 동시에 업데이트한다.
  • 리더에서 단위 노름을 가진 비임베딩 벡터 g를 사용한 선형 조합을 적용하여, 백스캐터링 기호의 에너지 검출을 가능하게 한다.

실험 결과

연구 질문

  • RQ1CSI가 전혀 없는 조건에서 DRL 기반 프레임워크가 AmBC 시스템에서 IRS와 비임베딩 최적화를 효과적으로 수행할 수 있는가?
  • RQ2CSI 없는 DRL 프레임워크의 성능는 전체 CSI 기준 성능과 비교해 검출 신뢰성 측면에서 어떻게 나타나는가?
  • RQ3학습 기간과 에피소드 길이가 DRL 프레임워크의 수렴성과 성능에 미치는 영향은 어떠한가?
  • RQ4CSI가 알려지지 않은 조건에서 IRS 반사판 수가 시스템의 검출 성능에 미치는 영향는 어떠한가?
  • RQ5명시적인 채널 추정 없이도 DRL 프레임워크가 시간 상관성이 있는 채널과 변동하는 환경 신호 세기에 적응할 수 있는가?

주요 결과

  • 제안된 DRL 프레임워크는 모든 IRS 크기에서 최고의 전체 CSI 기준 성능(Best full-CSI benchmark, eigenvector combiner with IRS)과 비교해 중앙값 기반 일반화된 비율 용량 차이(GRCD)가 25% 이내로 유지된다.
  • N = 64개의 반사판을 가진 IRS의 경우, 최고의 비-IRS 기준 성능보다 비트 오류율(BER)이 한 계단 높아진다.
  • L_t = 100인 학습 기호 지속 시간은 정확한 채널 공분산 추정을 가능하게 하며, 이 이상에서는 수익 감소 효과가 나타난다.
  • 장기적인 학습 단계(T_1)는 GRCD 성능 향상에 기여하며, T_1 = 0일 경우 성능이 열악한 것으로 나타나, CSI가 없는 환경에서 무작위 탐색의 필요성을 시사한다.
  • 에피소드 단위 학습과 할인율 0을 통해, 각 에피소드의 보상 함수 변화를 반영함으로써, 다양한 채널 실현에서 안정적인 성능를 유지한다.
  • 비-IRS 경우의 최적 고유벡터 조합기를 초기화 값으로 사용함으로써, DRL 과정의 탐색과 수렴성이 크게 향상된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.