Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Reinforcement Learning based Modulation and Coding Scheme Selection in Cognitive Heterogeneous Networks

Lin Zhang, Junjie Tan|arXiv (Cornell University)|2018. 11. 07.
Cognitive Radio Networks and Spectrum Sensing참고 문헌 28인용 수 8
한 줄 요약

이 논문은 인지 이종망에서 이중 사용자에 의한 간섭을 보완하기 위해 불완전한 스펙트럼 감지 조건 하에서 주 사용자의 간섭을 적응적으로 완화할 수 있도록 딥 강화학습(DRL) 기반의 변조 및 코딩 체계(MCS) 선택 알고리즘을 제안한다. 간섭 패턴을 학습하고 스위칭 비용 요소를 통합함으로써 DRL 에이전트는 최적에 가까운 전송 속도(최적의 90–100%)를 달성하면서도 시스템 오버헤드를 감소시켜 정적 및 동적 간섭 환경 모두에서 기준 알고리즘을 능가한다.

ABSTRACT

We consider a cognitive heterogeneous network (HetNet), in which multiple pairs of secondary users adopt sensing-based approaches to coexist with a pair of primary users on a certain spectrum band. Due to imperfect spectrum sensing, secondary transmitters (STs) may cause interference to the primary receiver (PR) and make it difficult for the PR to select a proper modulation and/or coding scheme (MCS). To deal with this issue, we exploit deep reinforcement learning (DRL) and propose an intelligent MCS selection algorithm for the primary transmission. To reduce the system overhead caused by MCS switchings, we further introduce a switching cost factor in the proposed algorithm. Simulation results show that the primary transmission rate of the proposed algorithm without the switching cost factor is 90 percent to 100 percent of the optimal MCS selection scheme, which assumes that the interference from the STs is perfectly known at the PR as prior information, and is 30 percent to 100 percent higher than those of the benchmark algorithms. Meanwhile, the proposed algorithm with the switching cost factor can achieve a better balance between the primary transmission rate and system overheads than both the optimal algorithm and benchmark algorithms.

연구 동기 및 목표

  • 인지 이종망에서 불완전한 스펙트럼 감지로 인해 발생하는 주 사용자 전송 품질 저하 문제를 해결하기 위해.
  • 모르는 간섭을 가진 이중 전송기로부터 주 사용자가 최적의 변조 및 코딩 체계를 적응적으로 선택할 수 있도록 지능형 MCS 선택 메커니즘을 개발하기 위해.
  • 강화학습 프레임워크에 스위칭 비용 요소를 도입하여 주 전송 속도와 시스템 오버헤드 사이의 균형을 맞추기 위해.
  • 정적 및 동적 간섭 조건 하에서 제안된 DRL 기반 알고리즘의 성능을 평가하고 최적 알고리즘 및 기준 알고리즘과 비교하기 위해.

제안 방법

  • 주 수신기에서 DRL 에이전트로 딥 Q넷(DQN)을 사용하여 시간에 따라 이중 전송기로부터 온 간섭 패턴을 학습한다.
  • 에이전트는 현재 간섭 수준을 관측하고 장기 보상(전송 속도와 스위칭 비용 간의 트레이드오프)을 최대화하는 MCS를 선택한다.
  • 스위칭 비용 요소를 보상 함수에 도입하여 빈번한 MCS 변경을 방지함으로써 시스템 오버헤드를 감소시킨다.
  • 학습 안정성을 확보하기 위해 경험 리플레이 메모리에서 과거 상태-행동-보상 전이를 샘플링하는 리플레이 버퍼와 타겟 네트워크를 사용하여 DRL 에이전트를 훈련시킨다.
  • 다양한 이중 사용자 쌍이 존재하는 실제적인 인지 HetNet 조건을 시뮬레이션하여 정적 및 동적 간섭 시나리오 모두에서 알고리즘을 평가한다.
  • 보상 함수는 순순간 전송 속도와 MCS 스위칭 빈도 비례하는 페널티 항을 조합하여 에이전트가 성능과 오버헤드 사이의 균형을 유지할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1불완전한 스펙트럼 감지 조건 하에서 인지 HetNet 환경에서 DRL 기반 MCS 선택 알고리즘이 이중 사용자로부터 온 간섭 패턴을 효과적으로 학습하고 적응할 수 있는가?
  • RQ2스위칭 비용 요소의 포함 여부가 MCS 적응에서 주 전송 속도와 시스템 오버헤드 사이의 트레이드오프에 미치는 영향는 어떠한가?
  • RQ3완전한 간섭 지식을 가정한 최적의 MCS 선택 기법과 비교했을 때 제안된 DRL 알고리즘의 성능는 어떠한가?
  • RQ4전송 속도 및 스위칭 빈도 측면에서 DRL 기반 알고리즘이 기준 알고리즘(SNR 기반 및 UCB 기반 등)보다 어떤 성능 향상을 보이는가?
  • RQ5동적 간섭 조건 하에서 DRL 에이전트가 최적 알고리즘과 기존 기준 대비 전송 속도와 스위칭 오버헤드 사이의 균형을 더 잘 달성할 수 있는가?

주요 결과

  • 제안된 DRL 기반 MCS 선택 알고리즘은 이중 간섭을 완전히 알고 있다는 가정 하에 최적 기법의 90–100%의 전송 속도를 달성한다.
  • 스위칭 비용이 없을 경우, 알고리즘이 기준 알고리즘보다 전송 속도에서 30–100% 향상되어 간섭에 대한 강력한 적응성을 입증한다.
  • 스위칭 비용 요소가 포함된 경우, 비용이 0에서 6으로 증가함에 따라 MCS 스위칭 빈도는 약 0.26에서 약 0.03으로 감소하지만 높은 전송 속도를 유지한다.
  • 동적 간섭 환경에서 스위칭 비용이 0에서 3.5 사이일 경우, DRL 알고리즘이 UCB 알고리즘보다 더 높은 수렴 전송 속도(1.25–2 kbits/frame)를 달성하며 스위칭 빈도는 유사하다.
  • 스위칭 비용이 3.5에서 6 사이일 경우, DRL 알고리즘은 동일한 스위칭 빈도(~0.03)를 유지하면서 UCB보다 더 높은 수렴 전송 속도(2 kbits/frame 이상)를 달성하여 엄격한 오버헤드 제약 조건 하에서도 뛰어난 성능을 보인다.
  • 모든 스위칭 비용 수준(0.5에서 6)에서 DRL 기반 알고리즘이 SNR 기반 알고리즘보다 전송 속도와 스위칭 빈도 측면에서 항상 뛰어나 성능의 견고성과 적응성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.