Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Player Multi-Armed Bandit Based Resource Allocation for D2D Communications

Anushree Neogi, Prasanna Chaporkar|arXiv (Cornell University)|2018. 12. 12.
Advanced Bandit Algorithms Research참고 문헌 15인용 수 6
한 줄 요약

이 논문은 부분적인 채널 상태 정보(partial CSI) 하에서 디바이스 투 디바이스(D2D) 통신의 전력 및 자원 할당을 위한 다중 플레이어 다중 손잡이 밴딧(MP-MAB) 프레임워크를 제안한다. UCB1과 Exp3 알고리즘을 사용하여 탐색과 이용의 균형을 이룬다. 5G 네트워크 환경에서 셀룰러 사용자(CU)의 최소 요구 QoS를 보장하는 조건에서, MP-UCB1은 kth-UCB1, DLF 및 Exp3 기반 정책에 비해 더 높은 합산 전송률과 공정성을 달성함을 보여준다.

ABSTRACT

Device-to-device (D2D) communications is expected to play a significant role in increasing the system capacity of the fifth generation (5G) wireless networks. To accomplish this, efficient power and resource allocation algorithms need to be devised for the D2D users. Since the D2D users are treated as secondary users, their interference to the cellular users (CUs) should not hamper the CU communications. Most of the prior works on D2D resource allocation assume full channel state information (CSI) at the base station (BS). However, the required channel gains for the D2D pairs may not be known. To acquire these in a fast fading channel requires extra power and control overhead. In this paper, we assume partial CSI and formulate the D2D power and resource allocation problem as a multi-armed bandit problem. We propose a power allocation scheme for the D2D users in which the BS allocates power to the D2D users if a certain signal-to-interference-plus-noise ratio (SINR) is maintained for the CUs. In a single player environment a D2D user selects a CU in every time slot by employing UCB1 algorithm. Since this resource allocation problem can also be considered as an adversarial bandit problem we have applied the exponential-weight algorithm for exploration and exploitation (Exp3) to solve it. In a multiple player environment, we extend UCB1 and Exp3 to multiple D2D users. We also propose two algorithms that are based on distributed learning algorithm with fairness (DLF) and kth-UCB1 algorithms in which the D2D users are ranked. Our simulation results show that our proposed algorithms are fair and achieve good performance.

연구 동기 및 목표

  • 완전한 채널 상태 정보가 높은 오버헤드로 인해 비현실적이므로, 부분적인 채널 상태 정보 하에서 D2D 통신의 전력 및 자원 할당 문제를 해결하는 것.
  • D2D 사용자가 셀룰러 사용자의 스펙트럼을 기회적으로 재사용하는 동안 셀룰러 사용자(CU)가 최소 요구 신호대간섭비(SINR)를 유지하도록 보장하는 것.
  • 동일한 자원 블록을 경쟁하는 다수의 D2D 사용자 간의 충돌을 최소화하고 공정성을 확보하는 분산 학습 알고리즘을 설계하는 것.
  • 단일 플레이어 밴딧 알고리즘(UCB1, Exp3)을 순위가 매겨진 사용자를 포함한 다중 플레이어 환경으로 확장하여 확장 가능하고 공정한 D2D 액세스를 가능하게 하는 것.

제안 방법

  • 부분적인 CSI 하에서 D2D 전력 및 자원 할당 문제를 다중 플레이어 다중 손잡이 밴딧(MP-MAB) 문제로 수식화한다.
  • 각 D2D 사용자가 예상 전송률을 최대화하는 셀룰러 사용자 자원 블록을 선택하기 위해 UCB1 알고리즘을 적용하며, 탐색과 이용의 균형을 유지한다.
  • UCB1과 Exp3를 다중 플레이어 환경으로 확장하여 충돌 감소 및 공정성 확보를 위한 메커니즘을 도입한다.
  • 사용자가 순위가 매겨지고 순위 기반으로 암을 선택하도록 학습하는 두 가지 신규 알고리즘—DLF(Distributed Learning with Fairness)와 kth-UCB1—을 도입한다. 이는 간섭을 감소시킨다.
  • 셀룰러 사용자(CU)의 최소 SINR 임계값(γ^tgt)을 설정한다. 전력은 오직 CU의 SINR가 이 임계값을 초과할 경우에만 D2D 사용자에게 할당된다.
  • 모든 사용자 및 채널 간에 밴딧 피드백을 표준화하기 위해 순간 수상(throughput)을 구간 [0,1]로 정규화한다.

실험 결과

연구 질문

  • RQ1부분적인 CSI 하에서 셀룰러 사용자로부터 자원 블록을 효율적으로 선택하면서도 셀룰러 사용자의 최소 QoS를 유지할 수 있는 방법은 무엇인가?
  • RQ2사용자 순위와 공정성 메커니즘이 다중 플레이어 D2D 밴딧 학습에서 충돌 감소와 시스템 전송률에 미치는 영향은 무엇인가?
  • RQ3다중 사용자 D2D 자원 할당 환경에서 UCB1 및 Exp3 기반 정책 간의 공정성과 누적 전송률 측면에서의 비교 결과는 어떠한가?
  • RQ4어려운 밴딧 알고리즘인 Exp3는 QoS 제약 조건을 보장하는 D2D 스펙트럼 공유에 효과적으로 적용될 수 있는가?
  • RQ5kth-UCB1과 DLF는 표준 UCB1에 비해 다중 사용자 D2D 환경에서 공정성을 얼마나 향상시키는가?

주요 결과

  • MP-UCB1은 낮은 충돌률과 최적의 CU 선택 빈도가 높아 모든 평가된 알고리즘 중에서 가장 높은 합산 전송률을 달성한다.
  • 공정성 백분율—각 D2D 사용자가 자신의 최적 CU를 선택하는 비율—은 MP-UCB1에서 가장 높았으며, 그 다음으로 DLF와 kth-UCB1, Exp3는 가장 낮은 공정성을 보였다.
  • 높은 충돌률과 낮은 공정성에도 불구하고, kth-UCB1과 DLF는 사용자가 순위 기반 최적의 암을 선택함으로써 간섭을 감소시켜 여전히 높은 합산 전송률을 달성한다.
  • 셀룰러 사용자의 합산 전송률은 안정적으로 일정 평균에 가까이 유지되며, 전력 할당 결정과 충돌로 인한 변동이 발생한다.
  • D2D 사용자의 합산 전송률은 D2D 링크의 더 짧은 통신 거리와 높은 스펙트럼 효율성으로 인해 셀룰러 사용자보다 높다.
  • 제안된 알고리즘들은 셀룰러 사용자의 SINR가 항상 임계값 γ^tgt를 초과하도록 보장하여 QoS를 보장하고 성능 저하를 방지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.