UAV Coverage Path Planning With Quantum-Based Recurrent Deep Deterministic Policy Gradient

Citations

WEB OF SCIENCE

26
Citations

SCOPUS

28

초록

This study proposes quantum-based deep deterministic policy gradient (Q-DDPG) and quantum-based recurrent DDPG (Q-RDDPG) schemes for time-series optimization in UAV communications. Herein, Q-DDPG-based actor-critic reinforcement learning is utilized to optimize action selections in a large state and continuous action space. In this scheme, quantum models are exploited to reduce computational complexity and training loss. As a particular case, Q-DDPG and Q-RDDPG are employed for trajectory optimization and dynamic resource allocation in UAV communications. The results demonstrate that Q-DDPG and Q-RDDPG schemes achieved higher rewards with lower training losses compared to classical DDPG.

키워드

Autonomous aerial vehicles; Training; Optimization; NOMA; Encoding; Vehicle dynamics; Resource management; Deep deterministic policy gradient; energy efficiency; quantum embedding; recurrent; UAV communications; NETWORKS
제목
UAV Coverage Path Planning With Quantum-Based Recurrent Deep Deterministic Policy Gradient
저자
Silvirianti; Narottama, Bhaskara; Shin, Soo Young
DOI
10.1109/TVT.2023.3347219
발행일
2024-05
유형
Article
저널명
IEEE Transactions on Vehicular Technology
권
73
호
5
페이지
7424 ~ 7429