TY - RPRT TI - A Lyapunov Drift-Plus-Penalty Method Tailored for Reinforcement Learning with Queue Stability AU - Wenhan Xu AU - Jiashuo Jiang AU - Lei Deng AU - Danny Hin-Kwok Tsang PY - 2026 UR - https://arxiv.org/abs/2506.04291 ID - 2506.04291 ER -