TY - RPRT TI - Bilevel Multi-Armed Bandit-Based Hierarchical Reinforcement Learning for Interaction-Aware Self-Driving at Unsignalized Intersections AU - Zengqi Peng AU - Yubin Wang AU - Lei Zheng AU - Jun Ma PY - 2025 UR - https://arxiv.org/abs/2502.03960 ID - 2502.03960 ER -