TY - RPRT TI - Sample-Efficient Hypergradient Estimation for Decentralized Bi-Level Reinforcement Learning AU - Mikoto Kudo AU - Takumi Tanabe AU - Akifumi Wachi AU - Youhei Akimoto PY - 2026 UR - https://arxiv.org/abs/2603.14867 ID - 2603.14867 ER -