TY - RPRT TI - A-3PO: Accelerating Asynchronous LLM Training with Staleness-aware Proximal Policy Approximation AU - Xiaocan Li AU - Shiliang Wu AU - Zheng Shen PY - 2026 UR - https://arxiv.org/abs/2512.06547 ID - 2512.06547 ER -