TY - RPRT TI - AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs AU - Haizhong Zheng AU - Yizhuo Di AU - Jiahui Wang AU - Shuowei Jin AU - Xueshen Liu AU - Yongji Wu AU - Z. Morley Mao AU - Ion Stoica AU - Jiawei Zhao AU - Beidi Chen PY - 2026 UR - https://arxiv.org/abs/2605.15565 ID - 2605.15565 ER -