TY - RPRT TI - Training Long-Context, Multi-Turn Software Engineering Agents with Reinforcement Learning AU - Alexander Golubev AU - Maria Trofimova AU - Sergei Polezhaev AU - Ibragim Badertdinov AU - Maksim Nekrashevich AU - Anton Shevtsov AU - Simon Karasik AU - Sergey Abramov AU - Andrei Andriushchenko AU - Filipp Fisin AU - Sergei Skvortsov AU - Boris Yangel PY - 2025 UR - https://arxiv.org/abs/2508.03501 ID - 2508.03501 ER -