TY - RPRT TI - Breaking the Safety-Capability Tradeoff: Reinforcement Learning with Verifiable Rewards Maintains Safety Guardrails in LLMs AU - Dongkyu Derek Cho AU - Huan Song AU - Arijit Ghosh Chowdhury AU - Haotian An AU - Yawei Wang AU - Rohit Thekkanal AU - Negin Sokhandan AU - Sharlina Keshava AU - Hannah Marlowe PY - 2025 UR - https://arxiv.org/abs/2511.21050 ID - 2511.21050 ER -