TY - RPRT TI - Deep Reinforcement Learning: From First Principles to Reasoning Models AU - Ghoshana Bista PY - 2026 UR - https://arxiv.org/abs/2608.00133 ID - 2608.00133 ER -