TY - RPRT TI - Self-Supervised On-Policy Reinforcement Learning via Contrastive Proximal Policy Optimisation AU - Asim Osman AU - Sasha Abramowitz AU - Mark Bergh AU - Ulrich Armel Mbou Sob AU - Ruan John de Kock AU - Omayma Mahjoub AU - Oussama Hidaoui AU - Noah De Nicola AU - Arnol Manuel Fokam AU - Felix Chalumeau AU - Daniel Rajaonarivonivelomanantsoa AU - Siddarth Singh AU - Refiloe Shabe AU - Juan Claude Formanek AU - Simon Verster Du Toit AU - Arnu Pretorius PY - 2026 UR - https://arxiv.org/abs/2605.13554 ID - 2605.13554 ER -