TY - RPRT TI - HiFloat4 Format for End-To-End Reinforcement Learning Post-Training of Large Language Models AU - Hei Yi Mak AU - Shadan Golestan AU - Hoang Le AU - Mehran Taghian Jazi AU - Yunke Peng AU - Yaoyuan Wang AU - Yao Wang AU - Junsong Wang AU - Tianchi Hu AU - Fengchen He AU - Guipeng Hu AU - Tanzila Rahman AU - Anandharaju Durai Raju PY - 2026 UR - https://arxiv.org/abs/2607.26515 ID - 2607.26515 ER -