@misc{indiciae16798cd22db6, title = {HiFloat4 Format for End-To-End Reinforcement Learning Post-Training of Large Language Models}, author = {Hei Yi Mak and Shadan Golestan and Hoang Le and Mehran Taghian Jazi and Yunke Peng and Yaoyuan Wang and Yao Wang and Junsong Wang and Tianchi Hu and Fengchen He and Guipeng Hu and Tanzila Rahman and Anandharaju Durai Raju}, year = {2026}, url = {https://arxiv.org/abs/2607.26515}, note = {Source identifier: 2607.26515} }