TY - RPRT TI - $\mathbf{(N,K)}$-Puzzle: A Cost-Efficient Testbed for Benchmarking Reinforcement Learning Algorithms in Generative Language Model AU - Yufeng Zhang AU - Liyu Chen AU - Boyi Liu AU - Yingxiang Yang AU - Qiwen Cui AU - Yunzhe Tao AU - Hongxia Yang PY - 2024 UR - https://arxiv.org/abs/2403.07191 ID - 2403.07191 ER -