TY - RPRT TI - GDPO: Learning to Directly Align Language Models with Diversity Using GFlowNets AU - Oh Joon Kwon AU - Daiki E. Matsunaga AU - Kee-Eung Kim PY - 2024 UR - https://arxiv.org/abs/2410.15096 ID - 2410.15096 ER -