TY - RPRT TI - ARES: Alternating Reinforcement Learning and Supervised Fine-Tuning for Enhanced Multi-Modal Chain-of-Thought Reasoning Through Diverse AI Feedback AU - Ju-Seung Byun AU - Jiyun Chun AU - Jihyung Kil AU - Andrew Perrault PY - 2024 UR - https://arxiv.org/abs/2407.00087 ID - 2407.00087 ER -