TY - RPRT TI - MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models AU - Martino M. L. Pulici AU - Cuong Xuan Chu AU - Evgeny Kharlamov AU - Zifeng Ding AU - Volker Tresp AU - Yunpu Ma PY - 2026 UR - https://arxiv.org/abs/2607.18006 ID - 2607.18006 ER -