TY - RPRT TI - A Multi-Component Reward Function with Policy Gradient for Automated Feature Selection with Dynamic Regularization and Bias Mitigation AU - Sudip Khadka AU - L. S. Paudel PY - 2025 UR - https://arxiv.org/abs/2510.09705 ID - 2510.09705 ER -